Llama Guard 2

Llama Guard 2 — классификатор безопасности Meta на базе Llama 3 8B, обновлённый по таксономии MLCommons.

Llama Guard 2 — обновлённая модель Meta для проверки текста на входе и выходе генеративных систем. Она была представлена 18 апреля 2024 года вместе с Llama 3. Модель имеет 8 млрд параметров, построена на базе Llama 3 и использует категории риска из таксономии MLCommons.

Какие данные проверяет

Запросы и ответы текстовой модели

Классификатор предназначен для маркировки текста по категориям безопасности до или после его обработки основной моделью. Разработчик может встроить его в собственный фильтр и определить, как реагировать на обнаруженный риск. Llama Guard 2 не проверяет изображение как самостоятельный визуальный классификатор и не заменяет настройку правил для конкретного сервиса.

Изменения второй версии

Основа Llama 3 и общий перечень рисков

По сравнению с первой Llama Guard эта версия перешла на модельную основу Llama 3 и согласовала категории классификации с таксономией MLCommons. Модель выдаёт структурированный результат для входного сообщения или ответа. Конкретные правила применения и уровень строгости остаются на стороне приложения.

Место в семействе

От первой Guard к мультимодальной проверке

Первый классификатор семейства описан на странице Llama Guard. В июле 2024 года Meta представила Guard 3, а в сентябре — её отдельную визуальную версию. Более поздняя Guard 4 принимает изображения и текст. Об истории основного семейства читайте в карточке Llama 3.

Дата выпуска и источник

Что подтверждают материалы разработчика

Meta указала Llama Guard 2 среди защитных моделей, представленных 18.04.2024; официальная модельная карта Meta на Hugging Face идентифицирует её как 8B-модель на базе Llama 3. Первичный источник: официальная публикация или карточка Meta.

Сведения о разработчике и его моделях: Meta в Вики Futuretools.ru.