Llama Guard 2
Llama Guard 2 — классификатор безопасности Meta на базе Llama 3 8B, обновлённый по таксономии MLCommons.
Llama Guard 2 — обновлённая модель Meta для проверки текста на входе и выходе генеративных систем. Она была представлена 18 апреля 2024 года вместе с Llama 3. Модель имеет 8 млрд параметров, построена на базе Llama 3 и использует категории риска из таксономии MLCommons.
Какие данные проверяет
Запросы и ответы текстовой модели
Классификатор предназначен для маркировки текста по категориям безопасности до или после его обработки основной моделью. Разработчик может встроить его в собственный фильтр и определить, как реагировать на обнаруженный риск. Llama Guard 2 не проверяет изображение как самостоятельный визуальный классификатор и не заменяет настройку правил для конкретного сервиса.
Изменения второй версии
Основа Llama 3 и общий перечень рисков
По сравнению с первой Llama Guard эта версия перешла на модельную основу Llama 3 и согласовала категории классификации с таксономией MLCommons. Модель выдаёт структурированный результат для входного сообщения или ответа. Конкретные правила применения и уровень строгости остаются на стороне приложения.
Место в семействе
От первой Guard к мультимодальной проверке
Первый классификатор семейства описан на странице Llama Guard. В июле 2024 года Meta представила Guard 3, а в сентябре — её отдельную визуальную версию. Более поздняя Guard 4 принимает изображения и текст. Об истории основного семейства читайте в карточке Llama 3.
Дата выпуска и источник
Что подтверждают материалы разработчика
Meta указала Llama Guard 2 среди защитных моделей, представленных 18.04.2024; официальная модельная карта Meta на Hugging Face идентифицирует её как 8B-модель на базе Llama 3. Первичный источник: официальная публикация или карточка Meta.
Сведения о разработчике и его моделях: Meta в Вики Futuretools.ru.