Llama Guard 3

Llama Guard 3 — семейство классификаторов Meta для проверки текста: версии 8B и компактная 1B, добавленная с Llama 3.2.

Llama Guard 3 — поколение защитных моделей Meta для выявления небезопасных запросов и ответов. Версия 8B была выпущена 23 июля 2024 года вместе с Llama 3.1; компактная версия 1B появилась 25 сентября вместе с Llama 3.2. Обе используют текстовую классификацию и предназначены для встраивания в защитный слой приложения.

Версии 8B и 1B

Выбор между качеством классификации и ресурсами

Guard 3-8B дообучена на базе Llama 3.1; Guard 3-1B — на базе Llama 3.2 1B. Меньшую модель Meta дополнительно сократила и квантовала, чтобы снизить требования к развёртыванию. Это модели для классификации запросов и ответов, а не генеративные помощники общего назначения.

Риски и языки

Мультиязычная проверка текста

Meta описывает поддержку восьми языков и категорий MLCommons для распространённых типов вредного содержания. Модель возвращает классификационный ответ, который приложение может использовать в своей политике безопасности. Точность зависит от языка, формулировки и характера риска; классификатор не заменяет независимую проверку в чувствительных сценариях.

Визуальный вариант

Отдельная модель Guard 3 Vision

25 сентября Meta выпустила отдельную Llama Guard 3 11B Vision для анализа сочетаний текста и изображений. Она основана на Llama 3.2 Vision и имеет собственную модельную карточку, поэтому вынесена на отдельную страницу. Предыдущая версия — Llama Guard 2; позже семейство продолжила Guard 4.

Дата выпуска и источник

Что подтверждают материалы разработчика

Анонс Llama 3.1 от 23.07.2024 включает Guard 3; 1B-вариант выпущен 25.09.2024 вместе с Llama 3.2. Официальные карточки Meta указывают базы Llama 3.1 8B и Llama 3.2 1B. Первичный источник: официальная публикация или карточка Meta.

Сведения о разработчике и его моделях: Meta в Вики Futuretools.ru.