Llama Guard
Llama Guard — модель Meta на базе Llama 2 7B для классификации входных запросов и ответов на предмет рисков безопасности.
Llama Guard — первая открытая модель безопасности Meta для классификации пользовательских запросов и ответов языковых моделей. Её выпуск состоялся 7 декабря 2023 года в рамках инициативы Purple Llama. Модель основана на Llama 2 7B, дообученной классифицировать сообщения по таксономии рисков и выдавать метку безопасного или небезопасного содержания.
Проверка диалога
Классификация и запросов, и ответов
Llama Guard может применяться до передачи пользовательского текста основной модели и после получения её ответа. Модель формирует решение по категориям безопасности; приложение должно самостоятельно определить пороги, обработку результата и действия при срабатывании. Это дополнительный классификатор, а не автономная система модерации и не гарантия отсутствия ошибочных срабатываний.
Основа и настройка
Llama 2 7B с адаптируемой таксономией
В исследовательской публикации Meta описывает Llama Guard как инструкционно дообученную модель Llama 2 7B. Она поддерживает многоклассовую классификацию и может быть настроена под категории конкретного приложения. Компания опубликовала веса и исследовательскую методику; использование регулируется лицензией и правилами семейства Llama.
Обновления защиты
Guard 2, Guard 3 и Guard 4
В апреле 2024 года появилась Llama Guard 2, далее — Llama Guard 3 и мультимодальная Llama Guard 4. Эти версии меняли используемую базовую модель, таксономию и поддерживаемые входные данные. История обычных языковых моделей Meta начинается со страницы Llama 2.
Дата выпуска и источник
Что подтверждают материалы разработчика
Meta объявила Llama Guard 07.12.2023 и описала её как модель для фильтрации входных и выходных сообщений; исследовательская карточка указывает основу Llama 2 7B и доступность весов. Первичный источник: официальная публикация или карточка Meta.
Сведения о разработчике и его моделях: Meta в Вики Futuretools.ru.