Llama Guard 3 11B Vision
Llama Guard 3 11B Vision — модель Meta для классификации рисков в текстовых и графических запросах к мультимодальным ИИ-системам.
Llama Guard 3 11B Vision — мультимодальный классификатор безопасности Meta, выпущенный 25 сентября 2024 года. Он построен на Llama 3.2 Vision 11B и проверяет сочетание текста с изображением во входном запросе, а также текстовый ответ системы. Meta выпустила эту модель для сценариев, в которых одной текстовой фильтрации недостаточно.
Проверка изображений и текста
Классификация мультимодальных сообщений
Модель принимает текст и изображение, определяет, относится ли запрос или ответ к небезопасной категории, и возвращает метку с указанием возможного риска. Это позволяет проверять визуальные материалы до передачи основной модели. Для ответов Guard 3 Vision анализирует текстовую часть; модель не предназначена для отдельной оценки безопасности изображения без связанного запроса.
Архитектура и ограничения
Визуальная основа Llama 3.2 11B
Модель дообучена на базе Llama 3.2 Vision 11B. Её карточка описывает классификацию по таксономии опасностей и предупреждает об ограничениях, связанных с языком, контекстом и устойчивостью к обходным запросам. Проверка человеком и другие меры контроля могут оставаться необходимыми для чувствительных приложений.
Другие версии Guard 3
Текстовые классификаторы 1B и 8B
Для проверки только текста Meta выпустила Llama Guard 3 в размерах 8B и 1B. Все версии решают задачи входной и выходной фильтрации, но визуальная модель имеет отдельную архитектуру и обрабатывает изображение. Предыдущее поколение описано на странице Llama Guard 2.
Дата выпуска и источник
Что подтверждают материалы разработчика
В анонсе Llama 3.2 от 25.09.2024 Meta представила Guard 3 11B Vision; официальная карточка подтверждает базу Llama 3.2-11B, вход изображения и текста и классификацию безопасности. Первичный источник: официальная публикация или карточка Meta.
Сведения о разработчике и его моделях: Meta в Вики Futuretools.ru.