Prompt Guard
Prompt Guard — небольшая классификационная модель Meta для распознавания обычных запросов, prompt injection и jailbreak-попыток.
Prompt Guard — классификатор Meta для обнаружения prompt injection и попыток обхода защитных инструкций. Модель представлена 23 июля 2024 года вместе с Llama 3.1. Её задача — оценивать входной текст и различать обычные запросы, внедрённые инструкции и jailbreak-попытки; она не отвечает на запрос как универсальная языковая модель.
Что распознаёт модель
Обычный ввод, внедрение инструкций и jailbreak
Prompt Guard анализирует содержимое, которое пользователь или подключённый источник передаёт приложению, и относит его к одной из категорий. Такая проверка может быть полезна при работе с документами, веб-страницами и другими недоверенными данными, способными содержать команды для основной языковой модели. Результат нужно обрабатывать в логике конкретного продукта.
Роль в архитектуре защиты
Фильтр до основной языковой модели
Классификатор используется как один из защитных компонентов: он помогает обнаружить подозрительный ввод до выполнения запроса. Meta рекомендовала адаптировать модель под данные и сценарии конкретного приложения. Сама классификация не гарантирует, что все сложные атаки будут распознаны, и не отменяет проверку выходов основной модели.
Обновлённая версия
Prompt Guard 2
В апреле 2025 года Meta выпустила Prompt Guard 2 в размерах 86M и 22M; компания сообщила об улучшениях распознавания injection и jailbreak. Для проверки небезопасных ответов основной модели предназначена отдельная линейка Llama Guard.
Дата выпуска и источник
Что подтверждают материалы разработчика
Meta датирует анонс Prompt Guard 23.07.2024 и описывает модель как средство защиты от prompt injection; модельная карта Meta указывает классификационный характер системы. Первичный источник: официальная публикация или карточка Meta.
Сведения о разработчике и его моделях: Meta в Вики Futuretools.ru.