Prompt Guard

Prompt Guard — небольшая классификационная модель Meta для распознавания обычных запросов, prompt injection и jailbreak-попыток.

Prompt Guard — классификатор Meta для обнаружения prompt injection и попыток обхода защитных инструкций. Модель представлена 23 июля 2024 года вместе с Llama 3.1. Её задача — оценивать входной текст и различать обычные запросы, внедрённые инструкции и jailbreak-попытки; она не отвечает на запрос как универсальная языковая модель.

Что распознаёт модель

Обычный ввод, внедрение инструкций и jailbreak

Prompt Guard анализирует содержимое, которое пользователь или подключённый источник передаёт приложению, и относит его к одной из категорий. Такая проверка может быть полезна при работе с документами, веб-страницами и другими недоверенными данными, способными содержать команды для основной языковой модели. Результат нужно обрабатывать в логике конкретного продукта.

Роль в архитектуре защиты

Фильтр до основной языковой модели

Классификатор используется как один из защитных компонентов: он помогает обнаружить подозрительный ввод до выполнения запроса. Meta рекомендовала адаптировать модель под данные и сценарии конкретного приложения. Сама классификация не гарантирует, что все сложные атаки будут распознаны, и не отменяет проверку выходов основной модели.

Обновлённая версия

Prompt Guard 2

В апреле 2025 года Meta выпустила Prompt Guard 2 в размерах 86M и 22M; компания сообщила об улучшениях распознавания injection и jailbreak. Для проверки небезопасных ответов основной модели предназначена отдельная линейка Llama Guard.

Дата выпуска и источник

Что подтверждают материалы разработчика

Meta датирует анонс Prompt Guard 23.07.2024 и описывает модель как средство защиты от prompt injection; модельная карта Meta указывает классификационный характер системы. Первичный источник: официальная публикация или карточка Meta.

Сведения о разработчике и его моделях: Meta в Вики Futuretools.ru.