Llama Prompt Guard 2

Llama Prompt Guard 2 — обновлённая линейка Meta для распознавания внедрённых инструкций и обхода защит, в вариантах 22M и 86M.

Llama Prompt Guard 2 — обновлённое поколение небольших классификаторов Meta для защиты языковых приложений от prompt injection и jailbreak-попыток. Модели представлены 29 апреля 2025 года в размерах 22M и 86M параметров. Meta сообщает, что уменьшенный вариант быстрее и требует меньше вычислений, а большая версия улучшает распознавание атак по сравнению с исходной Prompt Guard.

Две версии по размеру

22M и 86M параметров

Prompt Guard 2 22M рассчитана на меньшие задержки и ограниченный вычислительный бюджет; модель 86M сохраняет больший размер и предназначена для ситуаций, где важнее качество распознавания. Обе выполняют классификацию входных сообщений и не заменяют основную языковую модель.

Защита от внедрённых команд

Проверка недоверенного ввода

Классификатор помогает находить команды, которые пытаются переопределить системные инструкции или заставить приложение выполнять нежелательные действия. Его можно включить в обработку текста из запросов, документов и других внешних источников. Итоговое решение — отклонить ввод, ограничить его или отправить на дополнительную проверку — принимает приложение.

Первая Prompt Guard

Обновление модели 2024 года

Предыдущая версия Prompt Guard была представлена в июле 2024 года. В 2025 году Meta обновила её в нескольких размерах; отдельная Llama Guard 4 решает соседнюю задачу — модерацию текстового и визуального содержимого, а не классификацию внедрённых инструкций.

Дата выпуска и источник

Что подтверждают материалы разработчика

Meta датирует выпуск 29.04.2025 и называет два размера Prompt Guard 2 — 86M и 22M; компания заявляет улучшение распознавания атак и снижение задержки у малой модели. Первичный источник: официальная публикация или карточка Meta.

Сведения о разработчике и его моделях: Meta в Вики Futuretools.ru.