Mistral Moderation 2
Mistral Moderation 2 — модель для выявления небезопасного текста и попыток обхода защит; документация указывает контекст 128 тысяч токенов.
Mistral Moderation 2 — модель для автоматической проверки текстового содержимого, доступная с 1 марта 2026 года. В документации Mistral указаны контекст до 128 тысяч токенов и выявление попыток обхода защит. Модель предназначена для вызова через интерфейс модерации, а не как универсальный чат-бот.
Проверка содержимого
Модерация текста и длинных диалогов
Сервис анализирует переданный текст на соответствие категориям безопасности, которые поддерживает API. Увеличенное контекстное окно полезно, когда для оценки требуется учитывать длинный материал или несколько реплик. Наличие оценки модели не заменяет правила продукта, проверку пограничных случаев и процедуру обработки ошибочной классификации.
Обход защит
Дополнительный сигнал для систем безопасности
В описании модели разработчик отдельно выделяет обнаружение jailbreak-попыток — запросов, которые стремятся обойти заданные ограничения. Такой результат можно использовать как один из сигналов защитного контура. Конкретная интеграция должна учитывать, что классификатор может ошибаться, а политика модерации должна соответствовать назначению сервиса.
Модель и открытые веса
Сопоставление с Shieldstral
Moderation 2 доступна как API-сервис. Для более настраиваемой проверки текста и изображений Mistral также выпустила открытые веса Shieldstral, где правило проверки задаётся текстовым вопросом. Сведения о моделях и документации собраны на странице Mistral AI в Вики.
Дата выпуска и источники
Что подтверждает разработчик
Официальная документация Mistral датирует модель 01.03.2026 и указывает 128K контекста и jailbreak detection. Первичный источник: официальная документация или публикация Mistral AI.
Предыдущая модель в этой линейке — Mistral Moderation.