Mistral Moderation

Mistral Moderation — модель-классификатор для выявления нежелательного текста и сообщений в контексте диалога.

Mistral Moderation — языковой классификатор для проверки текстового содержимого, добавленный в API Mistral в ноябре 2024 года. Официальная карточка конкретной модели указывает дату 6 ноября, контекст 8 тысяч токенов и endpoint moderations. Публикация блога Mistral вышла 7 ноября и описывает девять категорий политик и обработку сообщений с учётом контекста разговора.

Проверка текста

Категории политик и последнее сообщение диалога

API принимает отдельный текст либо содержание беседы и возвращает классификацию по правилам модерации. Mistral объясняла, что разговорный endpoint учитывает контекст и оценивает последнее сообщение, а набор политик включает разные типы потенциально вредного текста. Разработчик интеграции сам выбирает, как интерпретировать результат и какие действия выполнять.

Мультиязычность и границы применения

Классификатор — один слой системы безопасности

В публикации компания перечисляла обучение на английском, русском, французском, немецком, испанском, итальянском, португальском, арабском, китайском, японском и корейском языках. Результаты внутренней оценки были опубликованы Mistral. Классификатор не заменяет проверку человеком, отраслевые правила или другие механизмы защиты.

Обновление модерации

Mistral Moderation 2

Версия 2 описана на странице Mistral Moderation 2 и предназначена для новых интеграций. Карточка первой модели отмечает её deprecated с 31 марта 2026 года. Обзор разработчика и связанных моделей доступен в Вики Mistral AI.

Дата выпуска и источник

Что подтверждают материалы разработчика

Карточка модели датирует выпуск 06.11.2024 и указывает 8K и moderation endpoint; публикация блога от 07.11 описывает 9 категорий и контекстную проверку. Замена — Moderation 2. Первичный источник: официальная публикация или карточка Mistral AI.