Mistral Moderation
Mistral Moderation — модель-классификатор для выявления нежелательного текста и сообщений в контексте диалога.
Mistral Moderation — языковой классификатор для проверки текстового содержимого, добавленный в API Mistral в ноябре 2024 года. Официальная карточка конкретной модели указывает дату 6 ноября, контекст 8 тысяч токенов и endpoint moderations. Публикация блога Mistral вышла 7 ноября и описывает девять категорий политик и обработку сообщений с учётом контекста разговора.
Проверка текста
Категории политик и последнее сообщение диалога
API принимает отдельный текст либо содержание беседы и возвращает классификацию по правилам модерации. Mistral объясняла, что разговорный endpoint учитывает контекст и оценивает последнее сообщение, а набор политик включает разные типы потенциально вредного текста. Разработчик интеграции сам выбирает, как интерпретировать результат и какие действия выполнять.
Мультиязычность и границы применения
Классификатор — один слой системы безопасности
В публикации компания перечисляла обучение на английском, русском, французском, немецком, испанском, итальянском, португальском, арабском, китайском, японском и корейском языках. Результаты внутренней оценки были опубликованы Mistral. Классификатор не заменяет проверку человеком, отраслевые правила или другие механизмы защиты.
Обновление модерации
Mistral Moderation 2
Версия 2 описана на странице Mistral Moderation 2 и предназначена для новых интеграций. Карточка первой модели отмечает её deprecated с 31 марта 2026 года. Обзор разработчика и связанных моделей доступен в Вики Mistral AI.
Дата выпуска и источник
Что подтверждают материалы разработчика
Карточка модели датирует выпуск 06.11.2024 и указывает 8K и moderation endpoint; публикация блога от 07.11 описывает 9 категорий и контекстную проверку. Замена — Moderation 2. Первичный источник: официальная публикация или карточка Mistral AI.