Shieldstral
Shieldstral — открытая модель Mistral AI на 3,8 млрд параметров для адаптивной проверки безопасности текста и изображений.
Shieldstral — компактная мультимодальная модель Mistral AI для проверки безопасности текста и изображений, представленная 4 августа 2026 года. Вместо фиксированного набора категорий разработчик предлагает передавать проверяемое правило обычным языком. Модель возвращает оценку «да» или «нет» с вероятностью и распространяется с открытыми весами под Apache 2.0.
Проверка по задаваемой политике
Правило безопасности можно менять без дообучения
Запрос к Shieldstral состоит из контекста проверки, вопроса о политике и материала для оценки. Это позволяет использовать разные критерии в разных продуктах — например, проверять содержание изображения или пользовательский текст в соответствии с внутренними правилами сервиса. Модель формирует оценку по заданному вопросу; её нельзя считать заменой правовой экспертизы или всех мер защиты продукта.
Текст и изображения
Единый интерфейс для нескольких задач модерации
Mistral описывает сценарии проверки запросов, ответов, пары «запрос–ответ», выявления отказов и мультимодальной безопасности. Размер модели — 3,8 млрд параметров; в анонсе заявлена работа на GPU с 16 ГБ памяти. Результаты и скорость зависят от входа, оборудования и того, насколько точно сформулировано правило.
Связанные модели безопасности
Классификатор рядом с API модерации
Shieldstral опубликована как открытые веса. У Mistral есть и API-модель Mistral Moderation 2, которую компания описывает для фильтрации текстового содержимого и выявления попыток обхода защит. Обзор производителя и его моделей находится на странице Mistral AI в Вики.
Дата выпуска и источники
Что подтверждает разработчик
Первичный анонс от 04.08.2026 указывает размер 3,8B, Apache 2.0, мультимодальные проверки и адаптацию к политике через текстовый запрос. Первичный источник: официальная документация или публикация Mistral AI.