Shieldstral

Shieldstral — открытая модель Mistral AI на 3,8 млрд параметров для адаптивной проверки безопасности текста и изображений.

Shieldstral — компактная мультимодальная модель Mistral AI для проверки безопасности текста и изображений, представленная 4 августа 2026 года. Вместо фиксированного набора категорий разработчик предлагает передавать проверяемое правило обычным языком. Модель возвращает оценку «да» или «нет» с вероятностью и распространяется с открытыми весами под Apache 2.0.

Проверка по задаваемой политике

Правило безопасности можно менять без дообучения

Запрос к Shieldstral состоит из контекста проверки, вопроса о политике и материала для оценки. Это позволяет использовать разные критерии в разных продуктах — например, проверять содержание изображения или пользовательский текст в соответствии с внутренними правилами сервиса. Модель формирует оценку по заданному вопросу; её нельзя считать заменой правовой экспертизы или всех мер защиты продукта.

Текст и изображения

Единый интерфейс для нескольких задач модерации

Mistral описывает сценарии проверки запросов, ответов, пары «запрос–ответ», выявления отказов и мультимодальной безопасности. Размер модели — 3,8 млрд параметров; в анонсе заявлена работа на GPU с 16 ГБ памяти. Результаты и скорость зависят от входа, оборудования и того, насколько точно сформулировано правило.

Связанные модели безопасности

Классификатор рядом с API модерации

Shieldstral опубликована как открытые веса. У Mistral есть и API-модель Mistral Moderation 2, которую компания описывает для фильтрации текстового содержимого и выявления попыток обхода защит. Обзор производителя и его моделей находится на странице Mistral AI в Вики.

Дата выпуска и источники

Что подтверждает разработчик

Первичный анонс от 04.08.2026 указывает размер 3,8B, Apache 2.0, мультимодальные проверки и адаптацию к политике через текстовый запрос. Первичный источник: официальная документация или публикация Mistral AI.