ShieldGemma 2

ShieldGemma 2 — открытый классификатор Google на базе Gemma 3 4B для проверки изображений на сексуальный, опасный и жестокий контент.

ShieldGemma 2 — открытая модель-классификатор Google, представленная 10 марта 2025 года. Она построена на instruction-tuned checkpoint Gemma 3 4B; официальный репозиторий модели обозначен как google/shieldgemma-2-4b. Классификатор оценивает изображения по заданным правилам безопасности. В отличие от генеративного инструмента, её задача — выдать оценку соответствия политике, а не создавать картинку или текст.

Какие категории проверяет модель

Три политики для изображения

В карточке перечислены сексуально откровенный контент, опасное содержание и насилие или чрезмерная жестокость. На вход подаются изображение и текст политики, которая определяет критерий проверки. На выходе модель оценивает токены «Да» и «Нет»: более высокая вероятность «Да» означает, что изображение нарушает переданное правило. Разработчик задаёт собственную политику и порог решения.

Роль в системе модерации

Фильтр до или после генерации изображения

Google описывает использование ShieldGemma 2 как компонента общей системы: например, для проверки пользовательского изображения перед передачей vision-language модели или для отбора результата генерации. Классификатор может помочь построить очередь проверки и пометить потенциально запрещённые материалы, но продукту всё равно нужны журнал решений, процедура разбора спорных случаев и резервный путь для ошибок.

Ограничения классификации

Результат зависит от формулировки правила

Google указывает, что ShieldGemma 2 чувствительна к конкретному описанию политики и может вести себя непредсказуемо при неоднозначных правилах. Официальная карточка также отмечает ограниченный объём доступных оценочных наборов. Поэтому прежде чем использовать классификатор для автоматического блокирования, проверяют точность и пропуски на собственных изображениях, подбирают пороги отдельно по категориям и учитывают последствия ложного срабатывания.

Чем ShieldGemma 2 отличается от ShieldGemma 1

Изображения вместо текстовой модерации

Первая ShieldGemma появилась в 2024 году как модели для модерации текста; её размеры составляют 2B, 9B и 27B. ShieldGemma 2 — отдельный выпуск на 4B, специализированный для проверки изображений. Для текстовых фильтров Google продолжает документировать ShieldGemma 1. Эти страницы различают поколения и модальности, не приписывая версии 2 текстовую специализацию первой линейки.

Связанные модели и разработчик

Страницы семейства Gemma

Gemma 3 · MedGemma · FunctionGemma · Google DeepMind в Вики Futuretools

Первичные источники

Документация Google и даты выпусков

документация ShieldGemma · карточка ShieldGemma 2 · официальный журнал выпусков Gemma