ShieldGemma 2
ShieldGemma 2 — открытый классификатор Google на базе Gemma 3 4B для проверки изображений на сексуальный, опасный и жестокий контент.
ShieldGemma 2 — открытая модель-классификатор Google, представленная 10 марта 2025 года. Она построена на instruction-tuned checkpoint Gemma 3 4B; официальный репозиторий модели обозначен как google/shieldgemma-2-4b. Классификатор оценивает изображения по заданным правилам безопасности. В отличие от генеративного инструмента, её задача — выдать оценку соответствия политике, а не создавать картинку или текст.
- Какие категории проверяет модель
- Три политики для изображения
- Роль в системе модерации
- Фильтр до или после генерации изображения
- Ограничения классификации
- Результат зависит от формулировки правила
- Чем ShieldGemma 2 отличается от ShieldGemma 1
- Изображения вместо текстовой модерации
- Связанные модели и разработчик
- Страницы семейства Gemma
- Первичные источники
- Документация Google и даты выпусков
Какие категории проверяет модель
Три политики для изображения
В карточке перечислены сексуально откровенный контент, опасное содержание и насилие или чрезмерная жестокость. На вход подаются изображение и текст политики, которая определяет критерий проверки. На выходе модель оценивает токены «Да» и «Нет»: более высокая вероятность «Да» означает, что изображение нарушает переданное правило. Разработчик задаёт собственную политику и порог решения.
Роль в системе модерации
Фильтр до или после генерации изображения
Google описывает использование ShieldGemma 2 как компонента общей системы: например, для проверки пользовательского изображения перед передачей vision-language модели или для отбора результата генерации. Классификатор может помочь построить очередь проверки и пометить потенциально запрещённые материалы, но продукту всё равно нужны журнал решений, процедура разбора спорных случаев и резервный путь для ошибок.
Ограничения классификации
Результат зависит от формулировки правила
Google указывает, что ShieldGemma 2 чувствительна к конкретному описанию политики и может вести себя непредсказуемо при неоднозначных правилах. Официальная карточка также отмечает ограниченный объём доступных оценочных наборов. Поэтому прежде чем использовать классификатор для автоматического блокирования, проверяют точность и пропуски на собственных изображениях, подбирают пороги отдельно по категориям и учитывают последствия ложного срабатывания.
Чем ShieldGemma 2 отличается от ShieldGemma 1
Изображения вместо текстовой модерации
Первая ShieldGemma появилась в 2024 году как модели для модерации текста; её размеры составляют 2B, 9B и 27B. ShieldGemma 2 — отдельный выпуск на 4B, специализированный для проверки изображений. Для текстовых фильтров Google продолжает документировать ShieldGemma 1. Эти страницы различают поколения и модальности, не приписывая версии 2 текстовую специализацию первой линейки.
Связанные модели и разработчик
Страницы семейства Gemma
Gemma 3 · MedGemma · FunctionGemma · Google DeepMind в Вики Futuretools
Первичные источники
Документация Google и даты выпусков
документация ShieldGemma · карточка ShieldGemma 2 · официальный журнал выпусков Gemma