ShieldGemma
ShieldGemma — набор открытых классификаторов безопасности Google на базе Gemma 2 для проверки пользовательского ввода и ответов ИИ.
ShieldGemma — набор открытых safety-классификаторов Google, впервые опубликованный 31 июля 2024 года. Текстовые варианты построены на Gemma 2 и представлены в размерах 2B, 9B и 27B параметров. Репозитории Google: google/shieldgemma-2b, google/shieldgemma-9b и google/shieldgemma-27b. Модель оценивает входной запрос или сгенерированный ответ относительно заданных правил безопасности; она не является генеративным чат-ботом.
- Какие категории оценивает классификатор
- Политика задаётся разработчиком
- Размещение в контуре безопасности
- Фильтр дополняет, а не заменяет модерацию
- Размеры и специализация
- Подберите вариант по ресурсам и типу фильтрации
- Проверка и ограничения
- Настройте политику на собственном наборе
- Связанные модели и разработчик
- Модели семейства Gemma
- Первичные источники
- Документы, карточки и журнал релизов Google
Какие категории оценивает классификатор
Политика задаётся разработчиком
В анонсе Google названы разжигание ненависти, домогательства, сексуально откровенное и опасное содержание. Модели проверяют запросы пользователей и ответы генеративных моделей; разработчик определяет формулировку политики и способ трактовать оценку классификатора. Результат зависит от содержания правила и порога, который выбирает приложение.
Размещение в контуре безопасности
Фильтр дополняет, а не заменяет модерацию
ShieldGemma можно встроить до генерации, чтобы оценить пользовательский ввод, или после неё — чтобы проверить ответ. Команде необходимо испытать модель на реальных примерах, измерить ложные блокировки и пропуски и предусмотреть ручную обработку спорных случаев. Проверка классификатора не гарантирует, что вся система соблюдает внутренние требования или законодательство.
Размеры и специализация
Подберите вариант по ресурсам и типу фильтрации
Версии 2B, 9B и 27B различаются требованиями к памяти и вычислениям. Google выпустила позднее отдельную ShieldGemma 2 размером 4B для классификации изображений; её возможности описаны на странице ShieldGemma 2. Текстовые и визуальные модели не следует считать взаимозаменяемыми.
Проверка и ограничения
Настройте политику на собственном наборе
Официальная модельная документация и технический отчёт содержат сведения о тестировании и ограничениях. Перед запуском оцените качество на языках, типах запросов и категориях риска, которые относятся к продукту. Не переносите benchmark-результаты Google на иной порог, политику или пользовательскую аудиторию без повторной проверки.
Связанные модели и разработчик
Модели семейства Gemma
ShieldGemma 2 · Gemma · Gemma 2 · FunctionGemma · Google DeepMind в Вики Futuretools
Первичные источники
Документы, карточки и журнал релизов Google
документация ShieldGemma · анонс ShieldGemma · технический отчёт ShieldGemma · официальный журнал выпусков Gemma · https://huggingface.co/google/shieldgemma-2b · https://huggingface.co/google/shieldgemma-9b · https://huggingface.co/google/shieldgemma-27b