PaliGemma 2
PaliGemma 2 — открытая vision-language модель Google на базе Gemma 2: размеры 3B, 10B и 28B, тексто-визуальный ввод и настройка под задачи.
PaliGemma 2 — второе поколение открытых vision-language моделей Google, выпущенное 5 декабря 2024 года. Семейство включает размеры 3B, 10B и 28B на базе Gemma 2; изображения обрабатывает кодировщик SigLIP, текст — языковая часть модели. На вход подаются изображение и запрос, на выходе можно получить текст, подпись, ответ, координаты объектов или кодовые слова сегментации. Примеры официальных pretrained checkpoint: google/paligemma2-3b-pt-224, google/paligemma2-10b-pt-224 и google/paligemma2-28b-pt-224.
- Три размера и несколько разрешений
- От 3B до 28B параметров
- Задачи обработки изображений
- Вопросы, распознавание текста и сегментация
- Pretrained и Mix — разные варианты
- Смесь задач вынесена на отдельную страницу
- Ограничения vision-language модели
- Результат проверяют на предметных данных
- Связанные модели и разработчик
- Модели семейства Gemma
- Первичные источники
- Документы, карточки и журнал релизов Google
Три размера и несколько разрешений
От 3B до 28B параметров
Google сопоставляет размеры 3B, 10B и 28B моделям Gemma 2 2B, 9B и 27B соответственно. Для визуального входа опубликованы конфигурации с разрешениями 224, 448 и 896 пикселей. Более крупный размер и высокое разрешение потребуют больше ресурсов; модель следует выбрать по целевой задаче и аппаратной среде, а не только по числу параметров.
Задачи обработки изображений
Вопросы, распознавание текста и сегментация
PaliGemma 2 поддерживает описание изображений и коротких видео, визуальные вопросы, чтение текста, обнаружение и сегментацию объектов. Модель генерирует текстовые представления и структурированные выходы, когда формат предусмотрен задачей. Для точного извлечения текста, координат и классов необходимо дообучение и проверка на целевых изображениях.
Pretrained и Mix — разные варианты
Смесь задач вынесена на отдельную страницу
Pretrained-модели предназначены для дообучения под конкретный набор задач. Отдельная версия PaliGemma 2 Mix вышла 19 февраля 2025 года и училась на смеси задач; это другой checkpoint-релиз, а не ещё одно название базовых весов. Google предупреждает, что модели нужно адаптировать и тестировать перед использованием для конечных пользователей.
Ограничения vision-language модели
Результат проверяют на предметных данных
Модель может ошибаться в распознавании мелких объектов, надписей и пространственных отношений. Результаты опубликованных тестов относятся к конкретным наборам и версиям модели; они не подтверждают точность для любого отраслевого изображения. Сравните размеры и разрешения на одинаковом наборе примеров, отдельно оценивая ложные обнаружения и пропуски. Для варианта Mix см. PaliGemma 2 Mix.
Связанные модели и разработчик
Модели семейства Gemma
PaliGemma · PaliGemma 2 Mix · Gemma 3 · Gemma 4 · Google DeepMind в Вики Futuretools
Первичные источники
Документы, карточки и журнал релизов Google
документация PaliGemma · карточка PaliGemma 2 · официальный журнал выпусков Gemma · https://huggingface.co/google/paligemma2-3b-pt-224 · https://huggingface.co/google/paligemma2-10b-pt-224 · https://huggingface.co/google/paligemma2-28b-pt-224