T5Gemma 2
T5Gemma 2 — мультимодальные encoder-decoder модели Google на базе Gemma 3 с изображениями, контекстом до 128 тысяч токенов и размерами 270M–4B.
T5Gemma 2 — второе поколение открытого семейства Google с архитектурой «кодировщик—декодировщик». Оно вышло 18 декабря 2025 года на базе Gemma 3 в размерах 270M–270M, 1B–1B и 4B–4B. Модели поддерживают текст и изображения, контекст до 128 тысяч токенов и более 140 языков. В отличие от T5Gemma на базе Gemma 2, вторая версия получила мультимодальную обработку и изменения архитектуры для экономии параметров. Опубликованные предварительно обученные checkpoints: google/t5gemma-2-270m-270m, google/t5gemma-2-1b-1b и google/t5gemma-2-4b-4b.
- Мультимодальная обработка с длинным контекстом
- Изображение и текст на входе
- Размеры и архитектурные изменения
- 270M, 1B и 4B в двухчастной конфигурации
- Предварительное обучение и дальнейшая настройка
- Доступный checkpoint — исходная основа
- Когда сравнивать с первой T5Gemma
- Два поколения имеют разные входы и базовые модели
- Связанные модели и разработчик
- Страницы семейства Gemma
- Первичные источники
- Документация Google и даты выпусков
Мультимодальная обработка с длинным контекстом
Изображение и текст на входе
T5Gemma 2 использует vision encoder и архитектуру Gemma 3 для обработки изображений вместе с текстом. Google указывает контекст до 128 тысяч токенов и поддержку более 140 языков. Это даёт разработчику возможность исследовать задачи, в которых нужно обрабатывать длинный текстовый материал или сочетать текстовый запрос с изображением. При работе с документами следует отдельно проверять, как подготовка изображения и его разрешение влияют на извлечение сведений.
Размеры и архитектурные изменения
270M, 1B и 4B в двухчастной конфигурации
Опубликованы варианты 270M–270M, 1B–1B и 4B–4B; Google приводит ориентировочные общие размеры около 370M, 1,7B и 7B параметров без учёта vision encoder. В модели связаны embeddings кодировщика и декодировщика, а self-attention и cross-attention декодера объединены. Эти изменения уменьшают общий размер параметров относительно независимых таблиц и механизмов, сохраняя отдельный encoder для входного контекста.
Предварительное обучение и дальнейшая настройка
Доступный checkpoint — исходная основа
Google выпустила предварительно обученные checkpoints, рассчитанные на последующее обучение под конкретную задачу. Графики пост-обучения в анонсе иллюстрируют результаты минимальной supervised fine-tuning без reinforcement learning; Google отдельно отмечает, что это не опубликованные instruction-tuned checkpoints и что эти замеры нельзя напрямую смешивать с предобученными оценками. Перед использованием в приложении нужно определить собственную процедуру дообучения и оценить её на целевых данных.
Когда сравнивать с первой T5Gemma
Два поколения имеют разные входы и базовые модели
T5Gemma 2 построена на Gemma 3 и умеет обрабатывать изображения, тогда как первая T5Gemma адаптировала Gemma 2 и описана в Google как текстовое encoder-decoder семейство. Для сравнения зафиксируйте одну и ту же задачу, одинаковые данные и вычислительные условия. Официальная страница Google объединяет модели в одной линейке, но release log указывает отдельные даты этих поколений.
Связанные модели и разработчик
Страницы семейства Gemma
T5Gemma · Gemma 3 · Gemma 4 · EmbeddingGemma · Google DeepMind в Вики Futuretools
Первичные источники
Документация Google и даты выпусков
страница T5Gemma · анонс T5Gemma 2 · официальный журнал выпусков Gemma · checkpoint T5Gemma 2 270M–270M · checkpoint T5Gemma 2 1B–1B · checkpoint T5Gemma 2 4B–4B