T5Gemma
T5Gemma — открытые модели Google с архитектурой «кодировщик—декодировщик»: варианты на базе Gemma 2 и отдельные размеры Small–XL.
T5Gemma — семейство открытых моделей Google, в котором предварительно обученные decoder-only модели Gemma 2 преобразованы в архитектуру T5 «кодировщик—декодировщик». Google опубликовала его 9 июля 2025 года. В Gemma 2-линейке есть конфигурации 2B–2B, 9B–9B и асимметричная 9B–2B, где первое число относится к кодировщику, а второе — к декодировщику. Также выпущены модели в размерах T5 Small, Base, Large, Medium Large и XL.
- Как устроена первая T5Gemma
- Адаптация Gemma 2 вместо обучения с нуля
- Варианты обучения и задачи
- Генерация и понимание входного текста
- Названия опубликованных checkpoints
- Размеры и варианты обучения можно сверить по точному ID
- Что учитывать при выборе размера
- Сопоставьте память и характер задачи
- T5Gemma и базовая Gemma решают разные задачи
- Архитектура влияет на обработку входа и выход
- Связанные модели и разработчик
- Страницы семейства Gemma
- Первичные источники
- Документация Google и даты выпусков
Как устроена первая T5Gemma
Адаптация Gemma 2 вместо обучения с нуля
Google инициализировала encoder-decoder модель весами предобученных Gemma 2, а затем продолжила обучение. Такой подход переносит знания исходной модели и сокращает необходимость обучать новую архитектуру с нуля. Конфигурации 2B–2B и 9B–9B симметричны; в варианте 9B–2B части модели имеют разный размер, что позволяет менять баланс обработки входа и генерации.
Варианты обучения и задачи
Генерация и понимание входного текста
Для T5Gemma опубликованы instruction-tuned checkpoints и предварительно обученные версии с PrefixLM или UL2. Google описывает encoder-decoder архитектуру как подходящую для задач, где важно внимательно обработать исходный фрагмент, в том числе суммирования, перевода и ответов на вопросы. Выбор конкретного checkpoint зависит от того, нужна ли готовая обработка инструкций или дальнейшая настройка модели под собственные данные.
Названия опубликованных checkpoints
Размеры и варианты обучения можно сверить по точному ID
Для Gemma 2-конфигураций доступны, например, google/t5gemma-2b-2b-ul2-it, google/t5gemma-9b-9b-ul2-it и google/t5gemma-9b-2b-ul2-it. T5-размеры представлены checkpoint’ами Small (google/t5gemma-s-s-ul2-it), Base (google/t5gemma-b-b-ul2-it), Large (google/t5gemma-l-l-ul2-it), Medium Large (google/t5gemma-ml-ml-ul2-it) и XL (google/t5gemma-xl-xl-ul2-it). Это примеры instruction-tuned UL2 checkpoint’ов, а не полный перечень опубликованных сочетаний PrefixLM, UL2 и дообученных версий.
Что учитывать при выборе размера
Сопоставьте память и характер задачи
Размер 9B–9B требует больше ресурсов, чем 2B–2B; асимметричный вариант нельзя считать просто уменьшенной копией симметричной модели. Сравнивайте скорость, потребление памяти и качество на одинаковом наборе примеров. Если проекту необходимы изображения и длинный контекст, посмотрите отдельно на следующую версию — T5Gemma 2: её возможности нельзя автоматически приписывать первой T5Gemma.
T5Gemma и базовая Gemma решают разные задачи
Архитектура влияет на обработку входа и выход
Обычные Gemma 2 используют decoder-only архитектуру, тогда как T5Gemma имеет отдельные части для кодирования исходного материала и построения ответа. Это даёт другой режим работы, но само по себе не означает, что одна архитектура лучше для любого проекта. Перед переносом действующей системы сравните контрольные примеры, длину входа и фактическую задержку.
Связанные модели и разработчик
Страницы семейства Gemma
Gemma 3 · Gemma 4 · T5Gemma 2 · TranslateGemma · Google DeepMind в Вики Futuretools
Первичные источники
Документация Google и даты выпусков
страница T5Gemma · https://developers.googleblog.com/en/t5gemma/ · официальный журнал выпусков Gemma · checkpoint T5Gemma 2B–2B · checkpoint T5Gemma 9B–9B · checkpoint T5Gemma 9B–2B · checkpoint T5Gemma Small · checkpoint T5Gemma Base · checkpoint T5Gemma Large · checkpoint T5Gemma Medium Large · checkpoint T5Gemma XL