T5Gemma

T5Gemma — открытые модели Google с архитектурой «кодировщик—декодировщик»: варианты на базе Gemma 2 и отдельные размеры Small–XL.

T5Gemma — семейство открытых моделей Google, в котором предварительно обученные decoder-only модели Gemma 2 преобразованы в архитектуру T5 «кодировщик—декодировщик». Google опубликовала его 9 июля 2025 года. В Gemma 2-линейке есть конфигурации 2B–2B, 9B–9B и асимметричная 9B–2B, где первое число относится к кодировщику, а второе — к декодировщику. Также выпущены модели в размерах T5 Small, Base, Large, Medium Large и XL.

Как устроена первая T5Gemma

Адаптация Gemma 2 вместо обучения с нуля

Google инициализировала encoder-decoder модель весами предобученных Gemma 2, а затем продолжила обучение. Такой подход переносит знания исходной модели и сокращает необходимость обучать новую архитектуру с нуля. Конфигурации 2B–2B и 9B–9B симметричны; в варианте 9B–2B части модели имеют разный размер, что позволяет менять баланс обработки входа и генерации.

Варианты обучения и задачи

Генерация и понимание входного текста

Для T5Gemma опубликованы instruction-tuned checkpoints и предварительно обученные версии с PrefixLM или UL2. Google описывает encoder-decoder архитектуру как подходящую для задач, где важно внимательно обработать исходный фрагмент, в том числе суммирования, перевода и ответов на вопросы. Выбор конкретного checkpoint зависит от того, нужна ли готовая обработка инструкций или дальнейшая настройка модели под собственные данные.

Названия опубликованных checkpoints

Размеры и варианты обучения можно сверить по точному ID

Для Gemma 2-конфигураций доступны, например, google/t5gemma-2b-2b-ul2-it, google/t5gemma-9b-9b-ul2-it и google/t5gemma-9b-2b-ul2-it. T5-размеры представлены checkpoint’ами Small (google/t5gemma-s-s-ul2-it), Base (google/t5gemma-b-b-ul2-it), Large (google/t5gemma-l-l-ul2-it), Medium Large (google/t5gemma-ml-ml-ul2-it) и XL (google/t5gemma-xl-xl-ul2-it). Это примеры instruction-tuned UL2 checkpoint’ов, а не полный перечень опубликованных сочетаний PrefixLM, UL2 и дообученных версий.

Что учитывать при выборе размера

Сопоставьте память и характер задачи

Размер 9B–9B требует больше ресурсов, чем 2B–2B; асимметричный вариант нельзя считать просто уменьшенной копией симметричной модели. Сравнивайте скорость, потребление памяти и качество на одинаковом наборе примеров. Если проекту необходимы изображения и длинный контекст, посмотрите отдельно на следующую версию — T5Gemma 2: её возможности нельзя автоматически приписывать первой T5Gemma.

T5Gemma и базовая Gemma решают разные задачи

Архитектура влияет на обработку входа и выход

Обычные Gemma 2 используют decoder-only архитектуру, тогда как T5Gemma имеет отдельные части для кодирования исходного материала и построения ответа. Это даёт другой режим работы, но само по себе не означает, что одна архитектура лучше для любого проекта. Перед переносом действующей системы сравните контрольные примеры, длину входа и фактическую задержку.

Связанные модели и разработчик

Страницы семейства Gemma

Gemma 3 · Gemma 4 · T5Gemma 2 · TranslateGemma · Google DeepMind в Вики Futuretools

Первичные источники

Документация Google и даты выпусков

страница T5Gemma · https://developers.googleblog.com/en/t5gemma/ · официальный журнал выпусков Gemma · checkpoint T5Gemma 2B–2B · checkpoint T5Gemma 9B–9B · checkpoint T5Gemma 9B–2B · checkpoint T5Gemma Small · checkpoint T5Gemma Base · checkpoint T5Gemma Large · checkpoint T5Gemma Medium Large · checkpoint T5Gemma XL