DiffusionGemma

DiffusionGemma — экспериментальная открытая модель Google, которая генерирует текст блоками, последовательно уточняя их методом дискретной диффузии.

DiffusionGemma — экспериментальная открытая модель Google для изучения диффузионной генерации текста. Вместо последовательного вывода по одному токену она строит и уточняет блоки текста параллельно. Google опубликовала веса 10 июня 2026 года под лицензией Apache 2.0 и позиционирует модель для локальных интерактивных задач, а не как замену Gemma 4 в производственных системах с высоким качеством ответа.

Как работает генерация

Полотно из 256 токенов уточняется за несколько проходов

DiffusionGemma начинает с блока случайных или маскированных токенов — «полотна» длиной 256 токенов. На каждом проходе модель оценивает весь блок и уточняет его содержимое, учитывая контекст соседних слов; ранее сгенерированные фрагменты можно пересмотреть до завершения блока. После стабилизации полотно добавляется к контексту, и модель переходит к следующему. Подход сочетает диффузионное уточнение и последовательное построение более длинного текста.

Размер и мультимодальный ввод

Основа Gemma 4 26B A4B

Модель построена на архитектуре Gemma 4 26B A4B: около 25,2 млрд параметров суммарно, из которых во время работы активны примерно 3,8 млрд. Документация модели указывает контекст до 256 тысяч токенов и входные данные текста и изображений; материалы Google DeepMind также описывают мультимодальный ввод видео в используемом сценарии. Идентификатор открытой контрольной точки — google/diffusiongemma-26B-A4B-it.

Скорость и область применения

Сильнее всего преимущество заметно при локальном запуске

Google заявляет ускорение до четырёх раз в собственных тестах: более 1 000 токенов в секунду на NVIDIA H100 и более 700 токенов в секунду на GeForce RTX 5090. Эти цифры зависят от оборудования, программного стека, настроек и качества вывода. Параллельное декодирование может быть полезно при локальном редактировании текста, заполнении кода и быстрой итерации; при большом числе одновременных облачных запросов традиционная авторегрессия может использовать вычислители эффективнее.

Экспериментальный статус и компромиссы

Скорость не означает превосходство по качеству

Google прямо предупреждает, что качество текста у экспериментальной DiffusionGemma ниже, чем у стандартной Gemma 4. Поэтому модель интересна для исследований, прототипов и задач, где важна интерактивная локальная генерация; если приоритет — качество итогового ответа, Google рекомендует обычную Gemma 4. Веса распространяются по Apache 2.0; перед коммерческим использованием всё равно проверьте условия лицензии и выбранных библиотек запуска.

Связанные модели и разработчик

Страницы каталога и Вики

Gemma 4 · Gemini 3 8 Flash · Google DeepMind в Вики Futuretools

Первичные источники

Документация, карточка модели и анонс

В каталог внесена дата официального выпуска или объявления. Если дата анонса отличается от даты выхода в модельном справочнике, различие указано в тексте. Анонс Google от 10 июня 2026 года · Обзор модели DiffusionGemma · Карточка модели и лицензия · Руководство по принципу текстовой диффузии