HunyuanImage 3.0

HunyuanImage 3.0 — открытая модель Tencent для создания изображений по тексту с мультимодальным пониманием контекста.

HunyuanImage 3.0 — открытая модель Tencent для генерации изображений по текстовому описанию. Код вывода и веса опубликованы 28 сентября 2025 года. В отличие от схемы, где генерация и понимание изображения полностью разделены, модель использует единый мультимодальный авторегрессионный подход.

Как устроена модель

Мультимодальная MoE-архитектура

По карточке Tencent, семейство насчитывает 80 млрд параметров, из которых активируются 13 млрд; архитектура включает 64 эксперта. Модель способна учитывать текстовые инструкции и визуальный контекст, а также опираться на знания о мире при построении изображения.

Создание изображений

Текстовые запросы и сложная композиция

Базовый вариант предназначен для генерации изображения по тексту. Tencent отмечает следование сложным инструкциям, композицию и прорисовку деталей. Для сценариев редактирования и более развитой работы с инструкциями опубликованы отдельные варианты HunyuanImage 3.0 Instruct и Instruct Distil.

Открытая публикация

Код и веса Tencent

Модель доступна в репозитории Tencent и на Hugging Face. В официальном описании для запуска указаны существенные требования к вычислительным ресурсам; фактическая конфигурация зависит от веса и используемого программного стека. Не смешивайте базовую text-to-image-модель с последующими вариантами Instruct.

Дата, версия и источники

Проверка по материалам Tencent

Дата публикации карточки отражает указанное событие публичного выпуска или доступности версии. Примечание по датировке: Официальный журнал датирует публикацию кода и весов 28.09.2025. Источники: официальный репозиторий HunyuanImage 3.0; карточку базовой модели.

Сведения о разработчике и его моделях: Tencent в Вики Futuretools.ru.