HunyuanImage 3.0
HunyuanImage 3.0 — открытая модель Tencent для создания изображений по тексту с мультимодальным пониманием контекста.
HunyuanImage 3.0 — открытая модель Tencent для генерации изображений по текстовому описанию. Код вывода и веса опубликованы 28 сентября 2025 года. В отличие от схемы, где генерация и понимание изображения полностью разделены, модель использует единый мультимодальный авторегрессионный подход.
Как устроена модель
Мультимодальная MoE-архитектура
По карточке Tencent, семейство насчитывает 80 млрд параметров, из которых активируются 13 млрд; архитектура включает 64 эксперта. Модель способна учитывать текстовые инструкции и визуальный контекст, а также опираться на знания о мире при построении изображения.
Создание изображений
Текстовые запросы и сложная композиция
Базовый вариант предназначен для генерации изображения по тексту. Tencent отмечает следование сложным инструкциям, композицию и прорисовку деталей. Для сценариев редактирования и более развитой работы с инструкциями опубликованы отдельные варианты HunyuanImage 3.0 Instruct и Instruct Distil.
Открытая публикация
Код и веса Tencent
Модель доступна в репозитории Tencent и на Hugging Face. В официальном описании для запуска указаны существенные требования к вычислительным ресурсам; фактическая конфигурация зависит от веса и используемого программного стека. Не смешивайте базовую text-to-image-модель с последующими вариантами Instruct.
Дата, версия и источники
Проверка по материалам Tencent
Дата публикации карточки отражает указанное событие публичного выпуска или доступности версии. Примечание по датировке: Официальный журнал датирует публикацию кода и весов 28.09.2025. Источники: официальный репозиторий HunyuanImage 3.0; карточку базовой модели.
Сведения о разработчике и его моделях: Tencent в Вики Futuretools.ru.