HunyuanVideo

HunyuanVideo — открытая модель Tencent для генерации видео по тексту; в официальном репозитории опубликованы код и веса.

HunyuanVideo — открытая модель Tencent для генерации видео по текстовому описанию. Компания опубликовала код инференса и веса 3 декабря 2024 года. Репозиторий описывает модель как видеодиффузионную систему с архитектурой на 13 млрд параметров.

Генерация видео по тексту

От описания сцены к короткому ролику

Модель создаёт видеоряд по текстовому запросу. В официальном примере используется генерация роликов с разрешением до 720p; доступные настройки, длина ролика и нагрузка зависят от конфигурации запуска. HunyuanVideo предназначена для локального инференса, а не является самостоятельным онлайн-редактором.

Архитектура и доступ

Открытые веса для исследовательской и прикладной работы

Tencent описывает HunyuanVideo как трансформер диффузионного типа на 13 млрд параметров. Код, инструкция по загрузке весов и пример запуска опубликованы в репозитории. Для работы требуется совместимое GPU-окружение; точная производительность определяется используемыми весами и аппаратной конфигурацией.

Модели семейства

Отдельные задачи и следующие версии

На основе HunyuanVideo выпущены модель генерации видео из изображения HunyuanVideo-I2V и система с управлением по мультимодальным условиям HunyuanCustom. Более поздняя базовая версия семейства описана на странице HunyuanVideo 1.5.

Дата выпуска и первичный источник

Подтверждённая запись разработчика

Дата — объявленная Tencent публикация кода инференса и весов 03.12.2024; последующие FP8-веса от 18.12.2024 не считаются отдельной моделью. Источник: официальный источник Tencent.

Сведения о разработчике и его моделях: Tencent в Вики Futuretools.ru.