HunyuanVideo
HunyuanVideo — открытая модель Tencent для генерации видео по тексту; в официальном репозитории опубликованы код и веса.
HunyuanVideo — открытая модель Tencent для генерации видео по текстовому описанию. Компания опубликовала код инференса и веса 3 декабря 2024 года. Репозиторий описывает модель как видеодиффузионную систему с архитектурой на 13 млрд параметров.
Генерация видео по тексту
От описания сцены к короткому ролику
Модель создаёт видеоряд по текстовому запросу. В официальном примере используется генерация роликов с разрешением до 720p; доступные настройки, длина ролика и нагрузка зависят от конфигурации запуска. HunyuanVideo предназначена для локального инференса, а не является самостоятельным онлайн-редактором.
Архитектура и доступ
Открытые веса для исследовательской и прикладной работы
Tencent описывает HunyuanVideo как трансформер диффузионного типа на 13 млрд параметров. Код, инструкция по загрузке весов и пример запуска опубликованы в репозитории. Для работы требуется совместимое GPU-окружение; точная производительность определяется используемыми весами и аппаратной конфигурацией.
Модели семейства
Отдельные задачи и следующие версии
На основе HunyuanVideo выпущены модель генерации видео из изображения HunyuanVideo-I2V и система с управлением по мультимодальным условиям HunyuanCustom. Более поздняя базовая версия семейства описана на странице HunyuanVideo 1.5.
Дата выпуска и первичный источник
Подтверждённая запись разработчика
Дата — объявленная Tencent публикация кода инференса и весов 03.12.2024; последующие FP8-веса от 18.12.2024 не считаются отдельной моделью. Источник: официальный источник Tencent.
Сведения о разработчике и его моделях: Tencent в Вики Futuretools.ru.