NVIDIA UALM-Gen

UALM-Gen преобразует текстовый запрос в аудио, предсказывая аудиотокены непосредственно языковой моделью.

UALM-Gen — исследовательская 1,5B-модель NVIDIA для генерации звука по текстовому описанию. Вместо отдельной скрытой модели диффузии она предсказывает последовательность аудиотокенов внутри языкового конвейера. Разработчики показывают генерацию музыки и звуковых эффектов и сравнивают её с опубликованными специализированными системами синтеза аудио.

Генерация аудио из текста

Аудиотокены внутри языковой модели

В исследовательской работе UALM-Gen описана как языковая модель объёмом 1,5 млрд параметров, которая предсказывает токены X-Codec. Для управления генерацией команда использует classifier-free guidance и прямое предпочтительное дообучение. Архитектурный замысел — объединить языковую обработку и выдачу звуковой последовательности в одном декодирующем процессе.

Какие примеры приводит NVIDIA

Музыка и звуковые эффекты

На проектной странице показаны запросы на музыку с заданным настроением, инструментами и ритмом, а также сцены с несколькими звуковыми источниками. UALM-Gen можно сравнивать с UALM 7B, которое дополнительно обучено на понимание звука и текстовые задачи; соответствующая страница — UALM. Для мультимодального планирования и диалога перед созданием аудио существует UALM-Reason.

Статус публикации и ограничения

Исследовательская модель без отдельной карточки весов

NVIDIA ADLR опубликовала описание UALM 8 октября 2025 года и разместила код и демонстрационные результаты. В доступных первичных материалах отдельная публичная карточка весов UALM-Gen не указана, поэтому эту страницу следует читать как описание исследовательской модели, а не обещание готового сервиса или скачиваемого чекпойнта. Синтезированный звук может не соответствовать каждому требованию запроса; публикация не заменяет проверку лицензий и условий данных.

Связанные модели и разработчик

Страницы семейства NVIDIA

NVIDIA UALM · NVIDIA UALM-Reason · NVIDIA Music Flamingo · NVIDIA в Вики Futuretools

Дата публикации и первичный источник

Материалы NVIDIA

Страница NVIDIA ADLR датирует публикацию исследования 08.10.2025, описывает UALM-Gen как 1.5B текстово-аудиомодель, предсказывающую X-Codec-токены. На странице нет ссылки на отдельную карточку доступных весов; это исследовательская публикация. Первичный источник: официальные материалы NVIDIA.