NVIDIA UALM-Gen
UALM-Gen преобразует текстовый запрос в аудио, предсказывая аудиотокены непосредственно языковой моделью.
UALM-Gen — исследовательская 1,5B-модель NVIDIA для генерации звука по текстовому описанию. Вместо отдельной скрытой модели диффузии она предсказывает последовательность аудиотокенов внутри языкового конвейера. Разработчики показывают генерацию музыки и звуковых эффектов и сравнивают её с опубликованными специализированными системами синтеза аудио.
- Генерация аудио из текста
- Аудиотокены внутри языковой модели
- Какие примеры приводит NVIDIA
- Музыка и звуковые эффекты
- Статус публикации и ограничения
- Исследовательская модель без отдельной карточки весов
- Связанные модели и разработчик
- Страницы семейства NVIDIA
- Дата публикации и первичный источник
- Материалы NVIDIA
Генерация аудио из текста
Аудиотокены внутри языковой модели
В исследовательской работе UALM-Gen описана как языковая модель объёмом 1,5 млрд параметров, которая предсказывает токены X-Codec. Для управления генерацией команда использует classifier-free guidance и прямое предпочтительное дообучение. Архитектурный замысел — объединить языковую обработку и выдачу звуковой последовательности в одном декодирующем процессе.
Какие примеры приводит NVIDIA
Музыка и звуковые эффекты
На проектной странице показаны запросы на музыку с заданным настроением, инструментами и ритмом, а также сцены с несколькими звуковыми источниками. UALM-Gen можно сравнивать с UALM 7B, которое дополнительно обучено на понимание звука и текстовые задачи; соответствующая страница — UALM. Для мультимодального планирования и диалога перед созданием аудио существует UALM-Reason.
Статус публикации и ограничения
Исследовательская модель без отдельной карточки весов
NVIDIA ADLR опубликовала описание UALM 8 октября 2025 года и разместила код и демонстрационные результаты. В доступных первичных материалах отдельная публичная карточка весов UALM-Gen не указана, поэтому эту страницу следует читать как описание исследовательской модели, а не обещание готового сервиса или скачиваемого чекпойнта. Синтезированный звук может не соответствовать каждому требованию запроса; публикация не заменяет проверку лицензий и условий данных.
Связанные модели и разработчик
Страницы семейства NVIDIA
NVIDIA UALM · NVIDIA UALM-Reason · NVIDIA Music Flamingo · NVIDIA в Вики Futuretools
Дата публикации и первичный источник
Материалы NVIDIA
Страница NVIDIA ADLR датирует публикацию исследования 08.10.2025, описывает UALM-Gen как 1.5B текстово-аудиомодель, предсказывающую X-Codec-токены. На странице нет ссылки на отдельную карточку доступных весов; это исследовательская публикация. Первичный источник: официальные материалы NVIDIA.