NVIDIA UALM
UALM объединяет понимание аудио, генерацию звука по тексту и обычные текстовые задачи в исследовательской модели 7B.
UALM (Unified Audio Language Model) — исследовательская 7B-модель NVIDIA, в которой разработчики объединили аудиопонимание, создание звука по тексту и обработку текстовых задач. Это единая мультимодальная архитектура, а не отдельные специализированные модели, соединённые только на уровне интерфейса. В публикации показаны примеры музыкальной генерации, звуковых эффектов и ответов на вопросы по аудио.
Три направления в одной модели
Понимание, генерация и текст
NVIDIA описывает обучение UALM на данных аудиогенерации, аудиопонимания и обычных текстовых задач. Исследователи увеличивали вес генеративных аудиоданных при обучении и добавили этап предварительной адаптации перед общей настройкой. В публикации заявлено, что это помогает сохранить текстовые возможности базовой модели при объединении нескольких аудиорежимов.
Техническая схема
Whisper, X-Codec и языковой декодер
Модель построена на decoder-only языковой архитектуре. Для аудио на входе используется предварительно обученный кодировщик Whisper и проекция аудиопризнаков в представление модели; генерация работает через токены X-Codec с восьмислойным residual vector quantization. Для улучшения выходного аудио NVIDIA также описывает VAE, переводящий его к качеству 48 кГц стерео. Младший генеративный вариант UALM-Gen и модель рассуждения UALM-Reason опубликованы как отдельные части того же проекта.
Как понимать статус и результаты
Исследовательская публикация, не публичный API
NVIDIA ADLR разместила статью и демонстрационные примеры 8 октября 2025 года, однако на проектной странице не указала публичный API или отдельную карточку весов. Поэтому UALM включена в каталог как опубликованная исследовательская модель, а не доступный пользователю онлайн-инструмент. Демонстрационные сравнения показывают выбранные примеры и не гарантируют качество на любых описаниях, языках или музыкальных жанрах.
Связанные модели и разработчик
Страницы семейства NVIDIA
NVIDIA UALM-Gen · NVIDIA UALM-Reason · NVIDIA Audio Flamingo 3 · NVIDIA в Вики Futuretools
Дата публикации и первичный источник
Материалы NVIDIA
Страница NVIDIA ADLR датирует публикацию 08.10.2025 и описывает 7B-модель UALM, обученную на аудиогенерации, аудиопонимании и текстовых задачах. Там же документированы архитектура Whisper + decoder-only LLM + X-Codec и улучшение аудиовыхода; отдельные публичные веса не перечислены. Первичный источник: официальные материалы NVIDIA.