NVIDIA Audio Flamingo

Audio Flamingo анализирует речь, музыку и звуковые сцены, поддерживает диалог и ответы по аудиозаписи.

Audio Flamingo — первая аудиоязыковая модель NVIDIA из одноимённой серии. Она связывает аудиовход с языковой моделью, чтобы отвечать на вопросы о записи, описывать звуковую сцену и вести диалог. В отличие от системы, ограниченной распознаванием речи, модель рассчитана также на музыку и неречевые звуки.

Какие задачи решает модель

Описание, классификация и вопросы по аудио

В официальном описании NVIDIA перечислены создание подписей к аудио, ответы на вопросы, классификация и диалог. Модель может учитывать предыдущий контекст беседы и разбирать запись не только как последовательность слов: в примерах исследуются музыка, звуковые события и их сочетания. Это делает её исследовательской основой для систем, которым нужно связать услышанное с текстовым запросом.

Архитектура и обучение

Модель языка объединена с аудиопредставлением

Audio Flamingo основана на архитектуре Flamingo и языковой модели OPT-IML объёмом 1,3 млрд параметров. Команда сообщает о наборе примерно из 5,9 млн пар «аудио — текст». Поддержка few-shot означает, что модель может использовать несколько примеров в контексте запроса, не требуя отдельного дообучения под каждый конкретный вопрос.

Место в линейке и ограничения

Первая версия до Audio Flamingo 2

Эту версию следует отличать от Audio Flamingo 2, которая получила расширенную работу с длинными записями, новые данные и более крупную языковую основу. Дата 17 июля 2024 года — дата создания официального репозитория весов NVIDIA на Hugging Face; научная работа появилась раньше, в феврале 2024 года. Весами управляет некоммерческая лицензия NVIDIA, а также действуют условия базовой OPT-IML-модели и обучающих данных.

Связанные модели и разработчик

Страницы семейства NVIDIA

NVIDIA Audio Flamingo 2 · NVIDIA Audio Flamingo 3 · NVIDIA в Вики Futuretools

Дата публикации и первичный источник

Материалы NVIDIA

Официальная карточка NVIDIA на Hugging Face описывает Audio Flamingo как модель аудиопонимания и диалога; API Hub фиксирует создание репозитория 17.07.2024. Препринт научной работы был опубликован 02.02.2024, поэтому эти даты обозначают разные события. Первичный источник: официальные материалы NVIDIA.