NVIDIA Audio Flamingo 3
Audio Flamingo 3 понимает речь, музыку и звуки в записях длительностью до десяти минут.
Audio Flamingo 3 — открытая аудиоязыковая модель NVIDIA, объединяющая понимание речи, музыки и окружающих звуков. Она отвечает на вопросы по записи, сопоставляет несколько аудиофрагментов в диалоге и может по запросу сформировать промежуточные шаги рассуждения. Входная запись может длиться до десяти минут.
Единое представление аудио
Речь, музыка и звуковые события
AF3 использует AF-Whisper — аудиокодировщик, который обучали представлять речь, неречевые звуки и музыку совместно. Это позволяет модели отвечать на вопросы, где важны не только произнесённые слова, но и тембр, события, последовательность и сочетание звуков. По описанию разработчика, модель обрабатывает длинные записи и показывает результаты на задачах понимания и распознавания речи.
Диалог и рассуждение
Контекст нескольких фрагментов
Audio Flamingo 3 поддерживает многошаговые беседы о нескольких аудиозаписях: новый вопрос может ссылаться на уже загруженный фрагмент и предыдущий ответ. Режим on-demand thinking включается по запросу и предназначен для задач, где нужно сопоставить детали записи. Это не гарантирует фактическую точность каждого объяснения: выводы модели следует сверять с самим аудио, особенно в юридических, медицинских и иных чувствительных сценариях.
Открытая публикация и различия версий
Базовая модель и вариант Chat
NVIDIA опубликовала код, рецепты обучения и наборы данных вместе с моделью. Веса предназначены для некоммерческих исследовательских целей; применяются также ограничения лицензий базовой модели и данных. Версия для многоходового общения и голосового ответа вынесена отдельно — Audio Flamingo 3-Chat. Более ранние поколения описаны на страницах Audio Flamingo и Audio Flamingo 2.
Связанные модели и разработчик
Страницы семейства NVIDIA
NVIDIA Audio Flamingo 2 · NVIDIA Audio Flamingo 3-Chat · NVIDIA Audio Flamingo Next Instruct · NVIDIA в Вики Futuretools
Дата публикации и первичный источник
Материалы NVIDIA
Страница NVIDIA ADLR датирует публикацию 09.07.2025, указывает 7B-вариант, аудиоконтекст до 10 минут, режим on-demand reasoning и отдельный AF3-Chat. NVIDIA также сообщает об открытой публикации кода, обучающих рецептов и четырёх наборов данных. Первичный источник: официальные материалы NVIDIA.