NVIDIA Audio Flamingo 3

Audio Flamingo 3 понимает речь, музыку и звуки в записях длительностью до десяти минут.

Audio Flamingo 3 — открытая аудиоязыковая модель NVIDIA, объединяющая понимание речи, музыки и окружающих звуков. Она отвечает на вопросы по записи, сопоставляет несколько аудиофрагментов в диалоге и может по запросу сформировать промежуточные шаги рассуждения. Входная запись может длиться до десяти минут.

Единое представление аудио

Речь, музыка и звуковые события

AF3 использует AF-Whisper — аудиокодировщик, который обучали представлять речь, неречевые звуки и музыку совместно. Это позволяет модели отвечать на вопросы, где важны не только произнесённые слова, но и тембр, события, последовательность и сочетание звуков. По описанию разработчика, модель обрабатывает длинные записи и показывает результаты на задачах понимания и распознавания речи.

Диалог и рассуждение

Контекст нескольких фрагментов

Audio Flamingo 3 поддерживает многошаговые беседы о нескольких аудиозаписях: новый вопрос может ссылаться на уже загруженный фрагмент и предыдущий ответ. Режим on-demand thinking включается по запросу и предназначен для задач, где нужно сопоставить детали записи. Это не гарантирует фактическую точность каждого объяснения: выводы модели следует сверять с самим аудио, особенно в юридических, медицинских и иных чувствительных сценариях.

Открытая публикация и различия версий

Базовая модель и вариант Chat

NVIDIA опубликовала код, рецепты обучения и наборы данных вместе с моделью. Веса предназначены для некоммерческих исследовательских целей; применяются также ограничения лицензий базовой модели и данных. Версия для многоходового общения и голосового ответа вынесена отдельно — Audio Flamingo 3-Chat. Более ранние поколения описаны на страницах Audio Flamingo и Audio Flamingo 2.

Связанные модели и разработчик

Страницы семейства NVIDIA

NVIDIA Audio Flamingo 2 · NVIDIA Audio Flamingo 3-Chat · NVIDIA Audio Flamingo Next Instruct · NVIDIA в Вики Futuretools

Дата публикации и первичный источник

Материалы NVIDIA

Страница NVIDIA ADLR датирует публикацию 09.07.2025, указывает 7B-вариант, аудиоконтекст до 10 минут, режим on-demand reasoning и отдельный AF3-Chat. NVIDIA также сообщает об открытой публикации кода, обучающих рецептов и четырёх наборов данных. Первичный источник: официальные материалы NVIDIA.