NVIDIA Audio Flamingo Next Instruct

Audio Flamingo Next Instruct отвечает на вопросы по речи, музыке и звукам в аудиозаписях длительностью до 30 минут.

Audio Flamingo Next Instruct — основной инструкционный чекпойнт нового поколения аудиоязыковой модели NVIDIA. Он рассчитан на обычные вопросы и ответы, распознавание речи, перевод речи и диалог по длинным аудиозаписям. В карточке NVIDIA указан предел до 30 минут на запись; это отдельный выпущенный вариант семейства AF-Next, наряду с Think и Captioner.

Основной сценарий использования

Краткий ответ, вопрос–ответ и речь

Модель принимает текст вместе с аудио и формирует текстовый ответ. Карточка называет её базовым вариантом для общего понимания звука, аудиовопросов, диалога, автоматического распознавания речи и перевода речи. Запись обрабатывается частями по 30 секунд; общий лимит, указанный для опубликованного процессора, составляет 1800 секунд. Это не означает, что любая запись такой длины будет разбираться без потери деталей.

Отличие от AF3 и других вариантов

Следующее поколение и три настройки модели

По сравнению с Audio Flamingo 3, AF-Next расширяет максимальную длительность аудио до 30 минут и использует более крупный набор данных и длинный контекст. Если требуются временно привязанные шаги рассуждения, существует AF-Next Think; для развёрнутого описания сцены — AF-Next Captioner. Сам Instruct-чекпойнт оптимизирован под прямой ответ и инструкционное поведение.

Доступ и ограничения

Текстовый выход и исследовательская лицензия

Официальная карточка подчёркивает, что Hub-чекпойнт относится к модели audio-text-to-text. Возможности потокового синтеза речи и voice-to-voice, обсуждаемые в рамках проекта, не входят в эти опубликованные веса. Модель выпущена для некоммерческих исследовательских целей; карточка перечисляет зависимость от Qwen Research License и условий OpenAI для части данных. Для коммерческого внедрения нужно проверять каждую лицензию в цепочке.

Связанные модели и разработчик

Страницы семейства NVIDIA

NVIDIA Audio Flamingo 3 · NVIDIA Audio Flamingo Next Think · NVIDIA Audio Flamingo Next Captioner · NVIDIA в Вики Futuretools

Дата публикации и первичный источник

Материалы NVIDIA

Технический отчёт NVIDIA/University of Maryland датирован 13.04.2026 и объявляет три открытых варианта AF-Next. Карточка Instruct указывает до 30 минут аудио, текстовый вывод, распознавание и перевод речи; код и веса опубликованы отдельно на Hub. Первичный источник: официальные материалы NVIDIA.