NVIDIA Audio Flamingo Next Instruct
Audio Flamingo Next Instruct отвечает на вопросы по речи, музыке и звукам в аудиозаписях длительностью до 30 минут.
Audio Flamingo Next Instruct — основной инструкционный чекпойнт нового поколения аудиоязыковой модели NVIDIA. Он рассчитан на обычные вопросы и ответы, распознавание речи, перевод речи и диалог по длинным аудиозаписям. В карточке NVIDIA указан предел до 30 минут на запись; это отдельный выпущенный вариант семейства AF-Next, наряду с Think и Captioner.
- Основной сценарий использования
- Краткий ответ, вопрос–ответ и речь
- Отличие от AF3 и других вариантов
- Следующее поколение и три настройки модели
- Доступ и ограничения
- Текстовый выход и исследовательская лицензия
- Связанные модели и разработчик
- Страницы семейства NVIDIA
- Дата публикации и первичный источник
- Материалы NVIDIA
Основной сценарий использования
Краткий ответ, вопрос–ответ и речь
Модель принимает текст вместе с аудио и формирует текстовый ответ. Карточка называет её базовым вариантом для общего понимания звука, аудиовопросов, диалога, автоматического распознавания речи и перевода речи. Запись обрабатывается частями по 30 секунд; общий лимит, указанный для опубликованного процессора, составляет 1800 секунд. Это не означает, что любая запись такой длины будет разбираться без потери деталей.
Отличие от AF3 и других вариантов
Следующее поколение и три настройки модели
По сравнению с Audio Flamingo 3, AF-Next расширяет максимальную длительность аудио до 30 минут и использует более крупный набор данных и длинный контекст. Если требуются временно привязанные шаги рассуждения, существует AF-Next Think; для развёрнутого описания сцены — AF-Next Captioner. Сам Instruct-чекпойнт оптимизирован под прямой ответ и инструкционное поведение.
Доступ и ограничения
Текстовый выход и исследовательская лицензия
Официальная карточка подчёркивает, что Hub-чекпойнт относится к модели audio-text-to-text. Возможности потокового синтеза речи и voice-to-voice, обсуждаемые в рамках проекта, не входят в эти опубликованные веса. Модель выпущена для некоммерческих исследовательских целей; карточка перечисляет зависимость от Qwen Research License и условий OpenAI для части данных. Для коммерческого внедрения нужно проверять каждую лицензию в цепочке.
Связанные модели и разработчик
Страницы семейства NVIDIA
NVIDIA Audio Flamingo 3 · NVIDIA Audio Flamingo Next Think · NVIDIA Audio Flamingo Next Captioner · NVIDIA в Вики Futuretools
Дата публикации и первичный источник
Материалы NVIDIA
Технический отчёт NVIDIA/University of Maryland датирован 13.04.2026 и объявляет три открытых варианта AF-Next. Карточка Instruct указывает до 30 минут аудио, текстовый вывод, распознавание и перевод речи; код и веса опубликованы отдельно на Hub. Первичный источник: официальные материалы NVIDIA.