NVIDIA Audio Flamingo Next Captioner

Audio Flamingo Next Captioner создаёт подробные описания длинных аудиозаписей с речью, музыкой и звуками окружающей среды.

Audio Flamingo Next Captioner — вариант семейства AF-Next, настроенный на развёрнутые описания сложных аудиозаписей. Он объединяет в одном тексте речь, музыкальные фрагменты, фоновые шумы и изменения звуковой сцены. В отличие от Instruct-версии, которая подходит для кратких ответов и диалога, Captioner стремится дать насыщенное связное описание, включая длительные записи.

Подробная подпись к аудио

Несколько слоёв звуковой сцены в одном тексте

Официальная карточка предназначает модель для длинных описаний речи, окружающих звуков и музыки. В запросе можно попросить разобрать, как сцена меняется со временем, какие голоса и фоновые элементы слышны и в какой последовательности они появляются. Модель ориентирована на более подробный рассказ, а не на лаконичный ответ «да/нет» или отдельную транскрипцию.

Место в процессе обучения AF-Next

Чекпойнт до настройки ассистента

NVIDIA описывает Captioner как вариант, полученный после mid-training на расширенных наборах данных для длинных аудиоописаний и вопросов. В карточке отмечено, что до этапа обучения, ориентированного на поведение ассистента, этот вариант обычно многословнее и ближе к описанию сцены, чем Instruct. Процессор рассчитан на аудио длительностью до 30 минут и обрабатывает его окнами по 30 секунд.

Ограничения и связанные версии

Описание может содержать неточности

Подробная формулировка модели не является подтверждённой расшифровкой: названия инструментов, слова и последовательность событий следует сверять с исходной записью. Для общего вопросно-ответного режима и распознавания речи лучше подходит AF-Next Instruct, а для анализа временной последовательности и пошагового вывода — AF-Next Think. Официальный Hub-чекпойнт предназначен для некоммерческого исследования.

Связанные модели и разработчик

Страницы семейства NVIDIA

NVIDIA Audio Flamingo Next Instruct · NVIDIA Audio Flamingo Next Think · NVIDIA в Вики Futuretools

Дата публикации и первичный источник

Материалы NVIDIA

Публикация AF-Next от 13.04.2026 объявляет три открытых варианта. Карточка Captioner уточняет его специализацию на длинных описаниях, происхождение до assistant-alignment стадии и предел процессора в 30 минут; это отдельный чекпойнт, а не демо-обёртка. Первичный источник: официальные материалы NVIDIA.