NVIDIA Audio Flamingo Next Captioner
Audio Flamingo Next Captioner создаёт подробные описания длинных аудиозаписей с речью, музыкой и звуками окружающей среды.
Audio Flamingo Next Captioner — вариант семейства AF-Next, настроенный на развёрнутые описания сложных аудиозаписей. Он объединяет в одном тексте речь, музыкальные фрагменты, фоновые шумы и изменения звуковой сцены. В отличие от Instruct-версии, которая подходит для кратких ответов и диалога, Captioner стремится дать насыщенное связное описание, включая длительные записи.
- Подробная подпись к аудио
- Несколько слоёв звуковой сцены в одном тексте
- Место в процессе обучения AF-Next
- Чекпойнт до настройки ассистента
- Ограничения и связанные версии
- Описание может содержать неточности
- Связанные модели и разработчик
- Страницы семейства NVIDIA
- Дата публикации и первичный источник
- Материалы NVIDIA
Подробная подпись к аудио
Несколько слоёв звуковой сцены в одном тексте
Официальная карточка предназначает модель для длинных описаний речи, окружающих звуков и музыки. В запросе можно попросить разобрать, как сцена меняется со временем, какие голоса и фоновые элементы слышны и в какой последовательности они появляются. Модель ориентирована на более подробный рассказ, а не на лаконичный ответ «да/нет» или отдельную транскрипцию.
Место в процессе обучения AF-Next
Чекпойнт до настройки ассистента
NVIDIA описывает Captioner как вариант, полученный после mid-training на расширенных наборах данных для длинных аудиоописаний и вопросов. В карточке отмечено, что до этапа обучения, ориентированного на поведение ассистента, этот вариант обычно многословнее и ближе к описанию сцены, чем Instruct. Процессор рассчитан на аудио длительностью до 30 минут и обрабатывает его окнами по 30 секунд.
Ограничения и связанные версии
Описание может содержать неточности
Подробная формулировка модели не является подтверждённой расшифровкой: названия инструментов, слова и последовательность событий следует сверять с исходной записью. Для общего вопросно-ответного режима и распознавания речи лучше подходит AF-Next Instruct, а для анализа временной последовательности и пошагового вывода — AF-Next Think. Официальный Hub-чекпойнт предназначен для некоммерческого исследования.
Связанные модели и разработчик
Страницы семейства NVIDIA
NVIDIA Audio Flamingo Next Instruct · NVIDIA Audio Flamingo Next Think · NVIDIA в Вики Futuretools
Дата публикации и первичный источник
Материалы NVIDIA
Публикация AF-Next от 13.04.2026 объявляет три открытых варианта. Карточка Captioner уточняет его специализацию на длинных описаниях, происхождение до assistant-alignment стадии и предел процессора в 30 минут; это отдельный чекпойнт, а не демо-обёртка. Первичный источник: официальные материалы NVIDIA.