NVIDIA Nemotron-Labs Audio-Visual Flamingo
Nemotron-Labs Audio-Visual Flamingo анализирует видео совместно со звуком и изображением, связывая речь, действия и события.
Nemotron-Labs Audio-Visual Flamingo (AVF) — мультимодальная модель NVIDIA для совместного понимания видео, изображений и звука. Она предназначена для случаев, где ответ зависит одновременно от видимых действий и слышимых сигналов: например, кто говорит, что происходит в кадре и как меняется сцена во времени. Официальная карточка описывает опубликованный вариант AVF-Instruct как модель с текстовым ответом.
Аудио и видео рассматриваются совместно
События, речь и временная последовательность
AVF принимает визуальную и аудиодорожку как связанные части одной сцены. Модель может отвечать на вопросы о диалоге, звуковом фоне, действиях на экране, переходах и соответствии между слышимым и видимым. Карточка указывает поддержку длинного видео до 15 минут и контекста до 32 тысяч токенов; фактическая нагрузка зависит от частоты кадров и длины записи.
Архитектура и вход
Qwen 2.5-7B, аудио и кадры
Опубликованный чекпойнт основан на decoder-only языковой модели семейства Qwen 2.5-7B, аудиокодировщике и визуальном кодировщике. Процессор по умолчанию выбирает до 128 видеокадров и обрабатывает аудио окнами по 30 секунд. Это способ собрать ограниченное представление длинного видео, а не передать модели каждый исходный кадр без сокращения.
Релиз и границы применения
Текстовый ответ без голосовой генерации
Модельная карточка NVIDIA отмечает AVF-Instruct как финальный чекпойнт от 29.06.2026. Веса доступны для некоммерческого исследования; голосовой синтез, упоминаемый в более широком проекте, не входит в Hub-чекпойнт. Поэтому модель отвечает текстом и не должна описываться как готовая голосовая система. Для аудио без визуального ряда см. семейство Audio Flamingo Next.
Связанные модели и разработчик
Страницы семейства NVIDIA
NVIDIA Audio Flamingo Next Instruct · NVIDIA Audio Flamingo 3 · NVIDIA в Вики Futuretools
Дата публикации и первичный источник
Материалы NVIDIA
Официальная карточка NVIDIA на Hugging Face называет AVF-Instruct финальным чекпойнтом от 29.06.2026 и описывает до 15 минут видео, 32K контекст, 128 кадров по умолчанию, текстовый выход и некоммерческую исследовательскую лицензию. Первичный источник: официальные материалы NVIDIA.