VibeVoice-ASR-7B
VibeVoice-ASR распознаёт длительную речь, связывает реплики с говорящими и расставляет временные отметки.
Microsoft опубликовала VibeVoice-ASR 21 января 2026 года как систему распознавания длинных аудиозаписей. В актуальном официальном репозитории модель обозначена как VibeVoice-ASR-7B. Она объединяет распознавание речи, разделение говорящих и временную привязку текста, формируя структурированный результат вместо набора несвязанных коротких фрагментов.
Длинная запись
До часа аудио за один проход
Модель может принимать до 60 минут непрерывной записи в контексте до 64 тысяч токенов. Результат содержит кто говорил, когда прозвучала реплика и что было сказано. Microsoft также описывает пользовательские hotwords, которые помогают учитывать имена, термины и словарь конкретной области.
Языки и обработка
Распознавание и смена языка
Карточка Transformers сообщает о поддержке более 50 языков и обработке переключений между ними без отдельного указания языка. Это помогает в многоязычных записях, но не означает одинаковую точность для каждого языка, акцента или фонового шума. Проверяйте распознавание на собственных аудиоматериалах и корректируйте важные имена.
Форматы и доступ
Открытый код и модельные веса
VibeVoice-ASR доступна через официальный репозиторий Microsoft, Foundry Labs и модельные карточки Hugging Face. Трансформерная публикация предоставляет совместимый вариант загрузки microsoft/VibeVoice-ASR-HF. Для длинной записи могут потребоваться значительные ресурсы; точное потребление зависит от размера модели, батчинга и длины входа.
Ограничения
Распознавание не заменяет редактуру
Шум, перекрывающиеся реплики, редкие слова и специализированные термины могут приводить к пропускам или ошибочной атрибуции. В расшифровке юридической, медицинской или деловой записи проверьте текст и говорящих вручную. VibeVoice-ASR — модель транскрипции; она не проверяет истинность сказанного и не формирует автоматически официальный протокол.
Связанные модели
Другие разработки Microsoft
VibeVoice-ASR-Streaming-1.5B · VibeVoice-ASR-Streaming-7B · VibeVoice-TTS-1.5B · MAI-Transcribe-1.5 · Microsoft AI в Вики Futuretools
Первичные источники
Материалы разработчика и официальные карточки моделей
официальная документация VibeVoice-ASR · анонс VibeVoice-ASR в Azure AI Foundry · официальная карточка VibeVoice-ASR для Transformers