VibeVoice-ASR-Streaming-1.5B
VibeVoice-ASR-Streaming-1.5B расшифровывает речь по мере поступления аудио и поддерживает десять языков.
Microsoft выпустила потоковую версию VibeVoice-ASR 3 сентября 2026 года. В отличие от обычной модели для длинной записи, Streaming начинает выдавать транскрипцию по мере поступления аудио. Версия 1.5B рассчитана на меньшие требования к ресурсам, чем параллельный вариант 7B.
- Распознавание без ожидания конца записи
- Текст обновляется по аудиофрагментам
- Версия 1.5B
- Компактный вариант семейства
- Встраивание
- Транскрипция, разделение говорящих и словарь
- Ограничения
- Потоковый вывод может изменяться
- Связанные модели
- Другие разработки Microsoft
- Первичные источники
- Материалы разработчика и официальные карточки моделей
Распознавание без ожидания конца записи
Текст обновляется по аудиофрагментам
Модель может выдавать реплики по мере того, как человек продолжает говорить, связывая фрагмент с говорящим. Она поддерживает пользовательские горячие слова и десять языков. Потоковый вывод полезен в живых транскриптах и системах субтитров, где ждать завершения всей записи неудобно.
Версия 1.5B
Компактный вариант семейства
Checkpoint microsoft/VibeVoice-ASR-Streaming-1.5B опубликован под MIT. Он входит в ту же модельную архитектуру, что 7B-вариант, но меньше по числу параметров и ориентирован на запуск с ограниченными вычислительными ресурсами. Выбор зависит от требуемой задержки, памяти и качества на конкретных языках.
Встраивание
Транскрипция, разделение говорящих и словарь
Официальная документация описывает интеграцию аудиопотока, буферизацию фрагментов и выдачу промежуточной транскрипции. Поддержка пользовательских hotwords помогает распознавать имена и предметную лексику, но не исправляет все ошибки. Системе приложения нужно обрабатывать частичные результаты, которые могут уточняться с поступлением следующего фрагмента.
Ограничения
Потоковый вывод может изменяться
На шумных или перекрывающихся репликах распознавание способно ошибиться, а частичная расшифровка — уточниться после новых данных. Не используйте промежуточный текст как окончательный протокол без согласованного этапа завершения и редакторской проверки. Для полной записи, когда задержка не важна, сравните стандартную VibeVoice-ASR.
Связанные модели
Другие разработки Microsoft
VibeVoice-ASR-7B · VibeVoice-ASR-Streaming-7B · MAI-Transcribe-1.5 · VibeVoice-Realtime-0.5B · Microsoft AI в Вики Futuretools
Первичные источники
Материалы разработчика и официальные карточки моделей
документация потоковой версии VibeVoice-ASR · официальный репозиторий VibeVoice с журналом релизов · технический отчёт VibeVoice-ASR-Streaming · официальная карточка VibeVoice-ASR-Streaming-1.5B