MAI-Transcribe-2-Streaming — распознавание речи в реальном времени

Потоковая модель Microsoft для расшифровки аудио на 60 языках: показывает и уточняет текст, пока человек говорит.

MAI-Transcribe-2-Streaming — потоковая модель Microsoft AI, которая преобразует речь в текст в реальном времени. Она принимает аудио непрерывным потоком и показывает промежуточную расшифровку, пока человек говорит, а затем подтверждает итоговый текст. Модель представили 1 октября 2026 года. Это API для разработчиков, а не готовое приложение для записи и расшифровки.

Как работает потоковая расшифровка

Промежуточный текст появляется во время речи

Обычная расшифровка часто начинается после загрузки и обработки всей записи. В потоковом режиме аудио передаётся по частям. MAI-Transcribe-2-Streaming выдаёт предварительные фрагменты текста, обновляет их по мере поступления контекста и закрепляет результат для законченного сегмента. Это позволяет выводить субтитры без ожидания конца выступления или дать голосовому помощнику начать обработку запроса до того, как собеседник договорит.

Предварительная и итоговая версии — разные результаты

Первый фрагмент расшифровки может измениться, когда модель услышит продолжение фразы. Итоговая версия появляется позже и подтверждает распознанный сегмент. Поэтому скорость первого текста и точность финального результата оцениваются отдельно.

Точность и задержка

В анонсе Microsoft модель названа лидером по точности итоговых и промежуточных расшифровок в тесте Artificial Analysis. Компания приводит следующие результаты для потокового режима:

Показатель Результат Что измеряется
Итоговая расшифровка 2,5% WER; 0,13 секунды Доля ошибок в словах и время до итогового текста после обнаруженного конца речи
Первый промежуточный текст 2,5% WER; 0,12 секунды Точность первого фрагмента и время до него после обнаруженного конца речи

WER — доля ошибок в словах относительно эталонной расшифровки; чем показатель ниже, тем лучше. Значение 2,5% описывает результат на тестовых записях, а не гарантирует такую точность для каждого языка, микрофона или разговора. Набор AA-WER Streaming включает около восьми часов аудио из трёх корпусов с разными типами речи и рассчитывает итоговый показатель с заданными весами.

Цифры 0,12–0,13 секунды отсчитываются от обнаруженного окончания речи в процедуре тестирования. Это не полная задержка от микрофона до результата во всех приложениях. Microsoft отдельно сообщает, что первые предварительные гипотезы могут появляться чуть более чем через 100 мс после получения аудио; у этого измерения другая точка отсчёта.

Языки и задачи

Автоматическое определение языка

По данным Microsoft, модель работает с речью на 60 языках и автоматически определяет язык по мере поступления аудио. Перед внедрением стоит свериться с актуальным списком языков и проверить качество на собственных записях: результат зависит от языка, акцента, шума и условий записи.

Где полезен потоковый режим

  • субтитры и подписи во время встречи, лекции или трансляции;
  • голосовые помощники и интерфейсы, которые должны реагировать до конца фразы;
  • обработка звонков в контакт-центре;
  • диктовка и создание заметок в реальном времени.

Подключение и стоимость

Модель доступна через Microsoft Foundry. Документация описывает два способа интеграции: совместимый с OpenAI Realtime API WebSocket и Azure Speech SDK. SDK берёт на себя управление соединением и повторные попытки; WebSocket-вариант подойдёт приложениям, которые уже используют совместимый протокол. Подробности приведены в документации Microsoft Learn.

На момент запуска вводная цена составляет 0,54 доллара США за час аудио — примерно 9 долларов за 1 000 минут. Microsoft объявила эту цену до конца 2026 года; перед расчётом бюджета проверьте тариф в своём аккаунте Foundry.

Ограничение текущей версии

На момент публикации модель находится в публичном предварительном доступе. Microsoft указывает, что для preview нет соглашения об уровне обслуживания и не рекомендует использовать модель в производственной среде. Это важно учитывать, если от расшифровки зависят клиентские процессы или обязательства перед заказчиками.

Место в линейке MAI

MAI-Transcribe-2-Streaming рассчитана на приложения, которым текст нужен во время речи. Для обработки готовых аудиофайлов Microsoft предлагает MAI-Transcribe-2 без потоковой передачи. На Futuretools также есть страница более ранней речевой модели MAI-Transcribe-1.5 и страница Microsoft AI.

Анонс Microsoft AI от 1 октября 2026 года · методика теста AA-WER Streaming.