Voxtral Realtime

Voxtral Realtime — открытая модель Mistral AI для потоковой транскрибации аудио с настраиваемой задержкой менее 200 мс.

Voxtral Realtime — модель Mistral AI для распознавания речи в реальном времени, представленная 4 февраля 2026 года. Она обрабатывает поступающий звук потоково и позволяет настраивать задержку до значений ниже 200 мс. Модель содержит 4 млрд параметров, поддерживает 13 языков и опубликована под лицензией Apache 2.0.

Потоковая транскрибация

Текст появляется во время речи

В отличие от пакетного сценария, где аудиозапись сначала отправляют целиком, Voxtral Realtime начинает выдавать распознанный текст по мере получения аудио. По данным Mistral, при задержке около 480 мс точность остаётся близкой к пакетной версии; итоговая задержка выбирается с учётом компромисса между скоростью и точностью.

Языки и развёртывание

Открытые веса для голосовых приложений

Разработчик указывает 13 поддерживаемых языков и возможность развёртывания модели на периферийных устройствах. Это может быть полезно для голосовых помощников, субтитров и приложений, где важна реакция без ожидания окончания длинной записи. Такие сценарии требуют интеграции с аудиовходом, интерфейсом приложения и последующей обработкой результата.

Другие модели Voxtral

Пакетная расшифровка и генерация речи

Для транскрибации готовых записей Mistral выпустила Voxtral Mini Transcribe V2 в тот же день. Модель синтеза речи Voxtral Mini TTS решает обратную задачу и создаёт аудио по тексту. Эти модели не следует смешивать: у них разные входы и результаты.

Дата выпуска и источники

Что подтверждает разработчик

Дата, размер 4B, 13 языков, потоковый режим с задержкой ниже 200 мс и Apache 2.0 приведены в официальном анонсе Mistral. Первичный источник: официальная документация или публикация Mistral AI.

Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.