Voxtral Realtime
Voxtral Realtime — открытая модель Mistral AI для потоковой транскрибации аудио с настраиваемой задержкой менее 200 мс.
Voxtral Realtime — модель Mistral AI для распознавания речи в реальном времени, представленная 4 февраля 2026 года. Она обрабатывает поступающий звук потоково и позволяет настраивать задержку до значений ниже 200 мс. Модель содержит 4 млрд параметров, поддерживает 13 языков и опубликована под лицензией Apache 2.0.
Потоковая транскрибация
Текст появляется во время речи
В отличие от пакетного сценария, где аудиозапись сначала отправляют целиком, Voxtral Realtime начинает выдавать распознанный текст по мере получения аудио. По данным Mistral, при задержке около 480 мс точность остаётся близкой к пакетной версии; итоговая задержка выбирается с учётом компромисса между скоростью и точностью.
Языки и развёртывание
Открытые веса для голосовых приложений
Разработчик указывает 13 поддерживаемых языков и возможность развёртывания модели на периферийных устройствах. Это может быть полезно для голосовых помощников, субтитров и приложений, где важна реакция без ожидания окончания длинной записи. Такие сценарии требуют интеграции с аудиовходом, интерфейсом приложения и последующей обработкой результата.
Другие модели Voxtral
Пакетная расшифровка и генерация речи
Для транскрибации готовых записей Mistral выпустила Voxtral Mini Transcribe V2 в тот же день. Модель синтеза речи Voxtral Mini TTS решает обратную задачу и создаёт аудио по тексту. Эти модели не следует смешивать: у них разные входы и результаты.
Дата выпуска и источники
Что подтверждает разработчик
Дата, размер 4B, 13 языков, потоковый режим с задержкой ниже 200 мс и Apache 2.0 приведены в официальном анонсе Mistral. Первичный источник: официальная документация или публикация Mistral AI.
Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.