Voxtral Mini Transcribe V2

Voxtral Mini Transcribe V2 — модель Mistral AI для транскрибации аудио на 13 языках с разделением говорящих и временными метками слов.

Voxtral Mini Transcribe V2 — модель Mistral AI для пакетной транскрибации аудио, выпущенная 4 февраля 2026 года. Она преобразует записи в текст, распознаёт говорящих и может добавлять временные метки к словам. Mistral заявляет поддержку 13 языков и обработку аудиофайлов длительностью до трёх часов за один запрос.

Транскрибация с атрибуцией речи

Кто говорил и когда прозвучало слово

Режим диаризации присваивает фрагменты разным участникам разговора, а временные метки на уровне слов позволяют точнее синхронизировать текст с аудиозаписью. Это полезно для расшифровки интервью, совещаний и разговоров нескольких участников. При наложении реплик ограничения распознавания сохраняются: разработчик отмечает, что модель может передать речь одного из говорящих.

Языки и терминология

Контекстная подсказка для имён и специальных слов

В запрос можно передать до 100 слов или выражений, чтобы помочь распознавать имена, термины и отраслевую лексику. В документации Mistral предупреждает, что функция оптимизирована для английского, а поддержка остальных языков экспериментальная. Помимо этого, модель принимает длинные записи и рассчитана на пакетную обработку, а не на минимальную задержку в прямом эфире.

Потоковая версия семейства

Voxtral Realtime для живого звука

Для аудио, которое нужно расшифровывать по мере поступления, предназначена Voxtral Realtime. Обе модели представлены в одном выпуске Voxtral Transcribe 2 4 февраля 2026 года. Для генерации речи у Mistral есть отдельная Voxtral Mini TTS.

Дата выпуска и источники

Что подтверждает разработчик

Официальный анонс от 04.02.2026 описывает 13 языков, диаризацию, контекстные подсказки, метки слов и пакетную версию модели. Первичный источник: официальная документация или публикация Mistral AI.

Сведения о разработчике и его моделях: Mistral AI в Вики Futuretools.ru.