Grok Voice Transcribe 2.0

Модель xAI для пакетной и потоковой расшифровки речи с поддержкой нескольких аудиоформатов и языков.

Grok Voice Transcribe 2.0 — модель xAI для преобразования речи в текст, доступная с 17 сентября 2026 года. Она работает в пакетном режиме с аудиофайлами и в потоковом режиме через API; при запуске версии 2.0 в release notes модель 1.0 оставалась значением по умолчанию.

Пакетная и потоковая обработка

В документации Speech to Text перечислены аудиоформаты WAV, MP3, WebM, OGG и M4A, промежуточные результаты для потоковой расшифровки, словарные подсказки и автоматическое определение конца реплики. Документация также описывает работу с несколькими каналами аудио и разметку слов по говорящим.

Подключение через API

Идентификатор модели — grok-voice-transcribe-2.0. Для файла используется REST-запрос, для речи в реальном времени — потоковый endpoint. Поддерживаемые форматы и цены следует перепроверять в текущей документации xAI.

Выбор версии

В API сохраняется и предыдущий идентификатор grok-voice-transcribe-1.0. Выбор версии и её поведение зависят от параметров запроса; не полагайтесь на автоматический выбор модели в приложении без проверки конфигурации.

Разработчик и первичный источник

Страница разработчика: xAI в Вики Futuretools.ru.

Официальный источник: материал разработчика.