Grok Voice Transcribe 2.0
Модель xAI для пакетной и потоковой расшифровки речи с поддержкой нескольких аудиоформатов и языков.
Grok Voice Transcribe 2.0 — модель xAI для преобразования речи в текст, доступная с 17 сентября 2026 года. Она работает в пакетном режиме с аудиофайлами и в потоковом режиме через API; при запуске версии 2.0 в release notes модель 1.0 оставалась значением по умолчанию.
Пакетная и потоковая обработка
В документации Speech to Text перечислены аудиоформаты WAV, MP3, WebM, OGG и M4A, промежуточные результаты для потоковой расшифровки, словарные подсказки и автоматическое определение конца реплики. Документация также описывает работу с несколькими каналами аудио и разметку слов по говорящим.
Подключение через API
Идентификатор модели — grok-voice-transcribe-2.0. Для файла используется REST-запрос, для речи в реальном времени — потоковый endpoint. Поддерживаемые форматы и цены следует перепроверять в текущей документации xAI.
Выбор версии
В API сохраняется и предыдущий идентификатор grok-voice-transcribe-1.0. Выбор версии и её поведение зависят от параметров запроса; не полагайтесь на автоматический выбор модели в приложении без проверки конфигурации.
Разработчик и первичный источник
Страница разработчика: xAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.