GPT-Realtime-Whisper

GPT-Realtime-Whisper — модель OpenAI для потоковой расшифровки живой речи с передачей частичных текстовых результатов по мере обработки.

OpenAI выпустила GPT-Realtime-Whisper 7 мая 2026 года как модель для потокового преобразования речи в текст. Она предназначена для приложений, в которых аудио поступает непрерывно, а расшифровку нужно получать частями, не ожидая завершения всей записи.

Расшифровка речи с низкой задержкой

Модель принимает аудио и возвращает текстовые обновления во время обработки живого потока. Такой режим подходит для субтитров, транскрибирования звонков, голосовых заметок и интерфейсов, где текст должен появляться одновременно с речью. В отличие от GPT-Realtime-2, она не формирует голосовой ответ ассистента и не предназначена для выполнения действий через инструменты.

Отличие от обычной Whisper

Название GPT-Realtime-Whisper указывает на задачу распознавания, но это отдельная модель API для realtime-сессий. OpenAI тарифицирует её по длительности аудио, а не по числу текстовых токенов. Для записанного файла с итоговой расшифровкой и языковыми подсказками есть более новая GPT Transcribe; для потоковой транскрибации OpenAI также предлагает GPT Live Transcribe.

Выбор подходящего голосового сценария

Если требуется перевод исходной речи с выдачей переведённого аудио, рассмотрите GPT-Realtime-Translate. Если нужен разговорный агент, который отвечает голосом, моделью семейства является GPT-Realtime-2. Эти модели решают разные задачи, хотя все работают с аудио в реальном времени.

Документация

Дата запуска и назначение модели зафиксированы в журнале OpenAI API; детали форматов, лимитов и сессий доступны в официальной карточке GPT-Realtime-Whisper.

Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.