GPT-Realtime-Whisper
GPT-Realtime-Whisper — модель OpenAI для потоковой расшифровки живой речи с передачей частичных текстовых результатов по мере обработки.
OpenAI выпустила GPT-Realtime-Whisper 7 мая 2026 года как модель для потокового преобразования речи в текст. Она предназначена для приложений, в которых аудио поступает непрерывно, а расшифровку нужно получать частями, не ожидая завершения всей записи.
Расшифровка речи с низкой задержкой
Модель принимает аудио и возвращает текстовые обновления во время обработки живого потока. Такой режим подходит для субтитров, транскрибирования звонков, голосовых заметок и интерфейсов, где текст должен появляться одновременно с речью. В отличие от GPT-Realtime-2, она не формирует голосовой ответ ассистента и не предназначена для выполнения действий через инструменты.
Отличие от обычной Whisper
Название GPT-Realtime-Whisper указывает на задачу распознавания, но это отдельная модель API для realtime-сессий. OpenAI тарифицирует её по длительности аудио, а не по числу текстовых токенов. Для записанного файла с итоговой расшифровкой и языковыми подсказками есть более новая GPT Transcribe; для потоковой транскрибации OpenAI также предлагает GPT Live Transcribe.
Выбор подходящего голосового сценария
Если требуется перевод исходной речи с выдачей переведённого аудио, рассмотрите GPT-Realtime-Translate. Если нужен разговорный агент, который отвечает голосом, моделью семейства является GPT-Realtime-2. Эти модели решают разные задачи, хотя все работают с аудио в реальном времени.
Документация
Дата запуска и назначение модели зафиксированы в журнале OpenAI API; детали форматов, лимитов и сессий доступны в официальной карточке GPT-Realtime-Whisper.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.