GPT-Realtime-Translate

GPT-Realtime-Translate — модель OpenAI для поточного перевода живой речи с одновременной выдачей переведённого аудио и текста.

OpenAI выпустила GPT-Realtime-Translate 7 мая 2026 года как отдельную модель и endpoint для перевода аудио в реальном времени. Пока человек говорит, система получает поток речи и возвращает перевод голосом, а также текстовые фрагменты расшифровки.

Перевод непрерывного аудиопотока

Модель предназначена для устного перевода звонков, встреч, трансляций, занятий и видеокомнат. В отличие от обычного голосового агента, она не должна отвечать на сказанное как собеседник: её задача — переводить поток речи. Для этого используется отдельный маршрут API `/v1/realtime/translations`, а не стандартный цикл разговора ассистента.

Аудио и субтитры одновременно

По мере поступления исходной речи API передаёт части переведённого аудио и текстовые события. Для браузерного интерфейса OpenAI рекомендует WebRTC; WebSocket подходит для серверных аудиопотоков и телефонных интеграций. Для каждого целевого языка создаётся отдельная сессия, а в приложении полезно показывать оригинальный и переведённый текст.

Переводчик или голосовой помощник

Если нужно, чтобы система понимала вопрос, вызывала функции и отвечала по существу, используйте голосовую модель GPT-Realtime-2.1 или её предшественницу GPT-Realtime-2. Для текстовой расшифровки без голосового перевода предусмотрена GPT-Realtime-Whisper.

Проверка качества

Перед запуском нужно тестировать имена, числа, даты, суммы, телефонные номера, специальную терминологию, акценты и речь нескольких собеседников. OpenAI советует отдельно измерять задержку первого перевода и точность смысла: быстрая выдача не гарантирует правильный перевод.

Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.

Официальный источник: материал разработчика.