GPT-Realtime-Translate
GPT-Realtime-Translate — модель OpenAI для поточного перевода живой речи с одновременной выдачей переведённого аудио и текста.
OpenAI выпустила GPT-Realtime-Translate 7 мая 2026 года как отдельную модель и endpoint для перевода аудио в реальном времени. Пока человек говорит, система получает поток речи и возвращает перевод голосом, а также текстовые фрагменты расшифровки.
Перевод непрерывного аудиопотока
Модель предназначена для устного перевода звонков, встреч, трансляций, занятий и видеокомнат. В отличие от обычного голосового агента, она не должна отвечать на сказанное как собеседник: её задача — переводить поток речи. Для этого используется отдельный маршрут API `/v1/realtime/translations`, а не стандартный цикл разговора ассистента.
Аудио и субтитры одновременно
По мере поступления исходной речи API передаёт части переведённого аудио и текстовые события. Для браузерного интерфейса OpenAI рекомендует WebRTC; WebSocket подходит для серверных аудиопотоков и телефонных интеграций. Для каждого целевого языка создаётся отдельная сессия, а в приложении полезно показывать оригинальный и переведённый текст.
Переводчик или голосовой помощник
Если нужно, чтобы система понимала вопрос, вызывала функции и отвечала по существу, используйте голосовую модель GPT-Realtime-2.1 или её предшественницу GPT-Realtime-2. Для текстовой расшифровки без голосового перевода предусмотрена GPT-Realtime-Whisper.
Проверка качества
Перед запуском нужно тестировать имена, числа, даты, суммы, телефонные номера, специальную терминологию, акценты и речь нескольких собеседников. OpenAI советует отдельно измерять задержку первого перевода и точность смысла: быстрая выдача не гарантирует правильный перевод.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.