GPT-Realtime-2

GPT-Realtime-2 — голосовая модель OpenAI с настраиваемым рассуждением, инструментами и естественным обменом речью в реальном времени.

OpenAI представила GPT-Realtime-2 7 мая 2026 года как новую голосовую модель для API. Компания описала её как первую в голосовой линейке модель с рассуждением уровня GPT-5, способную обрабатывать более сложные просьбы и естественно продолжать разговор.

Речь, понимание контекста и действия

Модель предназначена для диалогов «речь на входе — речь на выходе». Она может обдумывать ответ, следовать подробным инструкциям и использовать инструменты. Это позволяет строить голосовых помощников, которые не ограничиваются чтением заготовленных реплик, а при необходимости обращаются к подключённым системам и продолжают разговор с учётом результата.

Управление компромиссом между скоростью и анализом

Для GPT-Realtime-2 настраивается уровень усилий на рассуждение. Чем сложнее задача и выше требуемая глубина, тем больше времени может занять ответ. В рабочих сценариях следует заранее задать правила вызова инструментов и подтверждения действий, чтобы модель не предпринимала значимые операции без подходящего контроля.

Отличие от специализированных аудиомоделей

GPT-Realtime-2 выступает голосовым собеседником и агентом. GPT-Realtime-Translate переводит непрерывный аудиопоток, а GPT-Realtime-Whisper передаёт текстовую расшифровку без голосового ответа. Более новая GPT-Realtime-2.1 улучшила распознавание буквенно-цифровых данных и поведение при шуме и перебиваниях.

Подключение

Для живого разговора используются соединения Realtime API по WebRTC, WebSocket или SIP. Дата релиза, общее назначение и рабочие режимы приведены в анонсе OpenAI о голосовых моделях и документации модели.

Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.

Предыдущая модель в этой линейке — GPT-Realtime-1.5.