GPT-Realtime-2
GPT-Realtime-2 — голосовая модель OpenAI с настраиваемым рассуждением, инструментами и естественным обменом речью в реальном времени.
OpenAI представила GPT-Realtime-2 7 мая 2026 года как новую голосовую модель для API. Компания описала её как первую в голосовой линейке модель с рассуждением уровня GPT-5, способную обрабатывать более сложные просьбы и естественно продолжать разговор.
Речь, понимание контекста и действия
Модель предназначена для диалогов «речь на входе — речь на выходе». Она может обдумывать ответ, следовать подробным инструкциям и использовать инструменты. Это позволяет строить голосовых помощников, которые не ограничиваются чтением заготовленных реплик, а при необходимости обращаются к подключённым системам и продолжают разговор с учётом результата.
Управление компромиссом между скоростью и анализом
Для GPT-Realtime-2 настраивается уровень усилий на рассуждение. Чем сложнее задача и выше требуемая глубина, тем больше времени может занять ответ. В рабочих сценариях следует заранее задать правила вызова инструментов и подтверждения действий, чтобы модель не предпринимала значимые операции без подходящего контроля.
Отличие от специализированных аудиомоделей
GPT-Realtime-2 выступает голосовым собеседником и агентом. GPT-Realtime-Translate переводит непрерывный аудиопоток, а GPT-Realtime-Whisper передаёт текстовую расшифровку без голосового ответа. Более новая GPT-Realtime-2.1 улучшила распознавание буквенно-цифровых данных и поведение при шуме и перебиваниях.
Подключение
Для живого разговора используются соединения Realtime API по WebRTC, WebSocket или SIP. Дата релиза, общее назначение и рабочие режимы приведены в анонсе OpenAI о голосовых моделях и документации модели.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Предыдущая модель в этой линейке — GPT-Realtime-1.5.