GPT-Realtime-2.1
GPT-Realtime-2.1 — голосовая модель OpenAI с рассуждением и вызовом инструментов, улучшенным распознаванием букв и цифр, обработкой шума и перебиваний.
OpenAI выпустила GPT-Realtime-2.1 6 июля 2026 года для Realtime API. Эта версия развивает GPT-Realtime-2 для голосовых агентов: она лучше распознаёт буквенно-цифровые сочетания, устойчивее обрабатывает тишину и фоновый шум и точнее реагирует на перебивания собеседника.
Голосовой диалог с рассуждением и инструментами
GPT-Realtime-2.1 предназначена для приложений, которые одновременно слушают человека и формируют ответ голосом. Модель может учитывать инструкции, рассуждать о запросе и вызывать подключённые инструменты, когда диалогу нужны данные или действия. Для подключения используются протоколы WebRTC, WebSocket или SIP — выбор зависит от того, где обрабатывается аудиопоток.
Улучшения версии 2.1
В журнале OpenAI отдельно названы распознавание последовательностей букв и цифр, устойчивость к шуму и тишине и поведение при перебивании. Это практические изменения для телефонных разговоров, голосового управления и поддержки клиентов, где важно корректно услышать номер, дождаться продолжения реплики и не говорить одновременно с человеком.
Выбор внутри семейства
GPT-Realtime-2 — предыдущее поколение модели с рассуждением, а GPT-Realtime-2.1 Mini — более быстрая и экономичная уменьшенная версия. Если приложение только переводит чужую речь и не должно отвечать от имени собеседника, OpenAI предлагает отдельную GPT-Realtime-Translate.
Настройка реального времени
Качество голосового агента зависит не только от модели: разработчику нужно настроить начало и конец реплик, шумоподавление, инструкции, доступные инструменты и обработку ошибок соединения. Актуальные режимы и лимиты опубликованы в официальной карточке GPT-Realtime-2.1.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.