GPT-Realtime
GPT-Realtime — голосовая модель OpenAI, которая в реальном времени принимает речь и отвечает текстом или аудио.
OpenAI представила `gpt-realtime` 28 августа 2025 года вместе с выходом Realtime API из стадии beta. Модель создана для диалога голосом с малой задержкой: она принимает аудио, учитывает текстовый контекст и может выдавать ответ голосом. OpenAI описывала улучшения в следовании сложным инструкциям, вызове инструментов и естественности речи.
Голосовой диалог без отдельной цепочки моделей
Входная и выходная речь в одной сессии
Для классической схемы разработчику требовалось соединить распознавание речи, текстовую модель и синтезатор. GPT-Realtime позволяет организовать речевой обмен внутри одной API-сессии. Клиент передаёт аудиопоток через Realtime API, а модель возвращает аудио и при необходимости текстовую транскрипцию.
Инструменты и подключение
Поддержка управления разговором в приложении
Вместе с моделью OpenAI объявила обновления API: соединение через WebRTC, WebSocket или SIP, поддержку изображений и удалённых серверов MCP. Инструменты позволяют голосовому агенту получать дополнительный контекст или передавать выполнение внешней функции. Наличие такого интерфейса не превращает модель в полностью автономную систему: приложение определяет доступные инструменты и контролирует их вызовы.
Следующие поколения
От GPT-Realtime к более новым версиям
OpenAI позднее выпустила GPT-Realtime-1.5, а затем GPT-Realtime-2 и другие модели голосового семейства. Компания запланировала отключить API для GPT-Realtime 20 января 2027 года и рекомендует перейти на GPT-Realtime-2.1.
Кому подходит эта карточка
Разработчикам голосовых интерфейсов
GPT-Realtime полезно рассматривать как поколение голосовой модели для двусторонних разговоров, а не как обычный сервис транскрибации. Для распознавания записи в текст OpenAI развивает отдельные модели, например GPT-Transcribe и GPT-Live-Transcribe.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.