GPT-Audio-1.5
GPT-Audio-1.5 — аудиомодель OpenAI для Chat Completions, которая принимает речь и формирует текстовый и голосовой ответ.
OpenAI выпустила GPT-Audio-1.5 23 февраля 2026 года для Chat Completions API. Модель предназначена для сценариев, в которых разработчику нужно добавить аудиообмен в уже существующее текстовое приложение: отправить голосовой запрос и получить ответ с текстом, аудио или обоими форматами.
Аудио в обычном диалоговом API
В отличие от непрерывной голосовой сессии Realtime API, GPT-Audio-1.5 вызывается через Chat Completions. Запрос может включать текст и аудио, а ответ — текст и сгенерированную речь. Такой режим позволяет сохранить привычную схему сообщений и интегрировать аудио в уже работающий чат.
Когда выбрать Realtime
Для разговора с минимальной задержкой, перебиваниями и состоянием живой сессии OpenAI предлагает GPT-Realtime-1.5 или более новое поколение GPT-Realtime-2.1. GPT-Audio-1.5 удобнее, когда приложение уже использует Chat Completions и ему нужен аудиоввод или голосовая выдача без отдельной Realtime-архитектуры.
Обработка входа и выдача речи
OpenAI показывает работу модели с аудио- и текстовой модальностями через Chat Completions. Для озвучивания обычного текста без диалога подходят специализированные модели синтеза речи, а для преобразования файлов в текст — GPT Transcribe. Перед запуском следует отдельно проверить допустимые форматы входного аудио, голоса и правила хранения пользовательских записей.
Официальные сведения
Дата API-релиза и доступ через Chat Completions указаны в журнале OpenAI. Поддерживаемые режимы и модальности описаны в карточке GPT-Audio-1.5.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.