GPT-Audio-1.5

GPT-Audio-1.5 — аудиомодель OpenAI для Chat Completions, которая принимает речь и формирует текстовый и голосовой ответ.

OpenAI выпустила GPT-Audio-1.5 23 февраля 2026 года для Chat Completions API. Модель предназначена для сценариев, в которых разработчику нужно добавить аудиообмен в уже существующее текстовое приложение: отправить голосовой запрос и получить ответ с текстом, аудио или обоими форматами.

Аудио в обычном диалоговом API

В отличие от непрерывной голосовой сессии Realtime API, GPT-Audio-1.5 вызывается через Chat Completions. Запрос может включать текст и аудио, а ответ — текст и сгенерированную речь. Такой режим позволяет сохранить привычную схему сообщений и интегрировать аудио в уже работающий чат.

Когда выбрать Realtime

Для разговора с минимальной задержкой, перебиваниями и состоянием живой сессии OpenAI предлагает GPT-Realtime-1.5 или более новое поколение GPT-Realtime-2.1. GPT-Audio-1.5 удобнее, когда приложение уже использует Chat Completions и ему нужен аудиоввод или голосовая выдача без отдельной Realtime-архитектуры.

Обработка входа и выдача речи

OpenAI показывает работу модели с аудио- и текстовой модальностями через Chat Completions. Для озвучивания обычного текста без диалога подходят специализированные модели синтеза речи, а для преобразования файлов в текст — GPT Transcribe. Перед запуском следует отдельно проверить допустимые форматы входного аудио, голоса и правила хранения пользовательских записей.

Официальные сведения

Дата API-релиза и доступ через Chat Completions указаны в журнале OpenAI. Поддерживаемые режимы и модальности описаны в карточке GPT-Audio-1.5.

Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.