GPT-4o Audio
GPT-4o Audio — предварительная модель OpenAI для обработки аудио и текстовых запросов через Chat Completions API.
OpenAI представила `gpt-4o-audio-preview` 17 октября 2024 года. Модель принимает текст или аудио и может отвечать текстом, звуком либо обоими форматами. В официальной документации имя модели отображается как GPT-4o Audio; в API к нему добавлено уточнение Preview, потому что выпуск оставался предварительным.
Модель для входящей и исходящей речи
Аудио как часть запроса и ответа
Разработчик мог передать в Chat Completions аудиозапись для анализа и попросить модель сформировать текстовый ответ или сгенерировать речь. Это позволяло создавать голосовые функции поверх привычного API чата. При этом модель не являлась потоковой Realtime-сессией: для общения с минимальной задержкой существовала отдельная модель GPT-4o Realtime.
Снимки модели
От первого preview к последующим обновлениям
OpenAI выпускала датированные снимки этой модели; среди них — `gpt-4o-audio-preview-2024-12-17` и более поздний вариант от 3 июня 2025 года. Снимки помогают разработчикам зафиксировать поведение API, но не являются отдельными семействами моделей. Для более экономичного аудиообмена компания также представила GPT-4o Mini Audio.
Статус API
Preview-версия снята с обслуживания
OpenAI уведомила разработчиков о выводе `gpt-4o-audio-preview` из API 7 мая 2026 года. В качестве замены указана модель GPT-Audio-1.5. Поэтому страница описывает выпуск и возможности исторической версии, а не предлагает подключить уже отключённый идентификатор.
Связь с GPT-4o
Аудиовариант мультимодального семейства
Модель опиралась на семейство GPT-4o, но имела отдельное назначение и API-маршрут для аудио. У OpenAI были и другие отдельные карточки этой ветки: например, GPT-4o Transcribe для распознавания речи в текст и GPT-4o Mini TTS для синтеза речи.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.