GPT-4o Mini TTS
GPT-4o Mini TTS — модель OpenAI для генерации речи по тексту с настройкой подачи голосового ответа.
GPT-4o Mini TTS — модель синтеза речи OpenAI, выпущенная 20 марта 2025 года. Она преобразует текст в аудио и позволяет задавать, как звучит речь. В анонсе OpenAI выделила управляемость подачи как отличие новой модели: разработчик может описывать требуемую манеру произношения в текстовой инструкции.
Что умеет модель
Генерация и настройка звучания
В запрос можно передать текст и описать голосовую подачу: например, темп, интонацию или эмоциональный характер. Это даёт больше контроля, чем простой выбор готового голоса, но не превращает TTS в средство клонирования голоса конкретного человека. Возможные голоса и параметры зависят от действующей документации API и настроек доступа.
Типовые задачи
Голосовые ответы и озвучивание
GPT-4o Mini TTS можно встроить в голосового помощника, озвучивание интерфейса или создание аудиоверсии текста. При построении диалога модель синтеза речи отвечает за выходное аудио; распознавание входящей речи выполняет отдельная модель. Например, для этого используются GPT-4o Transcribe, GPT Transcribe или модели Realtime — это разные компоненты, а не единый универсальный аудиомодуль.
Доступность и версии
Актуальный API и датированные снимки
OpenAI добавила модель в Audio API в марте 2025 года и позднее обновляла её версию. В январе 2026 года журнал API указывал датированный снимок от 15 декабря 2025 года. Для воспроизводимых систем фиксированная версия помогает избежать незаметных изменений поведения, тогда как переменный псевдоним может указывать на более новый снимок.
Связанные модели
Для сравнения возможностей и поколений посмотрите также: GPT-Audio-1.5; GPT-Realtime-2.1; GPT-4o Transcribe.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.