GPT-4o Transcribe
GPT-4o Transcribe — модель OpenAI для преобразования речи в текст. Она точнее распознаёт речь, в том числе при акценте, шуме и разной скорости разговора.
OpenAI представила GPT-4o Transcribe 20 марта 2025 года вместе с обновлением аудиомоделей API. Это модель распознавания речи: она принимает аудио и формирует текстовую расшифровку. Компания заявила об улучшении точности по сравнению с исходными моделями Whisper и отдельно отметила распознавание речи с акцентами, на фоне шума и при разном темпе.
Что делает модель
Расшифровка аудиозаписей
GPT-4o Transcribe предназначена для сценариев, где нужно преобразовать запись разговора, интервью или другого аудио в текст. По описанию OpenAI, качество распознавания повышено благодаря обучению с подкреплением и дополнительной обработке разнообразных аудиоданных. Это может уменьшать число ошибок в сложных фрагментах, но не отменяет редакторскую проверку имен, чисел и терминов.
Отличие от базовой Whisper
Речь, акцент и шум
OpenAI сравнивает GPT-4o Transcribe с исходными моделями Whisper по показателю Word Error Rate — доле ошибочно распознанных слов. Компания сообщает о снижении этого показателя на нескольких наборах тестов и о лучшем распознавании языков. Whisper остаётся отдельной открытой моделью, тогда как GPT-4o Transcribe доступна через API; их не следует считать одним и тем же продуктом.
Доступность и срок поддержки
Модель API с объявленным завершением поддержки
В августе 2026 года OpenAI сообщила, что GPT-4o Transcribe будет отключена в API 26 февраля 2027 года. До указанной даты модель остаётся доступной для интеграций, но для новых решений разработчик рекомендует GPT Transcribe или GPT Live Transcribe. Дата публикации карточки соответствует первому релизу аудиомодели, а не объявлению о её выводе из API.
Связанные модели
Для сравнения возможностей и поколений посмотрите также: GPT Transcribe; GPT Live Transcribe; Whisper.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.