Whisper-1
Whisper-1 — модель OpenAI для распознавания речи и перевода аудио; исходные веса и код Whisper были опубликованы открыто.
Whisper — модель OpenAI для распознавания речи, впервые представленная 21 сентября 2022 года. Компания опубликовала модель и код, а затем добавила Whisper в API транскрибации. Модель обучалась на большом многоязычном наборе аудиоданных и предназначена для преобразования речи в текст, в том числе с переводом на английский язык.
Возможности Whisper
Речь на разных языках и перевод
В публикации OpenAI Whisper описана как система автоматического распознавания речи, обученная на 680 тысячах часов аудио из интернета. Разнообразие данных улучшило устойчивость к акцентам, фоновому шуму и технической лексике. Модель также поддерживает многоязычную транскрибацию и перевод распознанной речи на английский. Это свойства опубликованного проекта; качество конкретной записи всё равно зависит от языка, шума и дикции.
Открытая модель и API
Два способа использования
Веса и код Whisper опубликованы для исследовательского и самостоятельного применения. Позднее OpenAI добавила модель Whisper в Audio API как whisper-1, упростив обработку аудиофайлов без собственного запуска модели. Страница API и открытый проект связаны, но условия эксплуатации и доступные параметры у локального запуска и облачного сервиса различаются.
Текущий статус
Срок окончания API не равен удалению открытых весов
OpenAI объявила, что API-модель whisper-1 будет отключена 26 февраля 2027 года. Это относится к предоставлению модели через API и не меняет факт открытой публикации исходных весов и кода. Для новых API-интеграций компания рекомендует GPT Transcribe или GPT Live Transcribe; существующий локальный запуск Whisper следует оценивать отдельно от статуса API.
Связанные модели
Для сравнения возможностей и поколений посмотрите также: GPT-4o Transcribe; GPT Live Transcribe; GPT Transcribe.
Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.
Официальный источник: материал разработчика.