Whisper-1

Whisper-1 — модель OpenAI для распознавания речи и перевода аудио; исходные веса и код Whisper были опубликованы открыто.

Whisper — модель OpenAI для распознавания речи, впервые представленная 21 сентября 2022 года. Компания опубликовала модель и код, а затем добавила Whisper в API транскрибации. Модель обучалась на большом многоязычном наборе аудиоданных и предназначена для преобразования речи в текст, в том числе с переводом на английский язык.

Возможности Whisper

Речь на разных языках и перевод

В публикации OpenAI Whisper описана как система автоматического распознавания речи, обученная на 680 тысячах часов аудио из интернета. Разнообразие данных улучшило устойчивость к акцентам, фоновому шуму и технической лексике. Модель также поддерживает многоязычную транскрибацию и перевод распознанной речи на английский. Это свойства опубликованного проекта; качество конкретной записи всё равно зависит от языка, шума и дикции.

Открытая модель и API

Два способа использования

Веса и код Whisper опубликованы для исследовательского и самостоятельного применения. Позднее OpenAI добавила модель Whisper в Audio API как whisper-1, упростив обработку аудиофайлов без собственного запуска модели. Страница API и открытый проект связаны, но условия эксплуатации и доступные параметры у локального запуска и облачного сервиса различаются.

Текущий статус

Срок окончания API не равен удалению открытых весов

OpenAI объявила, что API-модель whisper-1 будет отключена 26 февраля 2027 года. Это относится к предоставлению модели через API и не меняет факт открытой публикации исходных весов и кода. Для новых API-интеграций компания рекомендует GPT Transcribe или GPT Live Transcribe; существующий локальный запуск Whisper следует оценивать отдельно от статуса API.

Связанные модели

Для сравнения возможностей и поколений посмотрите также: GPT-4o Transcribe; GPT Live Transcribe; GPT Transcribe.

Сведения о разработчике и его моделях: OpenAI в Вики Futuretools.ru.

Официальный источник: материал разработчика.