Qwen-Audio-3.0-ASR-Flash

Qwen-Audio-3.0-ASR-Flash — облачная модель Qwen для распознавания речи в завершённых аудиозаписях.

Qwen-Audio-3.0-ASR-Flash — облачная модель Alibaba для распознавания речи в режиме офлайн. QwenCloud включила её в журнал релизов 30 июля 2026 года. Идентификатор используется для обработки записи после её окончания; для транскрипции в ходе разговора Qwen отдельно предлагает Streaming-вариант.

Из аудиозаписи в текст

Расшифровка после завершения записи

Flash принимает готовый аудиоматериал и формирует текстовую транскрипцию. Модель может использоваться в приложениях для обработки речи и индексирования аудиоконтента. Ограничения по длительности и формату входа следует проверять в API-документации, поскольку они относятся к конкретному endpoint.

Языки и улучшение транскрипции

Акценты, контекстные термины и нормализация

В описании Qwen-Audio-3.0-ASR компания заявляет поддержку 30 языков, семи крупных групп китайских диалектов и более двадцати региональных акцентов. Дополнительные возможности включают контекст и hotwords для редких терминов, более точную пунктуацию и приведение чисел, дат и денежных значений к стандартному виду.

Выбор режима обработки

Offline Flash или Filetrans

Для живого потока речи используйте ASR Flash Streaming. Файловый вариант ASR Flash Filetrans отдельно обозначен в каталоге QwenCloud и рассчитан на отправку готового файла. Три ID относятся к одной функциональной группе распознавания, но имеют отдельные способы вызова.

Дата выпуска

Сервисный запуск в QwenCloud

QwenCloud датирует выход qwen-audio-3.0-asr-flash 30 июля 2026 года. В тот же релиз входят отдельные streaming- и filetrans-модели.

Официальные источники: журнал моделей QwenCloud и руководство по ASR-моделям.

Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.