Qwen-Audio-3.0-ASR-Flash
Qwen-Audio-3.0-ASR-Flash — облачная модель Qwen для распознавания речи в завершённых аудиозаписях.
Qwen-Audio-3.0-ASR-Flash — облачная модель Alibaba для распознавания речи в режиме офлайн. QwenCloud включила её в журнал релизов 30 июля 2026 года. Идентификатор используется для обработки записи после её окончания; для транскрипции в ходе разговора Qwen отдельно предлагает Streaming-вариант.
Из аудиозаписи в текст
Расшифровка после завершения записи
Flash принимает готовый аудиоматериал и формирует текстовую транскрипцию. Модель может использоваться в приложениях для обработки речи и индексирования аудиоконтента. Ограничения по длительности и формату входа следует проверять в API-документации, поскольку они относятся к конкретному endpoint.
Языки и улучшение транскрипции
Акценты, контекстные термины и нормализация
В описании Qwen-Audio-3.0-ASR компания заявляет поддержку 30 языков, семи крупных групп китайских диалектов и более двадцати региональных акцентов. Дополнительные возможности включают контекст и hotwords для редких терминов, более точную пунктуацию и приведение чисел, дат и денежных значений к стандартному виду.
Выбор режима обработки
Offline Flash или Filetrans
Для живого потока речи используйте ASR Flash Streaming. Файловый вариант ASR Flash Filetrans отдельно обозначен в каталоге QwenCloud и рассчитан на отправку готового файла. Три ID относятся к одной функциональной группе распознавания, но имеют отдельные способы вызова.
Дата выпуска
Сервисный запуск в QwenCloud
QwenCloud датирует выход qwen-audio-3.0-asr-flash 30 июля 2026 года. В тот же релиз входят отдельные streaming- и filetrans-модели.
Официальные источники: журнал моделей QwenCloud и руководство по ASR-моделям.
Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.