Qwen-Audio-3.0-ASR-Flash-Filetrans
Qwen-Audio-3.0-ASR-Flash-Filetrans — модель Qwen для транскрибации готовых аудиофайлов без потоковой передачи.
Qwen-Audio-3.0-ASR-Flash-Filetrans — сервис Alibaba для распознавания речи в уже записанных аудиофайлах. QwenCloud добавила его в каталог 30 июля 2026 года. В отличие от потоковой ASR-модели, файл загружается для обработки после завершения записи, а не передаётся модели во время разговора.
Транскрибация после записи
Обработка аудио как файла
Такой режим подходит для транскрипции интервью, лекций, архивных записей и других материалов, где не требуется вывод текста в момент произнесения. Документация QwenCloud перечисляет поддерживаемые форматы, ограничения длительности и способ постановки задачи в API; они могут зависеть от текущей версии интерфейса.
Поддержка языков и словаря
Диалекты, терминология и читабельная расшифровка
В релизе семейства ASR 3.0 отмечены семь крупных китайских диалектных групп, более двадцати региональных акцентов и 30 языков. Также заявлены контекстные подсказки, hotwords, улучшенная пунктуация и нормализация чисел, дат и денежных сумм. Для критически важных материалов расшифровку следует сверять с исходной записью.
Сравнение с другими ASR
Файловый и потоковый API решают разные задачи
Для распознавания ещё идущей речи предусмотрена Qwen-Audio-3.0-ASR-Flash-Streaming. Модель Qwen-Audio-3.0-ASR-Flash также предназначена для офлайн-транскрибации, но QwenCloud отдельно перечисляет обе версии и их идентификаторы.
Дата запуска
Модель API от 30 июля 2026 года
Официальный журнал относит Filetrans к выпуску Qwen-Audio-3.0-ASR 30 июля. Актуальные ограничения файла и стоимость нужно сверять в справке API перед загрузкой больших архивов.
Официальные источники: журнал моделей QwenCloud и руководство по распознаванию речи.
Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.