Qwen-Audio-3.0-ASR-Flash-Streaming
Qwen-Audio-3.0-ASR-Flash-Streaming — модель Qwen для распознавания речи по мере поступления аудиопотока.
Qwen-Audio-3.0-ASR-Flash-Streaming — модель Alibaba для распознавания речи в режиме реального времени. QwenCloud выпустила её 30 июля 2026 года вместе с файловыми вариантами ASR. Сервис возвращает текст по мере поступления аудио, поэтому подходит для прямых субтитров, голосового ввода и транскрибации встреч.
Распознавание потоковой речи
Текст появляется до завершения записи
Документация QwenCloud описывает streaming-вариант для WebSocket-подключения с передачей аудио и получением текста. В модели доступны языки и региональные варианты, перечисленные в руководстве. Для китайского разработчик указывает семь основных групп диалектов и более двадцати региональных акцентов.
Термины и формат текста
Контекст, горячие слова и нормализация
Qwen сообщает о поддержке подсказок-контекста и hotwords для специализированной лексики. Релиз также отмечает улучшение расстановки знаков препинания и нормализации дат, чисел и денежных сумм. Модель может распознавать ошибочно или неоднозначно произнесённые слова, поэтому важные записи требуется вычитывать.
Когда выбрать потоковый вариант
Streaming вместо обработки готового файла
Если запись уже завершена, можно использовать Qwen-Audio-3.0-ASR-Flash-Filetrans или Qwen-Audio-3.0-ASR-Flash. Для голосового диалога, где модель отвечает речью, предназначена отдельная Qwen-Audio-3.0-Realtime-Plus.
Дата и документация
Публикация сервисной модели
QwenCloud датирует выпуск потоковой ASR-модели 30 июля 2026 года. Руководство отдельно описывает требования к аудио и выбор между распознаванием в реальном времени и обработкой файла.
Официальные источники: журнал моделей QwenCloud и руководство по распознаванию речи.
Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.