Qwen-Audio-3.0-TTS-Flash
Qwen-Audio-3.0-TTS-Flash — модель Alibaba для быстрого синтеза речи из текста с потоковой выдачей аудио.
Qwen-Audio-3.0-TTS-Flash — облачная модель Alibaba для синтеза речи, выпущенная 14 июля 2026 года. Она принимает текст и генерирует звуковой ответ через потоковый API. QwenCloud позиционирует Flash-вариант для приложений, где важна низкая задержка.
Озвучивание текста
Голосовой результат и системные голоса
Для синтеза приложение передаёт текст и выбирает поддерживаемый голос. В документации QwenCloud описаны параметры речи, формат аудиоданных и список доступных голосов. Набор языков определяется голосовой конфигурацией; перед использованием, например, для японского или корейского важно выбрать голос с поддержкой нужного языка.
Скорость и управление голосом
Вариант Flash для более быстрой выдачи
В анонсе Qwen указывает Flash для сценариев с меньшей задержкой, а Plus — для более высокого качества в профессиональном синтезе. Qwen-Audio-3.0-TTS-Flash поддерживает потоковую передачу, но руководством ограничен однонаправленный режим: модель генерирует речь из текста, а не ведёт разговор с входным аудио в рамках той же TTS-сессии.
Сравнение с моделями распознавания
TTS создаёт речь, ASR превращает её в текст
Для расшифровки аудиозаписи предназначены модели Qwen-Audio-3.0-ASR-Flash и ASR Flash Streaming. Realtime-модель Qwen-Audio-3.0-Realtime-Flash решает задачу двустороннего голосового общения.
Дата выпуска и интерфейс
Сервис QwenCloud
Официальный журнал сообщает о запуске Qwen-Audio-3.0-TTS-Flash 14 июля 2026 года. Актуальные параметры API, форматы аудио и набор голосов следует сверять в документации разработчика.
Официальные источники: журнал QwenCloud и руководство по синтезу речи.
Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.