Qwen-Audio-3.0-TTS-Flash

Qwen-Audio-3.0-TTS-Flash — модель Alibaba для быстрого синтеза речи из текста с потоковой выдачей аудио.

Qwen-Audio-3.0-TTS-Flash — облачная модель Alibaba для синтеза речи, выпущенная 14 июля 2026 года. Она принимает текст и генерирует звуковой ответ через потоковый API. QwenCloud позиционирует Flash-вариант для приложений, где важна низкая задержка.

Озвучивание текста

Голосовой результат и системные голоса

Для синтеза приложение передаёт текст и выбирает поддерживаемый голос. В документации QwenCloud описаны параметры речи, формат аудиоданных и список доступных голосов. Набор языков определяется голосовой конфигурацией; перед использованием, например, для японского или корейского важно выбрать голос с поддержкой нужного языка.

Скорость и управление голосом

Вариант Flash для более быстрой выдачи

В анонсе Qwen указывает Flash для сценариев с меньшей задержкой, а Plus — для более высокого качества в профессиональном синтезе. Qwen-Audio-3.0-TTS-Flash поддерживает потоковую передачу, но руководством ограничен однонаправленный режим: модель генерирует речь из текста, а не ведёт разговор с входным аудио в рамках той же TTS-сессии.

Сравнение с моделями распознавания

TTS создаёт речь, ASR превращает её в текст

Для расшифровки аудиозаписи предназначены модели Qwen-Audio-3.0-ASR-Flash и ASR Flash Streaming. Realtime-модель Qwen-Audio-3.0-Realtime-Flash решает задачу двустороннего голосового общения.

Дата выпуска и интерфейс

Сервис QwenCloud

Официальный журнал сообщает о запуске Qwen-Audio-3.0-TTS-Flash 14 июля 2026 года. Актуальные параметры API, форматы аудио и набор голосов следует сверять в документации разработчика.

Официальные источники: журнал QwenCloud и руководство по синтезу речи.

Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.