Qwen-Audio-3.0-TTS-Plus

Qwen-Audio-3.0-TTS-Plus — модель Alibaba для синтеза выразительной речи с поддержкой китайских диалектов и тонкой настройки произношения.

Qwen-Audio-3.0-TTS-Plus — облачная модель Alibaba для преобразования текста в речь. QwenCloud объявила её 14 июля 2026 года. В релизе компания выделила более выразительное звучание, улучшенное следование инструкциям и точную настройку характеристик голоса через специальные метки.

Синтез речи по тексту

Интонация, метки и языковые варианты

Модель озвучивает заданный текст выбранным голосом. Qwen сообщает о расширении поддержки языков и китайских диалектов, а также об управлении деталями генерации с помощью тегов. В документации доступны системные голоса и параметры поточной передачи аудио. Поддержка конкретного языка зависит от выбранного голоса.

Профиль Plus

Вариант для качества и профессионального синтеза

QwenCloud позиционирует Plus для сценариев, где важны качество звучания и выразительность. Для приложений, которым важнее короткая задержка, в той же линейке есть Qwen-Audio-3.0-TTS-Flash. Эти модели синтезируют речь из подготовленного текста, тогда как Realtime-линейка предназначена для диалогового обмена аудио.

Подключение и ограничения

Потоковый вывод через API

Руководство QwenCloud описывает потоковый WebSocket API для аудиосинтеза. Поддерживается односторонняя передача аудио: модель формирует голосовой ответ, но не ведёт в этой сессии двусторонний разговор. Для диалога можно рассмотреть Qwen-Audio-3.0-Realtime-Plus.

Дата запуска

Сервис появился в июле 2026 года

QwenCloud датирует релиз Qwen-Audio-3.0-TTS-Plus 14 июля 2026 года. В том же объявлении указана версия Flash.

Официальные источники: журнал релизов QwenCloud и руководство по потоковому синтезу речи.

Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.