Qwen-Audio-3.0-TTS-Plus
Qwen-Audio-3.0-TTS-Plus — модель Alibaba для синтеза выразительной речи с поддержкой китайских диалектов и тонкой настройки произношения.
Qwen-Audio-3.0-TTS-Plus — облачная модель Alibaba для преобразования текста в речь. QwenCloud объявила её 14 июля 2026 года. В релизе компания выделила более выразительное звучание, улучшенное следование инструкциям и точную настройку характеристик голоса через специальные метки.
Синтез речи по тексту
Интонация, метки и языковые варианты
Модель озвучивает заданный текст выбранным голосом. Qwen сообщает о расширении поддержки языков и китайских диалектов, а также об управлении деталями генерации с помощью тегов. В документации доступны системные голоса и параметры поточной передачи аудио. Поддержка конкретного языка зависит от выбранного голоса.
Профиль Plus
Вариант для качества и профессионального синтеза
QwenCloud позиционирует Plus для сценариев, где важны качество звучания и выразительность. Для приложений, которым важнее короткая задержка, в той же линейке есть Qwen-Audio-3.0-TTS-Flash. Эти модели синтезируют речь из подготовленного текста, тогда как Realtime-линейка предназначена для диалогового обмена аудио.
Подключение и ограничения
Потоковый вывод через API
Руководство QwenCloud описывает потоковый WebSocket API для аудиосинтеза. Поддерживается односторонняя передача аудио: модель формирует голосовой ответ, но не ведёт в этой сессии двусторонний разговор. Для диалога можно рассмотреть Qwen-Audio-3.0-Realtime-Plus.
Дата запуска
Сервис появился в июле 2026 года
QwenCloud датирует релиз Qwen-Audio-3.0-TTS-Plus 14 июля 2026 года. В том же объявлении указана версия Flash.
Официальные источники: журнал релизов QwenCloud и руководство по потоковому синтезу речи.
Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.