AuK
AuK — открытая речевая модель Tencent на 1,5 млрд параметров для синтеза, редактирования и улучшения аудио.
AuK — открытая базовая модель Tencent для генерации и редактирования речи, опубликованная 9 сентября 2026 года. Единый интерфейс принимает текстовые инструкции и аудиоконтекст для нескольких речевых задач.
Речевые задачи
Синтез, редактирование и разделение источников
По официальному описанию, AuK поддерживает синтез речи по тексту с нуля и по инструкции, редактирование содержания и акустических характеристик, работу с просодией, улучшение речи и разделение аудиоисточников. Все эти задачи доступны через интерфейс естественно-языковых инструкций.
Размер и доступность
Открытые веса на Hugging Face и ModelScope
Tencent указывает размер 1,5 млрд параметров и публикует код и веса модели. Репозиторий содержит примеры запуска, обучение и варианты интеграции. Для более короткого четырёхшагового вывода разработчик также представил облегчённый вариант AuK-Flash.
Отличие от узких моделей
Один интерфейс для нескольких операций с аудио
AuK объединяет синтез и последующую обработку звука. Это не означает, что качество всех задач одинаково или что модель заменяет специализированные распознаватели: заявленный диапазон и ограничения нужно сверять с примерами и карточкой весов.
Дата, версия и источники
Проверка по материалам Tencent
Дата публикации карточки отражает указанное событие публичного выпуска или доступности версии. Примечание по датировке: Дата выпуска весов — 09.09.2026 по официальному разделу News репозитория. Источники: официальный репозиторий AuK; технический отчёт; карточку базовой модели.
Сведения о разработчике и его моделях: Tencent в Вики Futuretools.ru.