AuK

AuK — открытая речевая модель Tencent на 1,5 млрд параметров для синтеза, редактирования и улучшения аудио.

AuK — открытая базовая модель Tencent для генерации и редактирования речи, опубликованная 9 сентября 2026 года. Единый интерфейс принимает текстовые инструкции и аудиоконтекст для нескольких речевых задач.

Речевые задачи

Синтез, редактирование и разделение источников

По официальному описанию, AuK поддерживает синтез речи по тексту с нуля и по инструкции, редактирование содержания и акустических характеристик, работу с просодией, улучшение речи и разделение аудиоисточников. Все эти задачи доступны через интерфейс естественно-языковых инструкций.

Размер и доступность

Открытые веса на Hugging Face и ModelScope

Tencent указывает размер 1,5 млрд параметров и публикует код и веса модели. Репозиторий содержит примеры запуска, обучение и варианты интеграции. Для более короткого четырёхшагового вывода разработчик также представил облегчённый вариант AuK-Flash.

Отличие от узких моделей

Один интерфейс для нескольких операций с аудио

AuK объединяет синтез и последующую обработку звука. Это не означает, что качество всех задач одинаково или что модель заменяет специализированные распознаватели: заявленный диапазон и ограничения нужно сверять с примерами и карточкой весов.

Дата, версия и источники

Проверка по материалам Tencent

Дата публикации карточки отражает указанное событие публичного выпуска или доступности версии. Примечание по датировке: Дата выпуска весов — 09.09.2026 по официальному разделу News репозитория. Источники: официальный репозиторий AuK; технический отчёт; карточку базовой модели.

Сведения о разработчике и его моделях: Tencent в Вики Futuretools.ru.