MAI-Voice-2

Модель Microsoft для генерации речи с новыми голосами и расширенной поддержкой языков.

MAI-Voice-2 — модель Microsoft AI для синтеза речи, то есть создания аудиозаписи по заданному тексту. 2 июня 2026 года Microsoft сообщила о её расширении: добавлены новые варианты голосов и более 15 дополнительных языков.

Генерация речи для цифровых продуктов

Синтез речи может использоваться в голосовых помощниках, озвучивании материалов и приложениях, где текст нужно прослушать. Выбор голоса и языка зависит от того, какие параметры предоставляет конкретный сервис. Сам анонс Microsoft не указывает полного перечня языков и не даёт оснований считать качество одинаковым для каждого языка.

Доступ и скоростная версия

MAI-Voice-2 стала частью набора моделей Microsoft AI и распространяется через поддерживаемые продукты компании. Для приложений, где задержка важнее гибкости, выпущена MAI-Voice-2 Flash. Доступность и условия использования необходимо сверять с текущей документацией Foundry.

Что учитывать при внедрении

Перед публикацией синтезированной речи стоит проверить произношение имён, чисел и отраслевых терминов, а также убедиться, что использование голоса соответствует правилам сервиса и правам на материалы.

Сведения о разработчике и его моделях: Microsoft AI в Вики Futuretools.ru.

Официальный источник: материал разработчика.