VibeVoice-TTS-1.5B

VibeVoice-TTS-1.5B генерирует длинную речь с несколькими голосами и сохранением очередности реплик.

Microsoft открыла VibeVoice-TTS 25 августа 2025 года как исследовательскую систему для синтеза длинной разговорной речи. Версия 1.5B объединяет языковую модель и генерацию акустического сигнала, чтобы создавать продолжительные записи с несколькими участниками и учитывать структуру диалога.

Длинная генерация

До 90 минут и четыре участника

По описанию Microsoft, VibeVoice-TTS-1.5B может формировать длинную речь продолжительностью до 90 минут и поддерживать до четырёх голосов в одном диалоге. Низкочастотные речевые токенизаторы сокращают последовательность, которую нужно обрабатывать, а модель генерирует аудио с учётом текста и очередности реплик. Это исследовательские максимумы, а не гарантия длительности на любом оборудовании.

Состав модели

Qwen2.5-1.5B и диффузионная аудиоголова

В карточке указано, что языковая часть основана на Qwen2.5-1.5B; диффузионная голова преобразует скрытые состояния в акустические признаки. Такой подход помогает сохранить контекст между репликами и управлять выразительностью. На практике генерация длинного файла требует достаточной памяти и времени, а качество зависит от языка и выбранного сценария.

Текущий статус

Исследовательский релиз с ограничениями

Microsoft удалила исходный код TTS из основного репозитория после обнаружения нежелательных способов использования. Компания оставила оговорку о необходимости ответственного применения синтетической речи. Поэтому перед интеграцией следует проверить действующую карточку модели, её условия и доступность, а не полагаться на старые инструкции репозитория.

Контроль использования

Не выдавайте синтез за запись человека

Генерация голосов может использоваться для введения слушателя в заблуждение. Внедряйте согласие на голосовое воспроизведение, маркировку синтетической речи и защиту от имитации без разрешения. VibeVoice-TTS следует оценивать на собственном тексте и языке; модель не гарантирует фактическую точность исходного сценария.

Связанные модели

Другие разработки Microsoft

VibeVoice-Realtime-0.5B · VibeVoice-ASR-7B · VibeVoice-ASR-Streaming-1.5B · MAI-Voice-2 · Microsoft AI в Вики Futuretools

Первичные источники

Материалы разработчика и официальные карточки моделей

официальный репозиторий VibeVoice с журналом релизов · исследование VibeVoice-TTS · официальная карточка VibeVoice-TTS-1.5B