VibeVoice-TTS-1.5B
VibeVoice-TTS-1.5B генерирует длинную речь с несколькими голосами и сохранением очередности реплик.
Microsoft открыла VibeVoice-TTS 25 августа 2025 года как исследовательскую систему для синтеза длинной разговорной речи. Версия 1.5B объединяет языковую модель и генерацию акустического сигнала, чтобы создавать продолжительные записи с несколькими участниками и учитывать структуру диалога.
- Длинная генерация
- До 90 минут и четыре участника
- Состав модели
- Qwen2.5-1.5B и диффузионная аудиоголова
- Текущий статус
- Исследовательский релиз с ограничениями
- Контроль использования
- Не выдавайте синтез за запись человека
- Связанные модели
- Другие разработки Microsoft
- Первичные источники
- Материалы разработчика и официальные карточки моделей
Длинная генерация
До 90 минут и четыре участника
По описанию Microsoft, VibeVoice-TTS-1.5B может формировать длинную речь продолжительностью до 90 минут и поддерживать до четырёх голосов в одном диалоге. Низкочастотные речевые токенизаторы сокращают последовательность, которую нужно обрабатывать, а модель генерирует аудио с учётом текста и очередности реплик. Это исследовательские максимумы, а не гарантия длительности на любом оборудовании.
Состав модели
Qwen2.5-1.5B и диффузионная аудиоголова
В карточке указано, что языковая часть основана на Qwen2.5-1.5B; диффузионная голова преобразует скрытые состояния в акустические признаки. Такой подход помогает сохранить контекст между репликами и управлять выразительностью. На практике генерация длинного файла требует достаточной памяти и времени, а качество зависит от языка и выбранного сценария.
Текущий статус
Исследовательский релиз с ограничениями
Microsoft удалила исходный код TTS из основного репозитория после обнаружения нежелательных способов использования. Компания оставила оговорку о необходимости ответственного применения синтетической речи. Поэтому перед интеграцией следует проверить действующую карточку модели, её условия и доступность, а не полагаться на старые инструкции репозитория.
Контроль использования
Не выдавайте синтез за запись человека
Генерация голосов может использоваться для введения слушателя в заблуждение. Внедряйте согласие на голосовое воспроизведение, маркировку синтетической речи и защиту от имитации без разрешения. VibeVoice-TTS следует оценивать на собственном тексте и языке; модель не гарантирует фактическую точность исходного сценария.
Связанные модели
Другие разработки Microsoft
VibeVoice-Realtime-0.5B · VibeVoice-ASR-7B · VibeVoice-ASR-Streaming-1.5B · MAI-Voice-2 · Microsoft AI в Вики Futuretools
Первичные источники
Материалы разработчика и официальные карточки моделей
официальный репозиторий VibeVoice с журналом релизов · исследование VibeVoice-TTS · официальная карточка VibeVoice-TTS-1.5B