VibeVoice-Realtime-0.5B
VibeVoice-Realtime-0.5B — компактная модель Microsoft для потокового синтеза речи с низкой задержкой.
Microsoft опубликовала VibeVoice-Realtime-0.5B 3 декабря 2025 года для сценариев, где речь нужно создавать одновременно с поступлением текста. Модель рассчитана на потоковую подачу фрагментов и короткую задержку до первого звука, сохраняя возможность продолжать генерацию достаточно длинного аудио.
- Синтез в реальном времени
- Текст поступает постепенно
- Размер и основа
- 0,5 млрд параметров
- Интеграция
- Модельный checkpoint не является телефонией
- Ответственное применение
- Голос может быть ошибочно принят за настоящий
- Связанные модели
- Другие разработки Microsoft
- Первичные источники
- Материалы разработчика и официальные карточки моделей
Синтез в реальном времени
Текст поступает постепенно
Realtime-версия может начинать воспроизведение до того, как готов весь текст. Microsoft указывает примерно 300 мс до первого слышимого фрагмента в описанном режиме и поддерживает генерацию длинной речи до примерно десяти минут. Фактическая задержка зависит от устройства, нагрузки и конфигурации вывода.
Размер и основа
0,5 млрд параметров
Компактная версия рассчитана на более лёгкий запуск, чем модели для длинных подкастов. Её языковая основа — Qwen2.5-0.5B; отдельная аудиоголова синтезирует акустические признаки. На дату первоначального релиза Microsoft описывала одноголосый вывод и систему заранее заданных голосовых характеристик.
Интеграция
Модельный checkpoint не является телефонией
Весы доступны на Hugging Face под лицензией MIT; официальный репозиторий содержит пример запуска и Colab. Для живого голосового интерфейса разработчику всё равно нужно соединить генератор с обработкой потока, пользовательскими репликами, прерыванием и воспроизведением. Модель сама не управляет звонком и не распознаёт речь собеседника.
Ответственное применение
Голос может быть ошибочно принят за настоящий
Синтетическая речь способна создавать риск имитации личности. Нужны явное согласие на использование голоса, маркировка и ограничения на голосовые профили. Не следует использовать сгенерированный аудиофайл для утверждения факта, который модель не проверяла.
Связанные модели
Другие разработки Microsoft
VibeVoice-TTS-1.5B · VibeVoice-ASR-7B · VibeVoice-ASR-Streaming-1.5B · MAI-Voice-2 Flash · Microsoft AI в Вики Futuretools
Первичные источники
Материалы разработчика и официальные карточки моделей
описание потоковой генерации VibeVoice-Realtime · официальный репозиторий VibeVoice с журналом релизов · официальная карточка VibeVoice-Realtime-0.5B