Doubao Realtime Voice
Doubao Realtime Voice — сквозная голосовая модель ByteDance для естественных диалогов с низкой задержкой.
ByteDance запустила Doubao Realtime Voice Model 20 января 2025 года и сразу сделала модель доступной в приложении Doubao. Это речевая система типа Speech-to-Speech: она принимает голос, понимает сказанное и генерирует устный ответ без отдельного преобразования всей речи в текст и обратно через набор независимых сервисов.
- Речь на входе и выходе
- Естественный диалог вместо цепочки конвертеров
- Языковая поддержка
- При запуске — преимущественно китайский контекст
- Доступ и развитие
- Модель позже обновили до Seeduplex
- Подходит для каких задач
- Голосовые интерфейсы и разговорные системы
- Связанные модели и разработчик
- Другие публикации команды ByteDance Seed
- Первичные источники
- Анонсы, карточки и репозитории разработчика
Речь на входе и выходе
Естественный диалог вместо цепочки конвертеров
Модель объединяет распознавание речи и генерацию ответа в сквозной архитектуре. По описанию ByteDance, такой подход помогает сохранять выразительность голоса, учитывать эмоции и плавнее реагировать на перебивания. Компания также указывает около 700 миллисекунд задержки базовой модели в своей конфигурации; реальная задержка приложения зависит от сети, устройства и полного серверного пути.
Языковая поддержка
При запуске — преимущественно китайский контекст
В официальном анонсе сказано, что версия была прежде всего рассчитана на китайскую речь и сценарии. Английский диалог поддерживался, но многоязычное переключение в одном разговоре тогда не было доступно. Эти сведения описывают дату запуска; актуальную языковую поддержку следует проверять в нынешнем приложении и документации.
Доступ и развитие
Модель позже обновили до Seeduplex
На старте голосовая модель появилась в Doubao App версии 7.2.0. Позже ByteDance сообщила об обновлении голосового взаимодействия до Seeduplex — отдельной модели с полнодуплексной архитектурой. Поэтому эту карточку следует рассматривать как исторический релиз, а не описание текущего голосового режима приложения.
Подходит для каких задач
Голосовые интерфейсы и разговорные системы
Архитектура ориентирована на голосовые ответы и живой диалог, в котором важно не только содержание, но и ритм речи. Для интеграции в собственный продукт необходимо проверить, доступна ли именно эта версия по API: анонс 2025 года подтверждал запуск в потребительском приложении, но сам по себе не подтверждал открытый API для сторонних разработчиков.
Связанные модели и разработчик
Другие публикации команды ByteDance Seed
Seed Audio 1.0 · SeedRealtime · Seed1.8 · Seed 2.0 · ByteDance Seed в Вики Futuretools
Первичные источники
Анонсы, карточки и репозитории разработчика
анонс Doubao Realtime Voice · официальная страница Doubao Realtime Voice