Seed1.5-VL
Seed1.5-VL — мультимодальная модель ByteDance для анализа изображений, видео, графических интерфейсов и визуальных задач.
ByteDance представила Seed1.5-VL 13 мая 2025 года как модель, объединяющую обработку текста, изображений и видео. По данным разработчика, API уже был доступен на Volcano Engine при публикации материала. Модель также рассчитана на задачи с графическими интерфейсами и визуальным рассуждением, поэтому её можно рассматривать для систем, которым нужно не только распознать картинку, но и объяснить содержимое или выбрать действие.
- Как устроена модель
- Зрительный кодировщик и языковая часть
- Изображения, ролики и интерфейсы
- Модель решает задачи по визуальному контексту
- Ограничения распознавания
- Мелкие детали и сложные отношения требуют контроля
- Доступ к модели
- API открыт, веса не представлены в этом релизе
- Связанные модели и разработчик
- Другие публикации команды ByteDance Seed
- Первичные источники
- Анонсы, карточки и репозитории разработчика
Как устроена модель
Зрительный кодировщик и языковая часть
В опубликованном описании Seed1.5-VL состоит из зрительного кодировщика SeedViT примерно на 532 млн параметров, адаптера для переноса визуальных признаков и MoE-языковой модели с 20 млрд активных параметров. Разработчик указывает обучение более чем на 3 трлн мультимодальных токенов. Эти размеры описывают архитектуру конкретного релиза и не означают, что всю систему можно считать одной открытой моделью для локального запуска.
Изображения, ролики и интерфейсы
Модель решает задачи по визуальному контексту
Seed1.5-VL предназначена для вопросов по изображениям, чтения диаграмм, визуальной локализации и подсчёта, понимания коротких и длинных видео, а также взаимодействия с GUI. ByteDance приводит собственные результаты на открытых наборах: по заявлению команды, модель получила лучшие оценки на 38 из 60 бенчмарков. Это статистика разработчика; она не заменяет практическую проверку на ваших изображениях, языке и интерфейсах.
Ограничения распознавания
Мелкие детали и сложные отношения требуют контроля
В документации перечислены слабые места: точный подсчёт объектов, поиск визуальных различий, объяснение сложных пространственных отношений и восстановление порядка событий в видео. Модель также может делать неподтверждённые предположения в задачах с несколькими шагами. Для автоматизированных действий в браузере или приложении необходимы ограничения прав и подтверждение критических операций человеком.
Доступ к модели
API открыт, веса не представлены в этом релизе
В анонсе ByteDance предложила API через Volcano Engine с именем doubao-1-5-thinking-vision-pro-250428 и опубликовала исследовательский код и технический отчёт. Перед интеграцией следует проверить актуальный статус endpoint и требования к изображениям и видео. Связанные поколения Seed1.6 и Seed1.8 опубликованы в каталоге Futuretools отдельно.
Связанные модели и разработчик
Другие публикации команды ByteDance Seed
Seed1.6 · Seed1.6 Thinking · Seed1.8 · UI-TARS 1.5 · Seed-1.6-Embedding · ByteDance Seed в Вики Futuretools
Первичные источники
Анонсы, карточки и репозитории разработчика
анонс Seed1.5-VL и технического отчёта · официальная страница Seed1.5-VL · официальный репозиторий Seed1.5-VL