Seed1.5-VL

Seed1.5-VL — мультимодальная модель ByteDance для анализа изображений, видео, графических интерфейсов и визуальных задач.

ByteDance представила Seed1.5-VL 13 мая 2025 года как модель, объединяющую обработку текста, изображений и видео. По данным разработчика, API уже был доступен на Volcano Engine при публикации материала. Модель также рассчитана на задачи с графическими интерфейсами и визуальным рассуждением, поэтому её можно рассматривать для систем, которым нужно не только распознать картинку, но и объяснить содержимое или выбрать действие.

Как устроена модель

Зрительный кодировщик и языковая часть

В опубликованном описании Seed1.5-VL состоит из зрительного кодировщика SeedViT примерно на 532 млн параметров, адаптера для переноса визуальных признаков и MoE-языковой модели с 20 млрд активных параметров. Разработчик указывает обучение более чем на 3 трлн мультимодальных токенов. Эти размеры описывают архитектуру конкретного релиза и не означают, что всю систему можно считать одной открытой моделью для локального запуска.

Изображения, ролики и интерфейсы

Модель решает задачи по визуальному контексту

Seed1.5-VL предназначена для вопросов по изображениям, чтения диаграмм, визуальной локализации и подсчёта, понимания коротких и длинных видео, а также взаимодействия с GUI. ByteDance приводит собственные результаты на открытых наборах: по заявлению команды, модель получила лучшие оценки на 38 из 60 бенчмарков. Это статистика разработчика; она не заменяет практическую проверку на ваших изображениях, языке и интерфейсах.

Ограничения распознавания

Мелкие детали и сложные отношения требуют контроля

В документации перечислены слабые места: точный подсчёт объектов, поиск визуальных различий, объяснение сложных пространственных отношений и восстановление порядка событий в видео. Модель также может делать неподтверждённые предположения в задачах с несколькими шагами. Для автоматизированных действий в браузере или приложении необходимы ограничения прав и подтверждение критических операций человеком.

Доступ к модели

API открыт, веса не представлены в этом релизе

В анонсе ByteDance предложила API через Volcano Engine с именем doubao-1-5-thinking-vision-pro-250428 и опубликовала исследовательский код и технический отчёт. Перед интеграцией следует проверить актуальный статус endpoint и требования к изображениям и видео. Связанные поколения Seed1.6 и Seed1.8 опубликованы в каталоге Futuretools отдельно.

Связанные модели и разработчик

Другие публикации команды ByteDance Seed

Seed1.6 · Seed1.6 Thinking · Seed1.8 · UI-TARS 1.5 · Seed-1.6-Embedding · ByteDance Seed в Вики Futuretools

Первичные источники

Анонсы, карточки и репозитории разработчика

анонс Seed1.5-VL и технического отчёта · официальная страница Seed1.5-VL · официальный репозиторий Seed1.5-VL