DeepSeek-VL2

DeepSeek-VL2 — открытая мультимодальная модель для анализа изображений, документов, таблиц и диаграмм.

DeepSeek представила семейство DeepSeek-VL2 13 декабря 2024 года. Базовая модель принимает изображение вместе с текстовым запросом и отвечает на вопросы о содержимом, включая сложные визуальные документы.

Какие задачи решает модель

Официальный репозиторий перечисляет визуальные вопросы и ответы, распознавание текста, анализ документов, таблиц и диаграмм, а также визуальную локализацию объектов. Для каждой из трёх конфигураций указана длина последовательности 4096 токенов. Веса доступны для самостоятельного запуска, а требования к памяти и скорости зависят от оборудования и используемого программного обеспечения.

Параметры полной версии

DeepSeek-VL2 — крупнейший вариант семейства: в официальной карточке для него указано 4,5 млрд активируемых параметров. Это MoE-модель, поэтому активируемое число параметров не следует путать с общим размером весов. Для более ограниченных ресурсов предназначены VL2-Small (2,8 млрд активируемых параметров) и VL2-Tiny (1 млрд).

Сравните варианты

Для меньшей конфигурации откройте DeepSeek-VL2-Small DeepSeek-VL2-Tiny

Другие версии моделей DeepSeek собраны на странице разработчика в Вики Futuretools.ru.

Название, дата и функции сверены с официальным репозиторием DeepSeek. Дата выпуска, длина последовательности, число активируемых параметров и список трёх вариантов указаны в официальном репозитории DeepSeek-VL2.