DeepSeek-VL2-Tiny

Компактная конфигурация DeepSeek-VL2 для визуальных вопросов, распознавания текста и понимания документов.

DeepSeek-VL2-Tiny — компактная мультимодальная модель из семейства DeepSeek-VL2, выпущенного 13 декабря 2024 года. Она связывает текстовый запрос с содержимым изображения и подходит для локального запуска при более скромном бюджете вычислений.

Распознавание текста и понимание изображений

Для VL2-Tiny разработчик заявляет те же типы задач, что и для семейства в целом: визуальные вопросы и ответы, распознавание текста, анализ документов, таблиц и диаграмм, а также локализацию объектов на изображении. Длина последовательности в репозитории указана как 4096 токенов. Результаты зависят от входного изображения и конфигурации запуска.

Размер модели и место в линейке

Для VL2-Tiny указано 1 млрд активируемых параметров. Модель построена по архитектуре Mixture-of-Experts: активируемые параметры описывают используемую часть модели при обработке запроса, а не полный размер всех весов. В том же семействе опубликованы VL2-Small с 2,8 млрд и полная VL2 с 4,5 млрд активируемых параметров.

Другие размеры VL2

Сопоставьте эту версию с вариантом среднего размера и полной моделью: DeepSeek-VL2-Small DeepSeek-VL2

Другие версии моделей DeepSeek собраны на странице разработчика в Вики Futuretools.ru.

Название, дата и функции сверены с официальным репозиторием DeepSeek. Дата выпуска, длина последовательности, число активируемых параметров и задачи основаны на официальном репозитории DeepSeek-VL2.