Qwen2.5-VL

Модель Alibaba для анализа изображений, документов, графиков и видеозаписей.

Qwen2.5-VL — семейство моделей Alibaba для одновременной обработки текста и визуальных данных. Оно вышло 26 января 2025 года в размерах 3B, 7B и 72B, причём доступны базовые и настроенные для диалога версии. Модель анализирует не только отдельные объекты на снимке, но и документы, графики, схемы, значки и расположение элементов внутри изображения.

Изображения, документы и видео

Qwen Team заявила поддержку видео длительностью более часа и поиск конкретных событий внутри записи. Модель может указывать на объекты с помощью координат или рамок и возвращать структурированные данные, например содержимое счёта или таблицы. Это полезно для первичного разбора визуальных материалов, но распознавание важных сумм и условий следует проверять до переноса данных в финансовую или управленческую систему.

Визуальное управление и локальный запуск

Разработчик описывает Qwen2.5-VL как визуального агента, который способен направлять инструменты и выполнять задачи с компьютером или телефоном. Такие действия происходят только в среде, где приложению предоставлены нужные разрешения. Веса всех трёх размеров опубликованы для самостоятельного запуска; меньшие варианты требуют меньше ресурсов, тогда как 72B рассчитана на более сложную обработку.

Место в линейке Qwen

Qwen2.5-VL специализируется на изображениях и видео, тогда как базовая Qwen2.5 ориентирована на текст, а Qwen2.5-Coder — на разработку программ. Для математических вычислений существует отдельная Qwen2.5-Math. Сравнительные результаты в анонсе являются оценками команды Qwen и зависят от методики тестирования.

Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.

Официальный источник: материал разработчика.