Qwen2.5-VL
Модель Alibaba для анализа изображений, документов, графиков и видеозаписей.
Qwen2.5-VL — семейство моделей Alibaba для одновременной обработки текста и визуальных данных. Оно вышло 26 января 2025 года в размерах 3B, 7B и 72B, причём доступны базовые и настроенные для диалога версии. Модель анализирует не только отдельные объекты на снимке, но и документы, графики, схемы, значки и расположение элементов внутри изображения.
Изображения, документы и видео
Qwen Team заявила поддержку видео длительностью более часа и поиск конкретных событий внутри записи. Модель может указывать на объекты с помощью координат или рамок и возвращать структурированные данные, например содержимое счёта или таблицы. Это полезно для первичного разбора визуальных материалов, но распознавание важных сумм и условий следует проверять до переноса данных в финансовую или управленческую систему.
Визуальное управление и локальный запуск
Разработчик описывает Qwen2.5-VL как визуального агента, который способен направлять инструменты и выполнять задачи с компьютером или телефоном. Такие действия происходят только в среде, где приложению предоставлены нужные разрешения. Веса всех трёх размеров опубликованы для самостоятельного запуска; меньшие варианты требуют меньше ресурсов, тогда как 72B рассчитана на более сложную обработку.
Место в линейке Qwen
Qwen2.5-VL специализируется на изображениях и видео, тогда как базовая Qwen2.5 ориентирована на текст, а Qwen2.5-Coder — на разработку программ. Для математических вычислений существует отдельная Qwen2.5-Math. Сравнительные результаты в анонсе являются оценками команды Qwen и зависят от методики тестирования.
Сведения о разработчике и его моделях: Alibaba в Вики Futuretools.ru.
Официальный источник: материал разработчика.