Phi-3 Vision

Phi-3 Vision — мультимодальная модель Microsoft на 4,2 млрд параметров для анализа изображений и текста.

Microsoft объявила Phi-3 Vision на Build 21 мая 2024 года. Это открытая мультимодальная модель на 4,2 млрд параметров, которая принимает изображение вместе с текстовой инструкцией и формирует текстовый ответ.

Понимание изображений

Схемы, графики и визуальные вопросы

Phi-3 Vision может отвечать на вопросы об изображении, разбирать графики и таблицы, сопоставлять несколько визуальных материалов и выполнять распознавание текста на изображениях. В опубликованной карточке опубликованы веса microsoft/Phi-3-vision-128k-instruct. Контекст включает текстовые и визуальные представления, поэтому фактический объём входа зависит от разрешения изображения и используемого обработчика.

Для каких задач подходит

Анализ визуального материала с текстом

Модель можно применять для предварительного разбора диаграмм, экранных снимков и документов, когда к изображению нужно задать вопрос. Результат зависит от читаемости мелких деталей, качества фотографии и формулировки запроса. Для точной проверки чисел, подписей и важных полей нужен исходный документ или отдельная проверка распознанного текста.

Ограничения

Ответ модели не равен распознанному оригиналу

Phi-3 Vision может неверно прочитать мелкий текст, спутать элементы таблицы или описать то, чего нет на изображении. При использовании в автоматизации следует сохранять связь ответа с исходной картинкой и проверять критичные выводы. Позднее Microsoft выпустила обновлённый вариант Phi-3.5 Vision с поддержкой нескольких кадров.

Как модель работает с изображениями

Вопрос задаётся вместе с визуальным материалом

Phi-3 Vision сочетает языковую модель с визуальным компонентом: на вход можно подать изображение и текстовый вопрос, а на выходе получить текстовый ответ. Microsoft отдельно упоминает понимание графиков, диаграмм и таблиц. Это делает модель пригодной для экспериментов с визуальными документами и снимками экрана. Результат зависит от читаемости изображения, масштаба подписей и того, насколько точно сформулирована задача.

Вариант Vision не равен Phi-3 Mini

Отдельная модель с изображениями на входе

Несмотря на близкие названия, Phi-3 Vision — самостоятельная мультимодальная версия на 4,2 млрд параметров, а не настройка текстовой Phi-3 Mini. Для неё опубликованы отдельные веса Instruct и отдельный модельный отчёт. В частности, вход включает визуальные токены, поэтому расход памяти и вычислений зависит не только от текста, но и от изображения. Для задач с несколькими кадрами позднее появилась Phi-3.5 Vision.

Связанные модели и разработчик

Другие версии семейства Phi

Phi-3 Mini · Phi-3 Small · Phi-3 Medium · Phi-3.5 Vision · Microsoft AI в Вики Futuretools

Первичные источники

Материалы Microsoft и карточки опубликованных весов

анонс Phi-3 Small, Medium и Vision на Microsoft Build · веса Phi-3 Vision