Phi-3 Vision
Phi-3 Vision — мультимодальная модель Microsoft на 4,2 млрд параметров для анализа изображений и текста.
Microsoft объявила Phi-3 Vision на Build 21 мая 2024 года. Это открытая мультимодальная модель на 4,2 млрд параметров, которая принимает изображение вместе с текстовой инструкцией и формирует текстовый ответ.
- Понимание изображений
- Схемы, графики и визуальные вопросы
- Для каких задач подходит
- Анализ визуального материала с текстом
- Ограничения
- Ответ модели не равен распознанному оригиналу
- Как модель работает с изображениями
- Вопрос задаётся вместе с визуальным материалом
- Вариант Vision не равен Phi-3 Mini
- Отдельная модель с изображениями на входе
- Связанные модели и разработчик
- Другие версии семейства Phi
- Первичные источники
- Материалы Microsoft и карточки опубликованных весов
Понимание изображений
Схемы, графики и визуальные вопросы
Phi-3 Vision может отвечать на вопросы об изображении, разбирать графики и таблицы, сопоставлять несколько визуальных материалов и выполнять распознавание текста на изображениях. В опубликованной карточке опубликованы веса microsoft/Phi-3-vision-128k-instruct. Контекст включает текстовые и визуальные представления, поэтому фактический объём входа зависит от разрешения изображения и используемого обработчика.
Для каких задач подходит
Анализ визуального материала с текстом
Модель можно применять для предварительного разбора диаграмм, экранных снимков и документов, когда к изображению нужно задать вопрос. Результат зависит от читаемости мелких деталей, качества фотографии и формулировки запроса. Для точной проверки чисел, подписей и важных полей нужен исходный документ или отдельная проверка распознанного текста.
Ограничения
Ответ модели не равен распознанному оригиналу
Phi-3 Vision может неверно прочитать мелкий текст, спутать элементы таблицы или описать то, чего нет на изображении. При использовании в автоматизации следует сохранять связь ответа с исходной картинкой и проверять критичные выводы. Позднее Microsoft выпустила обновлённый вариант Phi-3.5 Vision с поддержкой нескольких кадров.
Как модель работает с изображениями
Вопрос задаётся вместе с визуальным материалом
Phi-3 Vision сочетает языковую модель с визуальным компонентом: на вход можно подать изображение и текстовый вопрос, а на выходе получить текстовый ответ. Microsoft отдельно упоминает понимание графиков, диаграмм и таблиц. Это делает модель пригодной для экспериментов с визуальными документами и снимками экрана. Результат зависит от читаемости изображения, масштаба подписей и того, насколько точно сформулирована задача.
Вариант Vision не равен Phi-3 Mini
Отдельная модель с изображениями на входе
Несмотря на близкие названия, Phi-3 Vision — самостоятельная мультимодальная версия на 4,2 млрд параметров, а не настройка текстовой Phi-3 Mini. Для неё опубликованы отдельные веса Instruct и отдельный модельный отчёт. В частности, вход включает визуальные токены, поэтому расход памяти и вычислений зависит не только от текста, но и от изображения. Для задач с несколькими кадрами позднее появилась Phi-3.5 Vision.
Связанные модели и разработчик
Другие версии семейства Phi
Phi-3 Mini · Phi-3 Small · Phi-3 Medium · Phi-3.5 Vision · Microsoft AI в Вики Futuretools
Первичные источники
Материалы Microsoft и карточки опубликованных весов
анонс Phi-3 Small, Medium и Vision на Microsoft Build · веса Phi-3 Vision