Phi-3.5 Vision

Phi-3.5 Vision — мультимодальная модель Microsoft для анализа изображений, последовательностей кадров и длинного визуального контекста.

Phi-3.5 Vision была объявлена 22 августа 2024 года. Модель на 4,2 млрд параметров принимает изображения вместе с текстом, а обновлённая версия поддерживает анализ нескольких кадров и изображений в одном контексте.

Несколько изображений

Сравнение кадров и визуальных материалов

В отличие от одиночного изображения в ранней Phi-3 Vision, версия 3.5 позволяет передавать несколько визуальных входов и сопоставлять их. Microsoft приводит сценарии поиска различий между кадрами и анализа последовательностей. Точная длина входа зависит от разрешения и обработки изображений, а веса опубликованы по адресу microsoft/Phi-3.5-vision-instruct.

Практическое применение

Документы, интерфейсы и визуальные вопросы

Модель можно использовать для предварительного анализа снимков экрана, диаграмм, таблиц и нескольких изображений. Она формирует текстовый ответ, но не гарантирует точное распознавание мелких подписей и цифр. Если вывод влияет на решение, сравнивайте его с исходным файлом или проверенной системой извлечения данных.

Доступность и ограничения

Разделяйте веса и облачные площадки

Microsoft выпустила открытые веса для разработчиков и позднее добавила облачный сервис в Azure. Доступность конкретного интерфейса менялась по времени и региону. Для локального использования нужны совместимые библиотеки и достаточная видеопамять; модель не является готовым приложением для анализа документов.

Несколько изображений и кадров

Сравнение визуальной последовательности

Phi-3.5 Vision обновила мультимодальную ветку Phi-3. Microsoft сообщила о работе с несколькими изображениями и последовательностями кадров, что расширяет сценарии за пределы вопроса об одной картинке. Например, можно сравнивать изменения между снимками или передавать подборку кадров из ролика. Модель всё равно получает конечное представление визуального материала, поэтому важные мелкие детали и временные различия требуют проверки.

Отличие от текстовой версии

Визуальный вход требует отдельной оценки

Веса Phi-3.5 Vision опубликованы отдельно от Phi-3.5 Mini. У этих моделей разная входная модальность и разное назначение: Mini обрабатывает текст, Vision — изображения вместе с текстом. Для анализа диаграмм, снимков документов или экранов это принципиальная разница. Если задача не требует изображений, текстовая версия может быть проще в размещении; если требует — точность нужно проверить на нужном разрешении и типе визуальных данных.

Связанные модели и разработчик

Другие версии семейства Phi

Phi-3 Vision · Phi-3.5 Mini · Phi-3.5 MoE · Phi-4 Multimodal · Microsoft AI в Вики Futuretools

Первичные источники

Материалы Microsoft и карточки опубликованных весов

анонс семейства Phi-3.5 от Microsoft Azure · веса Phi-3.5 Vision