Phi-4 Reasoning Vision 15B

Phi-4 Reasoning Vision 15B — открытая мультимодальная модель Microsoft на 15 млрд параметров для анализа изображений и сложных задач рассуждения.

Microsoft Research объявила Phi-4 Reasoning Vision 15B 4 марта 2026 года. Это открытая модель на 15 млрд параметров, которая объединяет визуальное понимание и пошаговое рассуждение для задач с изображениями, интерфейсами, математикой и научными материалами.

Изображения и рассуждение

Визуальный вход влияет на ход решения

Модель принимает изображения и текстовые инструкции, а затем формирует ответ с возможностью рассуждения о визуальном содержимом. Microsoft отмечает сильные стороны в математике, науке, понимании интерфейсов и изображений. Официальная карточка весов опубликована как microsoft/Phi-4-reasoning-vision-15B.

Открытая исследовательская публикация

Модель, код и результаты обучения

Вместе с моделью Microsoft опубликовала технический отчёт, материалы для дообучения и результаты тестов. Статья разбирает подготовку данных, архитектурные решения и баланс между генерацией рассуждений и компактностью модели. Показатели разработчика относятся к его бенчмаркам и не являются гарантией для произвольного изображения или интерфейса.

Использование и ограничения

Проверяйте мелкие детали и выводы

Мультимодальное рассуждение может быть полезно для диаграмм, учебных задач и пользовательских интерфейсов, но модель способна неверно прочитать текст или сделать ошибочный вывод по изображению. В задачах управления компьютером она не заменяет безопасный исполнительный контур: права, подтверждение действий и журналирование задаёт приложение.

Данные и вычислительная эффективность

Визуальная модель на 15 млрд параметров

В техническом отчёте Microsoft описывает обучение на 200 млрд мультимодальных токенов с использованием базовых Phi-4 и Phi-4 Reasoning. Авторы рассматривают очистку данных, исправление ошибок, синтетическое расширение примеров и адаптивное разрешение изображений. Эти решения помогают модели анализировать изображения и документы без корпуса, сопоставимого с крупнейшими мультимодальными системами; это исследовательское наблюдение Microsoft, а не обещание одинаковой точности на всех задачах.

Изображения, документы и интерфейсы

От чтения чека до понимания экрана

В анонсе приведены задачи описания изображения, чтения документов и чеков, сравнения последовательности снимков, решения математических задач по фотографии и понимания элементов интерфейса. Модель может поддерживать агента, которому нужно определить, где расположен элемент экрана, но выполнение кликов и контроль действий относятся к приложению. Для мелкого текста, чисел и критичных команд требуется проверять распознанные данные и координаты.

Связанные модели и разработчик

Другие версии семейства Phi

Phi-3 Vision · Phi-3.5 Vision · Phi-4 Multimodal · Phi-4 Reasoning · Microsoft AI в Вики Futuretools

Первичные источники

Материалы Microsoft и карточки опубликованных весов

анонс Phi-4 Reasoning Vision 15B · технический отчёт Phi-4 Reasoning Vision 15B · официальные веса Phi-4 Reasoning Vision 15B