Phi-4 Reasoning Vision 15B
Phi-4 Reasoning Vision 15B — открытая мультимодальная модель Microsoft на 15 млрд параметров для анализа изображений и сложных задач рассуждения.
Microsoft Research объявила Phi-4 Reasoning Vision 15B 4 марта 2026 года. Это открытая модель на 15 млрд параметров, которая объединяет визуальное понимание и пошаговое рассуждение для задач с изображениями, интерфейсами, математикой и научными материалами.
- Изображения и рассуждение
- Визуальный вход влияет на ход решения
- Открытая исследовательская публикация
- Модель, код и результаты обучения
- Использование и ограничения
- Проверяйте мелкие детали и выводы
- Данные и вычислительная эффективность
- Визуальная модель на 15 млрд параметров
- Изображения, документы и интерфейсы
- От чтения чека до понимания экрана
- Связанные модели и разработчик
- Другие версии семейства Phi
- Первичные источники
- Материалы Microsoft и карточки опубликованных весов
Изображения и рассуждение
Визуальный вход влияет на ход решения
Модель принимает изображения и текстовые инструкции, а затем формирует ответ с возможностью рассуждения о визуальном содержимом. Microsoft отмечает сильные стороны в математике, науке, понимании интерфейсов и изображений. Официальная карточка весов опубликована как microsoft/Phi-4-reasoning-vision-15B.
Открытая исследовательская публикация
Модель, код и результаты обучения
Вместе с моделью Microsoft опубликовала технический отчёт, материалы для дообучения и результаты тестов. Статья разбирает подготовку данных, архитектурные решения и баланс между генерацией рассуждений и компактностью модели. Показатели разработчика относятся к его бенчмаркам и не являются гарантией для произвольного изображения или интерфейса.
Использование и ограничения
Проверяйте мелкие детали и выводы
Мультимодальное рассуждение может быть полезно для диаграмм, учебных задач и пользовательских интерфейсов, но модель способна неверно прочитать текст или сделать ошибочный вывод по изображению. В задачах управления компьютером она не заменяет безопасный исполнительный контур: права, подтверждение действий и журналирование задаёт приложение.
Данные и вычислительная эффективность
Визуальная модель на 15 млрд параметров
В техническом отчёте Microsoft описывает обучение на 200 млрд мультимодальных токенов с использованием базовых Phi-4 и Phi-4 Reasoning. Авторы рассматривают очистку данных, исправление ошибок, синтетическое расширение примеров и адаптивное разрешение изображений. Эти решения помогают модели анализировать изображения и документы без корпуса, сопоставимого с крупнейшими мультимодальными системами; это исследовательское наблюдение Microsoft, а не обещание одинаковой точности на всех задачах.
Изображения, документы и интерфейсы
От чтения чека до понимания экрана
В анонсе приведены задачи описания изображения, чтения документов и чеков, сравнения последовательности снимков, решения математических задач по фотографии и понимания элементов интерфейса. Модель может поддерживать агента, которому нужно определить, где расположен элемент экрана, но выполнение кликов и контроль действий относятся к приложению. Для мелкого текста, чисел и критичных команд требуется проверять распознанные данные и координаты.
Связанные модели и разработчик
Другие версии семейства Phi
Phi-3 Vision · Phi-3.5 Vision · Phi-4 Multimodal · Phi-4 Reasoning · Microsoft AI в Вики Futuretools
Первичные источники
Материалы Microsoft и карточки опубликованных весов
анонс Phi-4 Reasoning Vision 15B · технический отчёт Phi-4 Reasoning Vision 15B · официальные веса Phi-4 Reasoning Vision 15B