Phi-4 Multimodal

Phi-4 Multimodal — модель Microsoft для совместной обработки текста, изображений и речи в одном интерфейсе.

Microsoft выпустила Phi-4 Multimodal 26 февраля 2025 года как модель, объединяющую текст, изображения и речь. Она предназначена для задач, где приложению нужно одновременно учитывать несколько типов входных данных, а не только текст.

Три модальности

Текст, зрение и речь

Модель принимает текстовые и визуальные данные и поддерживает аудиосценарии, включая распознавание и генерацию речи. В анонсе Microsoft описывает возможность обрабатывать модальности совместно в одном приложении. Модель с открытыми весами доступна под названием microsoft/Phi-4-multimodal-instruct; это отдельная модель, самостоятельная версия, а не дополнение базовой текстовой Phi-4 при запуске.

Возможные сценарии

Интерфейсы, документы и голосовые приложения

Phi-4 Multimodal может служить основой для голосового помощника, анализа изображения по вопросу и обработки документов с визуальными элементами. Компания приводит примеры голосового перевода и визуального вопроса-ответа. Для каждого сценария нужно проверить поддерживаемый формат входа и качество на целевом языке.

Доступность и ограничения

Открытая модель требует интеграции

При запуске Microsoft сообщила о доступности на Hugging Face, Azure AI Foundry и в каталоге NVIDIA API. Сам модель не предоставляет пользовательский интерфейс, автоматический переводчик или систему управления устройством. В приложении необходимо соединить обработку аудио и изображения, проверить задержки и отдельно учесть конфиденциальность записей.

Архитектура с несколькими входами

Модальные компоненты связаны в одной модели

В анонсе Microsoft описала Phi-4 Multimodal как модель размером 5,6 млрд параметров, построенную на смеси адаптеров LoRA для речи, зрения и языка. Это позволяет объединить работу с текстом, изображением и звуковыми сигналами в одной системе. В доступных сценариях есть распознавание и генерация речи, анализ изображений и обработка текста; точные форматы и последовательность входов зависят от опубликованной версии.

Чем она отличается от Phi-4

Не просто текстовая модель с добавленным распознаванием

Базовая Phi-4 принимает текст, а Multimodal предназначена для входов нескольких типов и использует отдельный набор весов. Microsoft указывает, что модальности обрабатываются в совместном представлении; поэтому эту модель можно использовать как основу для голосовых и визуальных приложений. Однако карточка весов сама по себе не является голосовым ассистентом: приложение должно захватить данные, передать их поддерживаемым способом и обработать ответ.

Связанные модели и разработчик

Другие версии семейства Phi

Phi-4 · Phi-4 Mini · Phi-3.5 Vision · Phi-4 Reasoning Vision 15B · Microsoft AI в Вики Futuretools

Первичные источники

Материалы Microsoft и карточки опубликованных весов

анонс Phi-4 Mini и Phi-4 Multimodal · веса Phi-4 Multimodal