Phi-4 Multimodal
Phi-4 Multimodal — модель Microsoft для совместной обработки текста, изображений и речи в одном интерфейсе.
Microsoft выпустила Phi-4 Multimodal 26 февраля 2025 года как модель, объединяющую текст, изображения и речь. Она предназначена для задач, где приложению нужно одновременно учитывать несколько типов входных данных, а не только текст.
- Три модальности
- Текст, зрение и речь
- Возможные сценарии
- Интерфейсы, документы и голосовые приложения
- Доступность и ограничения
- Открытая модель требует интеграции
- Архитектура с несколькими входами
- Модальные компоненты связаны в одной модели
- Чем она отличается от Phi-4
- Не просто текстовая модель с добавленным распознаванием
- Связанные модели и разработчик
- Другие версии семейства Phi
- Первичные источники
- Материалы Microsoft и карточки опубликованных весов
Три модальности
Текст, зрение и речь
Модель принимает текстовые и визуальные данные и поддерживает аудиосценарии, включая распознавание и генерацию речи. В анонсе Microsoft описывает возможность обрабатывать модальности совместно в одном приложении. Модель с открытыми весами доступна под названием microsoft/Phi-4-multimodal-instruct; это отдельная модель, самостоятельная версия, а не дополнение базовой текстовой Phi-4 при запуске.
Возможные сценарии
Интерфейсы, документы и голосовые приложения
Phi-4 Multimodal может служить основой для голосового помощника, анализа изображения по вопросу и обработки документов с визуальными элементами. Компания приводит примеры голосового перевода и визуального вопроса-ответа. Для каждого сценария нужно проверить поддерживаемый формат входа и качество на целевом языке.
Доступность и ограничения
Открытая модель требует интеграции
При запуске Microsoft сообщила о доступности на Hugging Face, Azure AI Foundry и в каталоге NVIDIA API. Сам модель не предоставляет пользовательский интерфейс, автоматический переводчик или систему управления устройством. В приложении необходимо соединить обработку аудио и изображения, проверить задержки и отдельно учесть конфиденциальность записей.
Архитектура с несколькими входами
Модальные компоненты связаны в одной модели
В анонсе Microsoft описала Phi-4 Multimodal как модель размером 5,6 млрд параметров, построенную на смеси адаптеров LoRA для речи, зрения и языка. Это позволяет объединить работу с текстом, изображением и звуковыми сигналами в одной системе. В доступных сценариях есть распознавание и генерация речи, анализ изображений и обработка текста; точные форматы и последовательность входов зависят от опубликованной версии.
Чем она отличается от Phi-4
Не просто текстовая модель с добавленным распознаванием
Базовая Phi-4 принимает текст, а Multimodal предназначена для входов нескольких типов и использует отдельный набор весов. Microsoft указывает, что модальности обрабатываются в совместном представлении; поэтому эту модель можно использовать как основу для голосовых и визуальных приложений. Однако карточка весов сама по себе не является голосовым ассистентом: приложение должно захватить данные, передать их поддерживаемым способом и обработать ответ.
Связанные модели и разработчик
Другие версии семейства Phi
Phi-4 · Phi-4 Mini · Phi-3.5 Vision · Phi-4 Reasoning Vision 15B · Microsoft AI в Вики Futuretools