Phi-4 Mini Flash Reasoning
Phi-4 Mini Flash Reasoning — компактная модель Microsoft для быстрых рассуждений с гибридной архитектурой SambaY.
Microsoft представила Phi-4 Mini Flash Reasoning 9 июля 2025 года для сценариев, где важны низкая задержка, ограниченная память и многошаговая логика. Это 3,8-миллиардная модель, построенная на гибридной архитектуре SambaY.
- Гибридная архитектура
- SambaY сочетает внимание и блоки памяти
- Рассуждения на малом устройстве
- Математика и интерактивные ответы
- Когда выбирать Flash
- Сравните скорость и качество
- Что Microsoft называет SambaY
- Внимание и блоки памяти в одной архитектуре
- Как оценивать производительность
- Сравнивайте на одинаковом оборудовании
- Связанные модели и разработчик
- Другие версии семейства Phi
- Первичные источники
- Материалы Microsoft и карточки опубликованных весов
Гибридная архитектура
SambaY сочетает внимание и блоки памяти
Microsoft описывает модель как decoder-hybrid-decoder с блоками Gated Memory Unit. В архитектуре сочетаются Mamba, оконное внимание и перекрёстное внимание. Компания заявляет до десятикратного роста пропускной способности и среднее сокращение задержки в два-три раза относительно предшественника; эти цифры зависят от конкретной конфигурации и теста.
Рассуждения на малом устройстве
Математика и интерактивные ответы
Phi-4 Mini Flash Reasoning оптимизирована для математических и логических запросов и поддерживает контекст до 64 тысяч токенов. Microsoft указывает на развёртывание в Azure AI Foundry, каталоге NVIDIA API и Hugging Face. Локальную задержку необходимо измерять на целевом устройстве; сама модель не включает интерфейс приложения или инструменты.
Когда выбирать Flash
Сравните скорость и качество
Более высокая пропускная способность может быть полезна для учебных приложений и интерактивных помощников, где система отвечает в ходе диалога. При этом результаты следует сравнить с Phi-4 Mini Reasoning на собственных задачах. Для критических вычислений необходима независимая проверка.
Что Microsoft называет SambaY
Внимание и блоки памяти в одной архитектуре
В публикации Microsoft описана гибридная схема, в которой чередуются обычные трансформерные блоки и блоки Gated Memory Unit. Авторы связывают её с Mamba и оконным вниманием. Модель содержит 3,8 млрд параметров и поддерживает контекст до 64K. В компании заявили о пропускной способности до десяти раз выше и среднем сокращении задержки в два-три раза относительно предыдущего варианта, но это измерения Microsoft, а не гарантия для любого устройства.
Как оценивать производительность
Сравнивайте на одинаковом оборудовании
Эффект от гибридной архитектуры зависит от поддержки конкретной программной библиотекой и аппаратной платформой. Поэтому для приложения важно замерить время до первого токена, скорость генерации и качество ответов относительно Phi-4 Mini Reasoning при одинаковых условиях. Большой заявленный прирост производительности относится к тестам Microsoft и не означает, что каждый пользователь увидит такое же ускорение.
Связанные модели и разработчик
Другие версии семейства Phi
Phi-4 Mini Reasoning · Phi-4 Mini · Phi-4 Reasoning · Phi-4 Reasoning Plus · Microsoft AI в Вики Futuretools
Первичные источники
Материалы Microsoft и карточки опубликованных весов
анонс Phi-4 Mini Flash Reasoning · веса Phi-4 Mini Flash Reasoning