Phi-3.5 MoE
Phi-3.5 MoE — разреженная модель Microsoft на 42 млрд параметров, активирующая около 6,6 млрд параметров для одного запроса.
Phi-3.5 MoE — модель Microsoft на архитектуре «смесь экспертов», объявленная 22 августа 2024 года. Она содержит около 42 млрд параметров, но использует примерно 6,6 млрд активных параметров для обработки одного токена. Такой подход позволяет объединить специализированные блоки, не выполняя каждый из них на каждом шаге.
- Как устроена MoE
- Выбор экспертных блоков для запроса
- Языковые задачи
- Инструкции и многоязычные запросы
- Варианты развёртывания
- Облачный доступ или локальные веса
- Как устроена смесь экспертов
- Модель включает 16 специализированных блоков
- Что публиковала Microsoft
- Текстовая версия для нескольких языков
- Связанные модели и разработчик
- Другие версии семейства Phi
- Первичные источники
- Материалы Microsoft и карточки опубликованных весов
Как устроена MoE
Выбор экспертных блоков для запроса
Microsoft описывает 16 экспертов, из которых маршрутизатор выбирает подходящие для текущего входа. В открытом каталоге модель представлена отдельным репозиторием весов microsoft/Phi-3.5-MoE-instruct. Активные параметры и общий объём весов — разные величины: для размещения полной модели всё равно нужно учитывать её полный размер и требования к памяти.
Языковые задачи
Инструкции и многоязычные запросы
Phi-3.5 MoE предназначена для текстовых задач, программирования и сложных инструкций. Разработчик сообщал о поддержке более 20 языков и улучшенной пропускной способности по сравнению с плотной моделью аналогичного общего размера. Эти сравнения проводились Microsoft; реальная скорость зависит от оборудования и реализации маршрутизатора.
Варианты развёртывания
Облачный доступ или локальные веса
Azure AI предоставляла управляемый доступ, а Microsoft опубликовала веса для локальной работы. Модель потребует больше памяти, чем Phi-3.5 Mini, несмотря на меньший активный объём вычислений. До развёртывания важно проверить совместимость фреймворка, пропускную способность и качество на собственной нагрузке.
Как устроена смесь экспертов
Модель включает 16 специализированных блоков
В Phi-3.5 MoE заявлено около 42 млрд параметров всего и примерно 6,6 млрд активных параметров на один токен. Маршрутизатор выбирает часть экспертных блоков для обработки очередного фрагмента текста. Поэтому число активных параметров нельзя приравнивать к полной памяти для хранения весов: модель по-прежнему содержит крупный набор параметров. Перед локальным запуском нужно проверять требования конкретного формата и программной среды.
Что публиковала Microsoft
Текстовая версия для нескольких языков
Анонс Phi-3.5 описывает улучшения языковых задач, программирования и математики, а также поддержку более чем 20 языков для семейства. MoE-вариант опубликован как отдельная модельная карточка и может показывать другой баланс качества и вычислений, чем плотная Phi-3.5 Mini. Сравнения Microsoft относятся к указанным тестам; реальная скорость зависит от того, поддерживает ли оборудование и используемая библиотека разреженную архитектуру.
Связанные модели и разработчик
Другие версии семейства Phi
Phi-3.5 Mini · Phi-3 Small · Phi-3 Medium · Phi-4 · Microsoft AI в Вики Futuretools
Первичные источники
Материалы Microsoft и карточки опубликованных весов
анонс семейства Phi-3.5 от Microsoft Azure · веса Phi-3.5 MoE