Phi-1

Phi-1 — компактная модель Microsoft для генерации кода на Python, обученная на отобранных примерах и синтетических задачах.

Microsoft Research представила Phi-1 в июне 2023 года как небольшую модель, специально обученную программированию на Python. Дата 20 июня соответствует первой публичной публикации исследования о модели; техническая страница Microsoft указывает месяц, а официальный репозиторий весов доступен от имени Microsoft на Hugging Face. Модель не проектировалась как универсальный чат-ассистент.

Назначение модели

Генерация и дополнение Python-кода

Phi-1 содержит 1,3 млрд параметров и ориентирована на базовые задачи написания Python: продолжение функций, небольшие упражнения и кодовые фрагменты. В исследовании Microsoft объясняет, что данные включали отобранный код и синтетические учебники с упражнениями. Такой фокус позволил проверить, насколько качество обучающих примеров может компенсировать меньший размер модели.

Обучающие данные и оценка

Тесты относятся к задачам кода

В отчёте приведены показатели 50,6% pass@1 на HumanEval и 55,5% на MBPP. Это результаты конкретной версии и протокола Microsoft, а не ожидаемая точность любого программного проекта. Модель лучше рассматривать как исследовательскую основу для экспериментов с кодом, а не как готового разработчика, способного безопасно менять рабочую систему.

Ограничения

Узкая область и проверка результата

Phi-1 не обучалась как современная диалоговая модель с длинными инструкциями. Она может выдавать синтаксически неверный, неполный или небезопасный код и не заменяет тестирование. Для практического применения нужен внешний интерфейс, контекст проекта и контроль результата человеком.

Как обучали Phi-1

Качество примеров вместо масштаба корпуса

В статье описан отбор около 6 млрд токенов кода из веб-источников и ещё примерно 1 млрд токенов синтетических учебников и упражнений, созданных с помощью GPT-3.5. Авторы обучали модель четыре дня на восьми ускорителях A100. Этот эксперимент проверял конкретную гипотезу: тщательно отобранные примеры помогают небольшой языковой модели лучше писать простые функции Python. Он не доказывает, что небольшая модель справится с любым проектом или заменит специализированные современные средства разработки.

Что означают опубликованные оценки

Результаты относятся к тестовым задачам

Microsoft сообщила о показателях pass@1 50,6% на HumanEval и 55,5% на MBPP. В этих тестах оценивается, смогла ли модель с первой генерации предложить код, проходящий заданную проверку. Это не доля безошибочных ответов в реальном программном обеспечении: задачи короче и заранее формализованы, чем работа с большим кодовым проектом. Поэтому метрики полезны для сравнения экспериментальных моделей, но не заменяют запуск тестов и проверку кода.

Связанные модели и разработчик

Другие версии семейства Phi

Phi-1.5 · Phi-2 · Phi-3 Mini · Microsoft AI в Вики Futuretools

Первичные источники

Материалы Microsoft и карточки опубликованных весов

исследование и модель Phi-1 от Microsoft Research · первая версия исследования Phi-1, опубликованная 20 июня 2023 года · официальные веса Phi-1 от Microsoft