Rho-Math-1B

Rho-Math-1B — математическая модель Microsoft, обученная эффективнее отбирать полезные фрагменты текста.

Rho-Math-1B — математическая версия семейства Rho-1, опубликованная Microsoft на Hugging Face 12 апреля 2024 года. Семейство проверяет идею Selective Language Modeling: при продолжении предобучения модель уделяет больший вес полезным токенам, а не одинаково учится на каждом фрагменте корпуса.

Что означает Rho-1

Отбор информативных токенов при обучении

Обычная языковая модель обучается предсказывать следующий токен для всего текста. В Rho-1 вспомогательная модель оценивает полезность токенов, а обучение концентрируется на тех, которые лучше соответствуют целевому распределению. Microsoft исследовала этот способ на математическом корпусе OpenWebMath и показала, что отбор может повысить эффективность продолжительного предобучения.

Версия 1B

Компактная модель для математических экспериментов

Checkpoint microsoft/rho-math-1b-v0.1 относится к классу примерно одного миллиарда параметров и дообучен для задач математики. В карточке Microsoft приведён результат 15,6% few-shot accuracy на тесте MATH. Это результат конкретного протокола оценки; он не означает, что модель надёжно решает произвольные школьные, олимпиадные или рабочие задачи.

Для чего подходит

Исследование обучения и базового решения задач

Модель полезна для изучения отбора обучающих данных и сравнения небольших систем на математических тестах. Она может генерировать промежуточные рассуждения, но ранний checkpoint не следует принимать за законченный образовательный сервис. Для корректной оценки важно зафиксировать базовую модель, способ подсказки и правила подсчёта ответа.

Связанные варианты

7B и модели Interpreter опубликованы отдельно

Microsoft выпустила Rho-Math-7B, а затем версии Interpreter. Они имеют собственные параметры и результаты, поэтому не объединены в одну карточку. Rho-1 описывает метод предобучения, тогда как суффикс Math указывает на математическую настройку. Лицензия открытого checkpoint — MIT; экспериментальные показатели не отменяют необходимость проверять вычисления.

Связанные модели

Другие разработки Microsoft

Rho-Math-7B · Rho-Math-1B-Interpreter · Rho-Math-7B-Interpreter · Phi-4 Reasoning · Microsoft AI в Вики Futuretools

Первичные источники

Материалы разработчика и официальные карточки моделей

статья Microsoft Research о методе Rho-1 · первая публикация исследования Rho-1 · официальный код и описание моделей Rho-1 · официальная карточка Rho-Math-1B