Rho-Math-1B
Rho-Math-1B — математическая модель Microsoft, обученная эффективнее отбирать полезные фрагменты текста.
Rho-Math-1B — математическая версия семейства Rho-1, опубликованная Microsoft на Hugging Face 12 апреля 2024 года. Семейство проверяет идею Selective Language Modeling: при продолжении предобучения модель уделяет больший вес полезным токенам, а не одинаково учится на каждом фрагменте корпуса.
- Что означает Rho-1
- Отбор информативных токенов при обучении
- Версия 1B
- Компактная модель для математических экспериментов
- Для чего подходит
- Исследование обучения и базового решения задач
- Связанные варианты
- 7B и модели Interpreter опубликованы отдельно
- Связанные модели
- Другие разработки Microsoft
- Первичные источники
- Материалы разработчика и официальные карточки моделей
Что означает Rho-1
Отбор информативных токенов при обучении
Обычная языковая модель обучается предсказывать следующий токен для всего текста. В Rho-1 вспомогательная модель оценивает полезность токенов, а обучение концентрируется на тех, которые лучше соответствуют целевому распределению. Microsoft исследовала этот способ на математическом корпусе OpenWebMath и показала, что отбор может повысить эффективность продолжительного предобучения.
Версия 1B
Компактная модель для математических экспериментов
Checkpoint microsoft/rho-math-1b-v0.1 относится к классу примерно одного миллиарда параметров и дообучен для задач математики. В карточке Microsoft приведён результат 15,6% few-shot accuracy на тесте MATH. Это результат конкретного протокола оценки; он не означает, что модель надёжно решает произвольные школьные, олимпиадные или рабочие задачи.
Для чего подходит
Исследование обучения и базового решения задач
Модель полезна для изучения отбора обучающих данных и сравнения небольших систем на математических тестах. Она может генерировать промежуточные рассуждения, но ранний checkpoint не следует принимать за законченный образовательный сервис. Для корректной оценки важно зафиксировать базовую модель, способ подсказки и правила подсчёта ответа.
Связанные варианты
7B и модели Interpreter опубликованы отдельно
Microsoft выпустила Rho-Math-7B, а затем версии Interpreter. Они имеют собственные параметры и результаты, поэтому не объединены в одну карточку. Rho-1 описывает метод предобучения, тогда как суффикс Math указывает на математическую настройку. Лицензия открытого checkpoint — MIT; экспериментальные показатели не отменяют необходимость проверять вычисления.
Связанные модели
Другие разработки Microsoft
Rho-Math-7B · Rho-Math-1B-Interpreter · Rho-Math-7B-Interpreter · Phi-4 Reasoning · Microsoft AI в Вики Futuretools
Первичные источники
Материалы разработчика и официальные карточки моделей
статья Microsoft Research о методе Rho-1 · первая публикация исследования Rho-1 · официальный код и описание моделей Rho-1 · официальная карточка Rho-Math-1B