Rho-Math-7B
Rho-Math-7B — семимиллиардная версия математической модели Microsoft Rho-1.
Rho-Math-7B — более крупная математическая модель семейства Rho-1. Microsoft разместила её веса 12 апреля 2024 года. Как и меньший вариант на 1 млрд параметров, она использует результаты исследования Selective Language Modeling, однако размер и конфигурация checkpoint иные.
- Результаты на математике
- Более крупный вариант семейства
- Метод обучения
- Selective Language Modeling
- Выбор размера
- Компромисс между ресурсами и качеством
- Проверка ответов
- Не используйте вывод как доказательство
- Связанные модели
- Другие разработки Microsoft
- Первичные источники
- Материалы разработчика и официальные карточки моделей
Результаты на математике
Более крупный вариант семейства
В карточке Microsoft для Rho-Math-7B приведено 31,0% few-shot accuracy на MATH. Для сравнения Rho-Math-1B показала 15,6% по той же методике. Эти цифры описывают конкретный набор задач и способ подачи примеров, а не общую вероятность правильного ответа. На реальных заданиях модель может неверно понять условие или ошибиться в промежуточном шаге.
Метод обучения
Selective Language Modeling
При обучении Rho-1 модель-оценщик выделяет токены, которые полезнее для целевого распределения. Исследовательская работа Microsoft сообщает, что такой подход улучшал данные математики и уменьшал объём вычислений, нужный для достижения сопоставимых результатов в изученных тестах. Это свойство метода обучения, а не отдельный механизм, который пользователь включает во время ответа.
Выбор размера
Компромисс между ресурсами и качеством
Семь миллиардов параметров требуют больше памяти и вычислений, чем версия 1B. Модель уместна для исследований и локального запуска на подходящей инфраструктуре, если нужно проверить влияние размера на математические ответы. Перед выбором стоит сравнить Rho-Math-7B с Interpreter-вариантом: они обучались для разных форматов поведения.
Проверка ответов
Не используйте вывод как доказательство
Открытые веса и опубликованные результаты облегчают воспроизводимые эксперименты, но не обеспечивают формальную корректность. Проверяйте числовой ответ вычислением, программным решателем или эталоном. Если нужно, чтобы модель разворачивала ход решения в предназначенном для этого формате, смотрите отдельные страницы Rho-Math Interpreter.
Связанные модели
Другие разработки Microsoft
Rho-Math-1B · Rho-Math-1B-Interpreter · Rho-Math-7B-Interpreter · Phi-4 Reasoning · Microsoft AI в Вики Futuretools
Первичные источники
Материалы разработчика и официальные карточки моделей
статья Microsoft Research о методе Rho-1 · первая публикация исследования Rho-1 · официальный код и описание моделей Rho-1 · официальная карточка Rho-Math-7B