SRPO-Qwen-32B
SRPO-Qwen-32B — исследовательская модель Kwaipilot на базе Qwen2.5-32B для математических и программных задач.
SRPO-Qwen-32B — исследовательская модель команды Kwaipilot, опубликованная 21 апреля 2025 года. В её основе Qwen2.5-32B, дообученная методом Two-Staged history-Resampling Policy Optimization для математического рассуждения и программирования.
Два этапа обучения
В техническом описании сначала выделяется обучение на сложных математических задачах, чтобы сформировать развёрнутое рассуждение. Затем математические навыки объединяются с программированием. Метод History Resampling повторно использует примеры, на которых модель пока отвечает неэффективно, чтобы повысить результативность обучения.
Результаты исследования
Команда сообщает, что SRPO-Qwen-32B показала 50,0% на AIME24 и 41,6% на LiveCodeBench в описанной конфигурации, сравнивая результаты с DeepSeek-R1-Zero-Qwen-32B. Это результаты исследовательской оценки авторов, а не гарантия качества для всех задач. В карточке модели указана лицензия MIT.
Отдельный экспериментальный выпуск
SRPO — специализированная исследовательская настройка базовой модели, а не продолжение линейки KwaiCoder или KAT-Coder. Для сравнения откройте исследование адаптивного рассуждения KwaiCoder AutoThink Preview KAT-V1 40B
Разработчик и источник
Выпуски Kuaishou и команды Kwaipilot собраны на странице разработчика в Вики Futuretools.ru.
Дата и характеристики сверены с официальной публикацией разработчика или карточкой модели. Дата указана по первому публичному размещению модели в официальной организации Kwaipilot.