HiPO 8B
HiPO 8B — открытая модель Kwaipilot на базе Qwen3-8B, обученная выбирать между рассуждением и кратким ответом.
HiPO 8B — экспериментальная модель на базе Qwen3-8B, опубликованная командой Kwaipilot в сентябре 2025 года. Она демонстрирует алгоритм Hybrid Policy Optimization: модель учится включать развёрнутое рассуждение только тогда, когда оно может помочь решить задачу.
Баланс точности и длины ответа
В работе HiPO сравниваются режимы с обязательным рассуждением, обычное обучение с подкреплением и смешанное обучение на примерах с рассуждением и без него. Авторы сообщают, что их подход повысил точность и одновременно сократил среднюю длину ответов и долю задач, в которых модель включает рассуждение. Эти цифры относятся к экспериментам команды.
Исследовательский выпуск, а не отдельный API
Карточка модели и статья описывают метод обучения; готовый коммерческий сервис или SLA в публикацию не входят. Репозиторий содержит веса для самостоятельных экспериментов и указывает Apache 2.0. Для использования нужно учитывать требования к вычислительным ресурсам и совместимым инструментам запуска.
Младший вариант той же работы
Команда также опубликовала модель HiPO 1.7B. Обе версии иллюстрируют один метод, но имеют разные размеры. Перейдите к HiPO 1.7B KwaiCoder AutoThink Preview
Разработчик и источник
Выпуски Kuaishou и команды Kwaipilot собраны на странице разработчика в Вики Futuretools.ru.
Дата и характеристики сверены с официальной публикацией разработчика или карточкой модели. Дата — дата создания публичной карточки официального репозитория; статья об алгоритме опубликована отдельно.