HiPO 8B

HiPO 8B — открытая модель Kwaipilot на базе Qwen3-8B, обученная выбирать между рассуждением и кратким ответом.

HiPO 8B — экспериментальная модель на базе Qwen3-8B, опубликованная командой Kwaipilot в сентябре 2025 года. Она демонстрирует алгоритм Hybrid Policy Optimization: модель учится включать развёрнутое рассуждение только тогда, когда оно может помочь решить задачу.

Баланс точности и длины ответа

В работе HiPO сравниваются режимы с обязательным рассуждением, обычное обучение с подкреплением и смешанное обучение на примерах с рассуждением и без него. Авторы сообщают, что их подход повысил точность и одновременно сократил среднюю длину ответов и долю задач, в которых модель включает рассуждение. Эти цифры относятся к экспериментам команды.

Исследовательский выпуск, а не отдельный API

Карточка модели и статья описывают метод обучения; готовый коммерческий сервис или SLA в публикацию не входят. Репозиторий содержит веса для самостоятельных экспериментов и указывает Apache 2.0. Для использования нужно учитывать требования к вычислительным ресурсам и совместимым инструментам запуска.

Младший вариант той же работы

Команда также опубликовала модель HiPO 1.7B. Обе версии иллюстрируют один метод, но имеют разные размеры. Перейдите к HiPO 1.7B KwaiCoder AutoThink Preview

Разработчик и источник

Выпуски Kuaishou и команды Kwaipilot собраны на странице разработчика в Вики Futuretools.ru.

Дата и характеристики сверены с официальной публикацией разработчика или карточкой модели. Дата — дата создания публичной карточки официального репозитория; статья об алгоритме опубликована отдельно.