Qwen3.8-27B Coder390 EfficientThink — дообученная модель для кода

Qwen3.8-27B Coder390 EfficientThink — сторонняя доработка базовой Qwen3.8-27B, нацеленная на программирование и более короткие рассуждения. Разбираем результаты тестов, локальный запуск и ограничения.

Qwen3.8-27B Coder390 EfficientThink — сторонняя доработка Qwen3.8-27B, опубликованная автором nerkyor. Модель рассчитана на задачи программирования и сложные вопросы, в которых базовая версия могла продолжать рассуждать уже после того, как нашла ответ. По замыслу автора, дообучение должно сократить такие повторы и реже приводить к тому, что ответ обрывается из-за лимита вывода.

Это не официальный релиз команды Alibaba Qwen. Упоминания Opus 5.5, GPT-6 Astra, Grok 4.7 и DeepSeek V4 Pro относятся к описанной автором подготовке обучающих примеров и траекторий рассуждений. Они не означают, что модель официально создана этими компаниями или показывает сопоставимое с ними качество.

Что изменили в модели

Меньше повторных рассуждений

В карточке модели автор описывает проблему так: Qwen3.8-27B иногда уже получает промежуточный ответ, но затем снова и снова пересматривает тот же ход решения. В задачах с длинным выводом это могло занять весь лимит — до 94 тысяч токенов — и оставить пользователя без итогового ответа.

Для дообучения использовались несколько этапов SFT и RLOO поверх ранее подготовленной версии Qwen3.8-27B. Если говорить проще, модель учили на примерах решений, а затем дополнительно настраивали с учётом того, какие ответы оказались правильными и где рассуждение не привело к результату. Цель EfficientThink — убрать бесполезное повторение, не запрещая длинные рассуждения там, где они действительно нужны.

Что означает Coder390

Название может выглядеть как указание на 3,9 миллиона строк кода, однако карточка модели так его не объясняет. Автор связывает «390» с заявленным результатом около 90 баллов в трёх тестах — GPQA, MMLU и LiveCodeBench. Отдельного подтверждения обучения на 3,9 млн строк кода в открытом описании нет.

Результаты тестирования

Сравнение с исходной Qwen3.8-27B

Автор опубликовал результаты собственного тестирования на полных наборах GPQA, MMLU и LiveCodeBench (LCB). В выбранном им варианте static FP8 новая сборка набрала немного больше исходной модели:

  • GPQA: 178 правильных ответов из 198 против 177 у исходной модели.
  • MMLU: 450 из 500 против 444.
  • LiveCodeBench: 90 из 100 против 83.

Проверка проводилась автором на двух видеокартах RTX PRO 6000, с контекстом 100 тысяч токенов и пределом генерации 94 208 токенов. Поэтому эти цифры описывают конкретный эксперимент, а не независимую оценку качества модели. Они не подтверждают равенство Opus 5.5 или GPT-6 Astra: в карточке нет сопоставительного теста с этими моделями.

Стали ли ответы короче

В том же протоколе автор сравнил медианное число токенов рассуждения. На GPQA оно снизилось с 5 299 до 2 966, а на LiveCodeBench — с 8 388 до 4 511. Это примерно на 44% и 46% меньше соответственно. На MMLU снижение скромнее: с 205 до 154 токенов. Результат зависит от типа задачи: модель не просто ограничивает длину ответа, а должна сокращать повторения там, где они не помогают решить задачу.

Локальный запуск и лицензия

Форматы и требования к памяти

Веса доступны в нескольких форматах и уровнях квантования, в том числе GGUF для llama.cpp. Файл варианта Q4 LynnStyle занимает около 19,6 млрд байт (примерно 18,3 ГиБ). Это размер файла на диске, а не полное требование к видеопамяти: при запуске дополнительно нужны ресурсы для контекста и кэша модели. Поэтому наличие видеокарты с 24 ГБ памяти само по себе не гарантирует комфортную работу на длинном контексте.

GGUF-сборка включает встроенную голову MTP для спекулятивного декодирования. В совместимой версии llama.cpp её можно включить параметрами --spec-type draft-mtp --spec-draft-n-max 4. DFlash2 — альтернативный механизм ускорения: для него используются отдельные файлы и соответствующая конфигурация SGLang. Одновременно включать MTP и DFlash2 нельзя. Актуальные названия файлов, команды и требования к выбранной версии опубликованы в карточке модели.

Условия использования

Автор распространяет веса по лицензии Apache-2.0 в соответствии с лицензией базовой Qwen3.8-27B. Перед применением в коммерческом продукте стоит сверить лицензию конкретного файла и условия исходной модели. Скачать варианты весов и посмотреть методику тестирования можно на странице модели на Hugging Face.