Кодування флагманського рівня в щільній моделі 27B
22 квітня 2026 р. – блог із посиланнями
Qwen3.6-27B: кодування флагманського рівня в щільній моделі 27B (через) Великі претензії від Qwen щодо їхньої останньої відкритої моделі:
Qwen3.6-27B забезпечує продуктивність агентного кодування флагманського рівня, перевершуючи флагман Qwen3.5-397B-A17B з відкритим кодом попереднього покоління (397B загалом / 17B активного MoE) у всіх основних тестах кодування.
На Hugging Face Qwen3.5-397B-A17B має 807 ГБ, цей новий Qwen3.6-27B – 55,6 ГБ.
Я спробував це з квантованою версією Unsloth Qwen3.6-27B-GGUF:Q4_K_M на 16,8 ГБ і llama-server використовуючи цей рецепт benob на Hacker News, після першого встановлення llama-server використовуючи brew install llama.cpp:
llama-server \
-hf unsloth/Qwen3.6-27B-GGUF:Q4_K_M \
--no-mmproj \
--fit on \
-np 1 \
-c 65536 \
--cache-ram 4096 -ctxcp 2 \
--jinja \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0 \
--presence-penalty 0.0 \
--repeat-penalty 1.0 \
--reasoning on \
--chat-template-kwargs '{"preserve_thinking": true}'
Під час першого запуску вдалося зберегти модель ~17 ГБ ~/.cache/huggingface/hub/models--unsloth--Qwen3.6-27B-GGUF.
Ось стенограма для «Створення SVG пелікана, який їде на велосипеді». Це ан видатний результат для локальної моделі 16,8 ГБ:

Показники продуктивності, надані llama-server:
- Зчитування: 20 токенів, 0,4 с, 54,32 токенів/с
- Генерація: 4444 токенів, 2 хв 53 с, 25,57 токенів/с
Для хорошої міри, ось Створення SVG ОПОССУМА ПІВНІЧНОЇ ВІРГІНІЇ НА ЕЛЕКТРОСАКОТЕРІ (раніше запускався з GLM-5.1):

Для цього знадобилося 6575 жетонів, 4 хвилини 25 секунд, 24,74 т/с.
