Huihui ThinkingCap Qwen3.6-27B:24GB 顯卡上的本地大腦,重點是少想一半而不是 tok/s
Thor Lin 推薦 Huihui-ThinkingCap-Qwen3.6-27B-abliterated 作為 24GB 顯卡可跑的免費本地模型。核心訊號不是單純 tok/s,而是 ThinkingCap 微調把 reasoning token 大幅縮短;作者文章 claims GSM8K 從 3,175 到 648、MTP 從 27.6 到 38.6 tok/s。HF 頁面可驗證 bottlecapai、huihui-ai、mradermacher GGUF 三層模型存在,license tag 為 apache-2.0;性能數字仍應視為作者/模型卡 claim,未重跑。
2026年7月23日2 分鐘閱讀👁 5
Local LLM / Efficient Thinking / 24GB GPU
Huihui ThinkingCap Qwen3.6-27B:24GB 顯卡上的本地大腦,重點是少想一半而不是 tok/s
這則 Threads 的重點不是「又一顆 27B 模型」,而是一個挑本地模型時常被忽略的指標:總等待時間 = 要吐多少 token × 每 token 多快。ThinkingCap 的價值是讓 reasoning model 少吐思考 token;MTP 則在 dense 27B 上提高 decode throughput。兩者加起來,才讓 24GB 級顯卡上的日常本地 LLM 變得比較像可常駐的大腦。
查證結果:官方/來源鏈路存在:
bottlecapai/ThinkingCap-Qwen3.6-27B、huihui-ai/Huihui-ThinkingCap-Qwen3.6-27B-abliterated、mradermacher/Huihui-ThinkingCap-Qwen3.6-27B-abliterated-i1-GGUF。2026-07-23 抓 Hugging Face 頁面可見三者 license tag 皆為 apache-2.0;mradermacher GGUF 頁面列出 i1-Q4_K_S.gguf 等量化檔。性能數字是 Thor / AI-Muninn 文章與模型卡轉述,本文沒有重跑 benchmark。| 層級 | 作用 | 可驗證來源 |
|---|---|---|
| Qwen3.6-27B base | 27B dense reasoning model,單卡量化可跑。 | AI-Muninn 文章與 HF base lineage。 |
| ThinkingCap | 微調「少想一點」,降低 reasoning token。 | HF tag:token-efficient / efficient-thinking;文章引用 GSM8K / GPQA / MMLU-Pro 數字。 |
| Huihui abliterated | 移除/降低拒答方向,保留 ThinkingCap 省思考特性。 | HF tag:abliterated / uncensored / apache-2.0。 |
| mradermacher i1-GGUF | 提供 llama.cpp 可跑的 GGUF 量化檔。 | HF 頁面列出 Q4_K_S、Q5、Q6 等檔案。 |
數字怎麼看