載入中...
載入中...
Thor Lin 推薦 Huihui-ThinkingCap-Qwen3.6-27B-abliterated 作為 24GB 顯卡可跑的免費本地模型。核心訊號不是單純 tok/s,而是 ThinkingCap 微調把 reasoning token 大幅縮短;作者文章 claims GSM8K 從 3,175 到 648、MTP 從 27.6 到 38.6 tok/s。HF 頁面可驗證 bottlecapai、huihui-ai、mradermacher GGUF 三層模型存在,license tag 為 apache-2.0;性能數字仍應視為作者/模型卡 claim,未重跑。
MTPLX 是 Apple Silicon / MLX 上的 native MTP speculative decoding 專案,利用 Qwen3.6 模型內建 MTP heads 當 drafter,避免外部小模型佔記憶體。README 與 LargitData 測試都指向 M5 Max 上約 63 tok/s、temp=0.6 約 2.24 倍加速,但生產採用仍需自行重現。
Hugging Face CTO 用 Qwen3.6-27B、llama.cpp 與 Pi coding agent 在 MacBook Pro 上跑本地 coding agent,體感接近 Claude Opus;這代表開源本地模型在日常 coding 任務上的護城河差距正在變淺,但仍要留意公開 codebase、速度與第三方驗證限制。