載入中...
載入中...
Qwen-Compress 是 Gavin-chen 發布在 Hugging Face 的 MIT 授權實驗專案,透過每 4 層插入 HiddenStateCompressor,以 learned weighted pooling 將部分 hidden states 4 合 1,目標是降低 Qwen 架構 KV cache prefill 成本;IFEval 幾乎不掉,但 GSM8K 推理明顯衰退,適合視為研究原型而非 production-ready 壓縮方案。
Threads 貼文整理 2026 年本地 LLM / LocalLLaMA 社群對 MTP 與 DSpark 的討論。本文補充 arXiv 2607.05147 與 GitHub/PR 驗證,說明 Multi-Token Prediction、DSpark semi-autoregressive drafter、confidence-scheduled verification 的差異與落地 caveat。