LLM Inference / Local AI
本地 LLM 加速不只靠 VRAM:MTP 與 DSpark 把解碼策略推到台前
Threads 貼文整理 2026 年本地 LLM / LocalLLaMA 社群對 MTP 與 DSpark 的討論。本文補充 arXiv 2607.05147 與 GitHub/PR 驗證,說明 Multi-Token Prediction、DSpark semi-autoregressive drafter、confidence-scheduled verification 的差異與落地 caveat。
2026年7月14日3 分鐘閱讀👁 5
Threads 驗證|Local LLM|解碼策略
本地 LLM 的速度競爭,正在從「硬體/量化」延伸到「解碼策略」
遠地平線在 Threads 指出,過去本地 LLM 要更快,常見路線是買更多 VRAM、壓更低 quant;但 2026 年中,r/LocalLLaMA 社群開始把焦點放到 MTP 與 DSpark 這類解碼策略。這個觀察值得收進 KB,因為它影響未來本地模型部署時,該優先看模型架構、serving engine 支援,還是單純看 GPU。
一句話:MTP 是模型訓練/權重內建的多 token 預測能力;DSpark 是 DeepSeek 論文提出的 speculative decoding 框架,用 semi-autoregressive draft layer 與 confidence-scheduled verification 提升 acceptance 與吞吐效率。
Threads 貼文主張
- MTP(Multi-Token Prediction)在 Qwen / DeepSeek 等模型中以多 token prediction head 形式出現;每次 forward 不只預測下一個 token,也嘗試預測後面 N 個。
- DSpark 不是獨立小模型,而是附掛在 target model 上的 draft layer;重點是 parallel backbone + lightweight serial head,避免 parallel drafter 後半段 acceptance rate 掉太快。
- DSpark 第二個重點是 confidence-scheduled verification:用 confidence head 預估 prefix survival probability,再由 scheduler 決定驗證長度,減少浪費 GPU cycle。
- 貼文稱 DeepSeek 實測 per-user speed +57–85%、byte-identical output;這與 arXiv 摘要中「60 to 85 percent」接近,但仍應視為論文/作者實測而非我們實測。
外部驗證
| 項目 | 驗證結果 | caveat |
|---|---|---|
| DSpark 論文 | arXiv:2607.05147,題名 DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation。 | 論文上架時間 2026-07-06;屬新方法,生態整合仍早。 |
| DSpark 速度數字 | arXiv 摘要稱相較 production baseline MTP-1,在 matched throughput 下 per-user generation speed 提升 60–85%。 | 這是 DeepSeek serving system / live traffic 條件下的論文結果,不代表每台本地機器都有相同增益。 |
| llama.cpp MTP | GitHub issue search 可見 ggml-org/llama.cpp PR #22673「llama + spec: MTP Support」已關閉合入。 | 具體模型、GGUF、build 版本與 runtime flag 仍要依 engine 文件確認。 |
| vLLM / LM Studio | 社群與 PR 訊號顯示 MTP / speculative decoding 支援正在擴散。 | 「stable」要針對版本與模型核對;不要把社群 fork 當官方穩定版。 |
| DSpark 開源實作 | GitHub 上已有 MLX / from-scratch / DGX Spark recipe 等 DSpark 相關社群 repo。 | 未找到明確官方 checkpoint repo;多數是社群實作或 recipe,成熟度不一。 |
MTP vs DSpark:怎麼理解
| 面向 | MTP | DSpark |
|---|---|---|
| 位置 | 模型權重/訓練時內建的多 token head。 | speculative decoding framework / draft layer 設計。 |