載入中...
載入中...
AirLLM 是 Apache-2.0 的 Python / GitHub 專案,主打不用量化、蒸餾或剪枝,透過逐層拆分與載入把 70B 模型跑在 4GB GPU,405B 跑在 8GB,DeepSeek-V3 約 12GB,Kimi K3 2.8T 官方 release 聲稱在 RTX 6000 Ada 上峰值 3.72GB VRAM。本文整理技術原理、安裝、瓶頸與適用場景。
Threads 貼文整理 2026 年本地 LLM / LocalLLaMA 社群對 MTP 與 DSpark 的討論。本文補充 arXiv 2607.05147 與 GitHub/PR 驗證,說明 Multi-Token Prediction、DSpark semi-autoregressive drafter、confidence-scheduled verification 的差異與落地 caveat。