載入中...
載入中...
AirLLM 是 Apache-2.0 的 Python / GitHub 專案,主打不用量化、蒸餾或剪枝,透過逐層拆分與載入把 70B 模型跑在 4GB GPU,405B 跑在 8GB,DeepSeek-V3 約 12GB,Kimi K3 2.8T 官方 release 聲稱在 RTX 6000 Ada 上峰值 3.72GB VRAM。本文整理技術原理、安裝、瓶頸與適用場景。
Qwen-Compress 是 Gavin-chen 發布在 Hugging Face 的 MIT 授權實驗專案,透過每 4 層插入 HiddenStateCompressor,以 learned weighted pooling 將部分 hidden states 4 合 1,目標是降低 Qwen 架構 KV cache prefill 成本;IFEval 幾乎不掉,但 GSM8K 推理明顯衰退,適合視為研究原型而非 production-ready 壓縮方案。
Threads 貼文整理 2026 年本地 LLM / LocalLLaMA 社群對 MTP 與 DSpark 的討論。本文補充 arXiv 2607.05147 與 GitHub/PR 驗證,說明 Multi-Token Prediction、DSpark semi-autoregressive drafter、confidence-scheduled verification 的差異與落地 caveat。
HTML 實驗版:NVIDIA Build / NIM 免費模型目錄可以當作低成本試用場,但不能把免費端點誤認為正式產品基礎設施;重點是額度、資料風險、授權與可遷移性。
AI 開源模型困境:資安與競爭力的殘酷博弈