載入中...
載入中...
Threads 以記憶體頻寬解釋 token decoding 速度,提到 RX 7900 XTX、RTX 4090、M3 Ultra、DGX Spark、RTX 5090、RTX Pro 6000 的差異。本文用官方規格校正 DGX Spark 273 GB/s、Apple M3 Ultra over 800GB/s、RX 7900 XTX 960GB/s / effective 3500GB/s,並整理本地 LLM 採購判斷。
AirLLM 是 Apache-2.0 的 Python / GitHub 專案,主打不用量化、蒸餾或剪枝,透過逐層拆分與載入把 70B 模型跑在 4GB GPU,405B 跑在 8GB,DeepSeek-V3 約 12GB,Kimi K3 2.8T 官方 release 聲稱在 RTX 6000 Ada 上峰值 3.72GB VRAM。本文整理技術原理、安裝、瓶頸與適用場景。
Qwen-Compress 是 Gavin-chen 發布在 Hugging Face 的 MIT 授權實驗專案,透過每 4 層插入 HiddenStateCompressor,以 learned weighted pooling 將部分 hidden states 4 合 1,目標是降低 Qwen 架構 KV cache prefill 成本;IFEval 幾乎不掉,但 GSM8K 推理明顯衰退,適合視為研究原型而非 production-ready 壓縮方案。
Threads 貼文整理 2026 年本地 LLM / LocalLLaMA 社群對 MTP 與 DSpark 的討論。本文補充 arXiv 2607.05147 與 GitHub/PR 驗證,說明 Multi-Token Prediction、DSpark semi-autoregressive drafter、confidence-scheduled verification 的差異與落地 caveat。
NVIDIA Nemotron-Labs-TwoTower 是 two-tower block-wise diffusion language model:凍結 AR/context tower 處理上下文,訓練 diffusion/denoiser tower 以 mask diffusion 並行生成 token block。模型卡聲稱在 2×H100、block size 16、γ=0.8 下達 2.42× AR throughput 並保留 98.7% aggregate quality。
Lucebox 是 Luce-Org 開源的 hand-tuned LLM inference hub,主張針對特定 consumer hardware 與模型家族重寫 kernel、speculative decoding、prefill 路徑。Megakernel、DFlash、PFlash 都指向同一件事:local AI 的瓶頸不一定是硬體太舊,而是通用 inference stack 沒有榨乾晶片。