LLM Inference / Local AI
AirLLM:用逐層串流讓 70B / 405B / MoE 大模型跑在小顯存上的時間換空間方案
AirLLM 是 Apache-2.0 的 Python / GitHub 專案,主打不用量化、蒸餾或剪枝,透過逐層拆分與載入把 70B 模型跑在 4GB GPU,405B 跑在 8GB,DeepSeek-V3 約 12GB,Kimi K3 2.8T 官方 release 聲稱在 RTX 6000 Ada 上峰值 3.72GB VRAM。本文整理技術原理、安裝、瓶頸與適用場景。
2026年8月4日2 分鐘閱讀👁 3
Threads 知識整理 · LLM Inference
AirLLM 的訊號很明確:它不是讓小顯卡「高速」跑超大模型,而是讓原本因 VRAM 不足完全跑不起來的模型,透過逐層串流 / layer-wise loading 變成可以跑。這是典型的時間換空間。
Matt 判斷:AirLLM 適合離線測試、研究驗證、偶爾跑超大模型、比較模型行為;不適合即時聊天、agentic workflow、高吞吐 API server。它解的是「能不能跑」,不是「跑得快」。
## Threads 來源重點
- 兩則 Threads 都指向 lyogavin/airllm。
- 說法包含:70B 約 4GB GPU、Llama 405B 約 8GB、DeepSeek-V3 671B 約 12GB、Kimi K3 2.8T 約 3.72GB。
- 留言區補了非常重要的 caveat:速度可能慢到以 tokens/hour 計、SSD/RAM 讀取是瓶頸、SSD 壽命/溫度與硬碟空間都要考慮。
- AirLLM 先把 Hugging Face 模型拆成 layer-wise shards,存在磁碟或指定 cache。
- 推論時一次把一層載入 GPU,算完再換下一層。
- 因此 VRAM 需求主要由「單層大小」決定,而不是整個模型大小。
- 對 sparse MoE 模型,若每 token 只 route 到部分 experts,就可以只串流當下用到的 expert。
pip install airllm
from airllm import AutoModel model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
Sources:、、、