本地 LLM 實戰的真相:容量往往比頻寬更重要,swap 會吃掉所有紙面優勢
這則 Threads 最值得記錄的,不是某張卡跑分多高,而是它清楚展示:在本地 LLM 推理裡,模型能否完整塞進記憶體,往往比紙面頻寬更決定真實體感。一旦開始 swap,理論優勢很快就會被 SSD 速度懲罰吞掉。
title: 本地 LLM 實戰的真相:容量往往比頻寬更重要,swap 會吃掉所有紙面優勢 date: 2026-04-08 source: https://www.threads.com/@thor3323/post/DW2q_lwknxh category: articles tags:
- Local LLM
- Gemma 4
- RTX 5090
- DGX Spark
- Memory Capacity
- Benchmark created: 2026-04-08 updated: 2026-04-08
本地 LLM 實戰的真相:容量往往比頻寬更重要,swap 會吃掉所有紙面優勢
概要
這則 Threads 的價值,不只是比較幾台機器跑 Gemma 4 的速度,而是它把一個本地推理常見但常被忽略的現實講得很清楚:
在本地 LLM 場景裡,模型能不能完整塞進記憶體,往往比紙面頻寬更重要。
貼文的核心對比是:
- RTX 5090:31B 模型輕鬆跑
- MBP M1 Max 32GB:31B 幾乎被記憶體限制拖垮
- DGX Spark:雖然頻寬看起來不如 MBP,但因為有 128GB 記憶體、不需要 swap,反而更快
這篇真正有價值的,不是單次 benchmark,而是它清楚展示了: 當模型大小逼近甚至超過可用記憶體時,性能會從「正常變慢」直接掉進「結構性崩潰」。
貼文中的關鍵觀察
作者針對 31B 模型得出的結論很直接:
- 5090 幾乎是信手拈來
- MBP M1 Max 32GB 已經到「氣喘吁吁」的程度
- DGX Spark 雖然不完美,但仍能跑,而且比 MBP 快很多
最值得記錄的細節有三個:
1. 31B 模型本身就吃掉大量記憶體
貼文提到 31B 模型約 19GB,但問題不只在模型本體,還包括:
- KV cache
- runtime overhead
- 其他系統佔用
所以對 32GB RAM 機器來說,表面上看似「有機會」,實際上很容易超過安全邊界。
2. 一旦開始 swap,整個體感會斷崖式下降
貼文最關鍵的一句是:
- SSD 比 RAM 慢 100 倍
這不是小幅退化,而是等級差異。
當 macOS 開始把記憶體 swap 到 SSD 時,原本紙面上的統一記憶體優勢、頻寬優勢,幾乎都會被拖垮。這也是為什麼 32GB MBP 明明不是很弱的機器,碰到 31B dense 模型卻會明顯發燙、變慢。
3. DGX Spark 證明「容量足夠」可以反殺「頻寬較高但不夠裝」
貼文提到一個很有意思的結果:
- DGX Spark 頻寬只有 MBP 的 68%
- 但跑 31B 反而快 4 倍
原因不神秘:
- MBP 頻寬雖高,但記憶體不夠,進入 swap
- DGX Spark 頻寬比較低,但 128GB 記憶體足夠把整個 workload 留在主記憶體裡