LLM Inference / Hardware
LLM decoding 速度先看記憶體頻寬:RTX 5090、RX 7900 XTX、M3 Ultra、DGX Spark 的採購判斷
Threads 以記憶體頻寬解釋 token decoding 速度,提到 RX 7900 XTX、RTX 4090、M3 Ultra、DGX Spark、RTX 5090、RTX Pro 6000 的差異。本文用官方規格校正 DGX Spark 273 GB/s、Apple M3 Ultra over 800GB/s、RX 7900 XTX 960GB/s / effective 3500GB/s,並整理本地 LLM 採購判斷。
2026年8月4日1 分鐘閱讀👁 3
Threads 知識整理 · AI Hardware
這則 Threads 的核心觀念是對的:LLM autoregressive decoding 時,每產生一個 token 都要大量讀取權重與 KV cache,所以記憶體頻寬往往比峰值 FLOPS 更直接影響 token/s。
Matt 判斷:買本地 LLM 硬體不能只看「AI TOPS」或模型宣傳。若是 decoding / chat / agent workload,要同時看 VRAM 容量、記憶體頻寬、軟體支援與功耗。DGX Spark 的賣點是整合與大 unified memory,不是跟 RTX 5090 拼 raw bandwidth。
## 官方規格校正
| 硬體 | 官方可驗證重點 | 對 LLM 的含義 |
|---|---|---|
| NVIDIA DGX Spark | 128GB LPDDR5x coherent unified memory;memory bandwidth 273 GB/s | 容量大、整合度高,但 decoding 頻寬不是消費級高階 GPU 等級。 |
| Apple M3 Ultra | Apple 新聞稿稱 over 800GB/s memory bandwidth;最高 512GB unified memory | 適合大記憶體本地工作流,但 CUDA 生態與 GPU server stack 需分開評估。 |
| AMD RX 7900 XTX | 24GB GDDR6;memory bandwidth up to 960 GB/s;effective bandwidth up to 3500 GB/s | raw bandwidth 不差,但 ROCm / 框架支援與實際 LLM kernel 很關鍵。 |
| RTX 5090 | 32GB GDDR7 | 容量 32GB 對許多本地模型夠用;頻寬與 CUDA 生態是強項。 |
| RTX Pro 6000 Blackwell | Threads 指稱與 5090 同晶片附近,差異主要是 96GB ECC / 商用定位 | 若要長任務、多人、專業保固與大模型,容量比單純跑分更重要。 |
## 採購判斷
- 模型是否塞得下:先看 VRAM / unified memory 容量。
- 互動速度:decoding token/s 看頻寬與 kernel 實作。
- 工作型態:批次離線可容忍慢;語音客服、agent loop、coding assistant 不能慢。
- 生態:CUDA / vLLM / llama.cpp / MLX / ROCm 的成熟度會直接影響可用性。