Gemma 4 QAT GGUF:把大型多模態模型推進一般筆電的本機推論門檻
Gemma 4 QAT GGUF 的價值不只在量化,而是在把多模態、長上下文與本機推論推到一般筆電/消費級 GPU 可測的範圍;新增 12B Instruct 在 16GB 顯卡、LM Studio、256K context 的社群實測補充。
Unsloth 文件列出 Gemma 4 QAT GGUF 涵蓋 E2B、E4B、12B、26B-A4B、31B。它們被描述為多模態、hybrid-thinking 模型,支援 140+ 語言;小模型最高 128K context,12B 以上最高 256K context。
官方文件標示的建議總記憶體(RAM + VRAM 或 unified memory)約為:E2B 3GB、E4B 5GB、12B 7GB、26B-A4B 15GB、31B 18GB。這讓 26B-A4B / 31B 這類模型從「強桌機 GPU」更接近「高階筆電或統一記憶體機器」。
一般量化常是先訓練 BF16,再把權重壓到低位元;QAT 則在訓練過程中就讓模型適應量化誤差。Unsloth 文件稱 int4 QAT GGUF 相對 BF16 約降低 72% 記憶體使用,同時保留接近原始模型品質。
| 模型 | QAT GGUF 大小 | BF16 大小 | 建議總記憶體 | 定位 |
|---|---|---|---|---|
| Gemma 4 E2B QAT | 2.62 GB | 9.31 GB | 3 GB | 手機 / 輕量筆電測試入口 |
| Gemma 4 E4B QAT | 4.22 GB | 15.1 GB | 5 GB | 筆電、低門檻本機多模態 |
| Gemma 4 12B QAT | 6.72 GB | 23.8 GB | 7 GB | 較完整的本機助理 / 長上下文實驗 |
| Gemma 4 26B-A4B QAT | 14.2 GB | 50.5 GB | 15 GB | 高階筆電、消費級 GPU 的主力候選 |
| Gemma 4 31B QAT | 17.3 GB | 61.4 GB | 18 GB | 需要更大 unified memory / VRAM 的高階本機模型 |
文件中特別比較 naive Q4_0 與 Unsloth 轉換。以 26B 為例,naive Q4_0 的 Top-1 約 70.20%,Unsloth 版本為 85.63%;12B 則從 74.08% 提到 88.76%。這表示「同樣看起來是 4-bit」不代表品質相同,轉換方式本身會決定能不能保住 QAT 的訓練成果。