Kimi K3 與 KDA:Moonshot 把「降低 KV Cache」推到 2.8T 旗艦模型
Threads 討論 Moonshot AI / 月之暗面的 Kimi Delta Attention (KDA) 如何從 Kimi Linear 的 48B/3B active 開源架構,延伸到 Kimi K3 2.8T 旗艦模型。官方 Kimi K3 文件確認:K3 是 2.8T parameters、1M-token context、native vision、built on KDA and AttnRes、Stable LatentMoE 896 experts / 16 active,並聲稱 scaling efficiency 約為 K2 的 2.5x;Kimi Linear 論文與 GitHub 確認 3:1 KDA-to-MLA hybrid、最多 75% KV cache reduction、1M context up to 6x decoding throughput。需 caveat:K3 完整權重官方說明為 2026-07-27 前釋出,本文發文時尚未以權重實測驗證;benchmark/幻覺與商業宣傳需分開看。
Moonshot AI / Kimi K3 / KDA / Long Context
KDA 的訊號:長上下文競爭開始從「壓縮 KV Cache」走向「重寫 attention 架構」
Threads 這篇把 Moonshot AI(月之暗面)的 Kimi Delta Attention, KDA 描述為「消滅 KV Cache」的新架構,並指出它已從 Kimi Linear 的開源試金石,延伸到 2.8T 參數級的 Kimi K3 旗艦模型。實際查證後,應更精準地說:KDA 不是魔法式完全不要記憶體,而是用 hybrid linear attention / finite-state memory 的方式,顯著降低長序列推論中的 KV cache 壓力與 memory bandwidth bottleneck。
Threads 主張與查證狀態
| 主張 | 查證結果 | 備註 |
|---|---|---|
| Kimi Linear 採用 3:1 KDA 線性層 : MLA 全注意力層 | GitHub / arXiv 可驗證。 | Kimi Linear paper 寫明 layerwise hybrid of KDA and MLA;GitHub 寫 3:1 KDA-to-global MLA ratio。 |
| Kimi Linear 48B total / 3B activated / 1M context | GitHub / HF 可驗證。 | 模型含 Base 與 Instruct,HF card/license metadata 為 MIT。 |
| KV cache 最多降低 75%、1M context decoding throughput 最高 6x | Kimi Linear arXiv / GitHub 可驗證為作者聲明。 | 這是 Moonshot/Kimi Team 實驗聲明,不是我方重跑 benchmark。 |
| Kimi K3 2.8T、KDA + AttnRes、1M context、native vision | Kimi API 官方文件可驗證。 | 官方稱 K3 是 3T class open-source model,2.8T parameters。 |
| Kimi K3 完整權重已向全球開源 | 需修正。 | 官方文件寫「full model weights will be released by July 27, 2026」。本文處理時尚未驗證權重已釋出。 |
Kimi Linear:KDA 的開源試金石
MoonshotAI/Kimi-Linear 與 arXiv:2510.26692 將 Kimi Linear 定位為 hybrid linear attention architecture。核心是 Kimi Delta Attention (KDA):在 Gated DeltaNet 的基礎上加入 finer-grained gating,讓有限狀態 RNN memory 更有效率地保留與更新資訊。
| 項目 | Kimi Linear 查證資訊 |
|---|---|
| 模型 | Kimi-Linear-48B-A3B-Base / Instruct |
| 參數 | 48B total parameters,3B activated parameters |
| Context | 1M tokens |
| 架構 |