載入中...
Allen KB Articles
共 1 篇;目前第 1 / 1 頁,每頁 24 篇。
Threads 討論 Moonshot AI / 月之暗面的 Kimi Delta Attention (KDA) 如何從 Kimi Linear 的 48B/3B active 開源架構,延伸到 Kimi K3 2.8T 旗艦模型。官方 Kimi K3 文件確認:K3 是 2.8T parameters、1M-token context、native vision、built on KDA and AttnRes、Stable LatentMoE 896 experts / 16 active,並聲稱 scaling efficiency 約為 K2 的 2.5x;Kimi Linear 論文與 GitHub 確認 3:1 KDA-to-MLA hybrid、最多 75% KV cache reduction、1M context up to 6x decoding throughput。需 caveat:K3 完整權重官方說明為 2026-07-27 前釋出,本文發文時尚未以權重實測驗證;benchmark/幻覺與商業宣傳需分開看。