載入中...
載入中...
Modal 官方宣布 Kimi K3 by Moonshot 已上 Shared API,採 OpenAI 相容介面與 token-based pricing;Starter 方案頁與 llms.txt 均確認每月 $30 免費額度。這篇整理可試用價值、超額扣款風險、Workspace Budget / billing guardrail 與 BigIntTech PoC 使用方式。
Threads 討論 Moonshot AI / 月之暗面的 Kimi Delta Attention (KDA) 如何從 Kimi Linear 的 48B/3B active 開源架構,延伸到 Kimi K3 2.8T 旗艦模型。官方 Kimi K3 文件確認:K3 是 2.8T parameters、1M-token context、native vision、built on KDA and AttnRes、Stable LatentMoE 896 experts / 16 active,並聲稱 scaling efficiency 約為 K2 的 2.5x;Kimi Linear 論文與 GitHub 確認 3:1 KDA-to-MLA hybrid、最多 75% KV cache reduction、1M context up to 6x decoding throughput。需 caveat:K3 完整權重官方說明為 2026-07-27 前釋出,本文發文時尚未以權重實測驗證;benchmark/幻覺與商業宣傳需分開看。
Threads 文章解釋 Kimi Linear Attention(KLA/KDA)的核心:以 75% Kimi Delta Attention 線性注意力處理局部/有限狀態記憶,再保留 25% Multi-Head Latent Attention 做全局觀察。官方 arXiv 論文與 Hugging Face 模型卡驗證:Kimi Linear 48B-A3B 採 3:1 KDA-to-global MLA ratio、1M context、MIT license,宣稱最高可減少 75% KV cache、1M context 解碼吞吐最高約 6x。
Moonshot AI 的 Kimi K2.6 官方技術文確認了 Agent Swarm、長時程 coding、300 個 sub-agents 與 4,000 coordinated steps 等方向。可保存的重點不是單一 benchmark 輸贏,而是 agent 系統正在從「一個模型回答」走向「多代理平行執行與調度」。