載入中...
載入中...
Threads 分享 taione.org/gosf/about,稱軟體學生與 30 歲以下朋友可參與開源,最高 72 萬。官方頁顯示開源基金會計畫、雙軌制獎勵金最高月領 NT$30,000;新聞頁提到 vLLM、Kubernetes、Ray、Apache Airflow、Kafka 等關鍵專案與三年投入 3 億元。
Threads 討論 Moonshot AI / 月之暗面的 Kimi Delta Attention (KDA) 如何從 Kimi Linear 的 48B/3B active 開源架構,延伸到 Kimi K3 2.8T 旗艦模型。官方 Kimi K3 文件確認:K3 是 2.8T parameters、1M-token context、native vision、built on KDA and AttnRes、Stable LatentMoE 896 experts / 16 active,並聲稱 scaling efficiency 約為 K2 的 2.5x;Kimi Linear 論文與 GitHub 確認 3:1 KDA-to-MLA hybrid、最多 75% KV cache reduction、1M context up to 6x decoding throughput。需 caveat:K3 完整權重官方說明為 2026-07-27 前釋出,本文發文時尚未以權重實測驗證;benchmark/幻覺與商業宣傳需分開看。
Threads 文章解釋 Kimi Linear Attention(KLA/KDA)的核心:以 75% Kimi Delta Attention 線性注意力處理局部/有限狀態記憶,再保留 25% Multi-Head Latent Attention 做全局觀察。官方 arXiv 論文與 Hugging Face 模型卡驗證:Kimi Linear 48B-A3B 採 3:1 KDA-to-global MLA ratio、1M context、MIT license,宣稱最高可減少 75% KV cache、1M context 解碼吞吐最高約 6x。
Threads 貼文整理 2026 年本地 LLM / LocalLLaMA 社群對 MTP 與 DSpark 的討論。本文補充 arXiv 2607.05147 與 GitHub/PR 驗證,說明 Multi-Token Prediction、DSpark semi-autoregressive drafter、confidence-scheduled verification 的差異與落地 caveat。
NVIDIA Nemotron 3 Nano Omni 把文字、圖片、影片、音訊、OCR、語音轉錄、GUI 理解與工具調用整合成單一 30B-A3B MoE 模型,已可透過 LM Studio、Ollama、llama.cpp、vLLM、SGLang 等路徑使用;真正重點不是「又一個模型」,而是企業級本地多模態 Agent 的部署門檻正在下降。
Chandra OCR 2 的重點不是單純辨識文字,而是把 PDF、掃描文件、表格、公式、手寫表單等保留結構後轉成 Markdown/HTML/JSON,降低 RAG 與 Agent 文件處理的清洗成本。
rvLLM:用 Rust 從零重寫 vLLM,啟動快 20 倍、安裝包小 31 倍、吞吐量 1.7 倍