載入中...
載入中...
CODA 將 Transformer 的 normalization、activation、residual update、reduction 等 memory-bound 周邊運算改寫成 GEMM-plus-epilogue programs,趁 GEMM output tile 還在 chip 上時完成計算,減少 global memory round-trip。真正啟發在於用受限 composable API 讓 GPU kernel 最佳化更可被 LLM / 工程師組合。
Threads 貼文討論 xAI / SpaceXAI 將 Colossus 1 逾 22 萬張 GPU 算力提供給 Anthropic。整理技術與商業意義:H100/H200/GB200 異質叢集不一定適合單一大規模訓練,但很適合推論、微調、批次任務與 Claude Code / API 容量擴張。
這則 Threads 真正值得記錄的,不只是 Stanford CS153 很豪華,而是它點出 AI 產業兩個更底層的未解問題:第一,很多場景的進展速度不是由模型本身決定,而是由 context 能否被有效管理與驗證決定;第二,算力遠未成為真正可替代、可商品化的資源,這會持續重塑 AI 成本與競爭格局。