載入中...
Allen KB Articles
共 9 篇;目前第 1 / 1 頁,每頁 24 篇。
Threads 以記憶體頻寬解釋 token decoding 速度,提到 RX 7900 XTX、RTX 4090、M3 Ultra、DGX Spark、RTX 5090、RTX Pro 6000 的差異。本文用官方規格校正 DGX Spark 273 GB/s、Apple M3 Ultra over 800GB/s、RX 7900 XTX 960GB/s / effective 3500GB/s,並整理本地 LLM 採購判斷。
AirLLM 是 Apache-2.0 的 Python / GitHub 專案,主打不用量化、蒸餾或剪枝,透過逐層拆分與載入把 70B 模型跑在 4GB GPU,405B 跑在 8GB,DeepSeek-V3 約 12GB,Kimi K3 2.8T 官方 release 聲稱在 RTX 6000 Ada 上峰值 3.72GB VRAM。本文整理技術原理、安裝、瓶頸與適用場景。
MozaikPlayer-Public 是 GitHub 上的 AI 去馬賽克播放器釋出頁,支援 macOS Apple Silicon 與 Windows NVIDIA CUDA,v1.3.0 加入串流即時融合與串流匯出。本文整理功能、平台條件、無 LICENSE caveat 與合法/隱私風險。
一則 Threads 貼文介紹 AMD Ryzen AI Halo:128GB unified memory、可支援最高 200B 參數模型、Windows/Linux 與 ROCm。本文整理官方規格、它對本地 AI 推理與原型開發的意義,以及與雲端 GPU、CUDA 生態、Mac Studio / NVIDIA DGX Spark 類設備相比的採用邊界。
Kaggle Notebook 的免費 GPU 是很好用的低成本實驗室,但要理解 session、quota、排隊、保存與平台政策限制;它適合學習與原型,不適合當成無限制雲端主機。
Threads 貼文討論 xAI / SpaceXAI 將 Colossus 1 逾 22 萬張 GPU 算力提供給 Anthropic。整理技術與商業意義:H100/H200/GB200 異質叢集不一定適合單一大規模訓練,但很適合推論、微調、批次任務與 Claude Code / API 容量擴張。
Threads 貼文從台灣 AI 代工廠可能報廢 / 退役的 GB200 資源切入,提醒台灣雖有 AI 製造鏈與股市紅利,卻仍缺主權 AI、算力與模型。重點不是「捐 GPU」本身,而是台灣能否把製造端資源轉成教育、研究與國家級算力基礎建設。
能源即算力》散熱卡關、算力白燒,AI 資料中心下一場硬仗:從「搶電」到「省電」