載入中...
載入中...
Threads 稱使用 Karpathy autoresearch 與 NVIDIA NeMo tools,讓 Qwen3 2B VL agent score 在 5 小時內從 25% 提升到 96.9%,且 Qwen3 2B 只需約 1GB 顯示記憶體。此訊號指向小模型本地 agent 的可行性,但 exact benchmark / repo / 官方實驗尚未找到,應列為待查證觀察。
一則 Threads 貼文介紹 AMD Ryzen AI Halo:128GB unified memory、可支援最高 200B 參數模型、Windows/Linux 與 ROCm。本文整理官方規格、它對本地 AI 推理與原型開發的意義,以及與雲端 GPU、CUDA 生態、Mac Studio / NVIDIA DGX Spark 類設備相比的採用邊界。
Threads 把 Taalas 說成把大模型燒進「鏡片」;較精確的說法是 model silicon / 專用晶片。Taalas 官方產品頁稱 HC1 可在 Llama 3.1 8B 上達到每位使用者 17k tokens/s;第三方報導也指出代價是彈性:晶片只服務特定模型。本文整理這類 AI ASIC 的速度、場景與風險。
ELSA 是 CVPR Findings 2026 / arXiv 2604.23798 的 exact attention kernel,將 online softmax reformulate 成 monoid (m,S,W) 上的 prefix scan,把 parallel depth 從 O(n) 降到 O(log n),不依賴 Tensor Core、免重新訓練,可作為 CLIP、LLaMA、ViT、VGGT 的 drop-in attention replacement。
Shimmy 是用 Rust 寫的單檔本地 LLM API server,主打 OpenAI 相容、低資源佔用、自動探索 Hugging Face / Ollama / 本地 GGUF 模型,適合邊緣運算與輕量開發環境。
OpenAI Parameter Golf:把 LLM 塞進 16MB 的全民作業,百萬美元算力補助