AI / Edge Agent
Qwen3 2B VL + NVIDIA NeMo 工具的本地 Agent 傳聞:手機跑 AI Agent 的訊號,但數字需查證
Threads 稱使用 Karpathy autoresearch 與 NVIDIA NeMo tools,讓 Qwen3 2B VL agent score 在 5 小時內從 25% 提升到 96.9%,且 Qwen3 2B 只需約 1GB 顯示記憶體。此訊號指向小模型本地 agent 的可行性,但 exact benchmark / repo / 官方實驗尚未找到,應列為待查證觀察。
2026年7月15日1 分鐘閱讀👁 6
Edge AI / Local Agent
Qwen3 2B VL + NVIDIA NeMo:本地 AI Agent 的可能訊號,但數字先列待查證
Threads 文章聲稱:使用 Karpathy autoresearch 與 NVIDIA NeMo tools,五小時內把 Qwen3 2B VL agent score 從 25% 提升到 96.9%;且 Qwen3 2B 只需要約 1GB 顯示記憶體。這個敘事很吸引人,因為它指向「手機或 edge device 跑 agent」的方向。
查證狀態:目前用 GitHub 搜尋沒有找到 exact phrase / repo / benchmark 對應結果;因此本文不把 96.9% 當成已驗證事實,而是保留為社群訊號。需要找到原始實驗 repo、evaluation task、模型版本、量化設定與硬體環境後,才能採信。
為什麼這件事值得追
- 小模型 agent 化:2B VL 如果能執行可靠的視覺/工具任務,代表很多 agent workflow 不必全部上雲。
- 記憶體門檻:1GB VRAM 等級會讓手機、筆電 iGPU、邊緣裝置更有想像空間。
- NeMo / distillation / data loop:如果改善來自自動研究、資料產生、評估與微調 loop,價值不在單一模型,而在「快速把小模型訓成任務專家」。
採信前必查清單
| 要查什麼 | 原因 |
|---|---|
| 原始 repo / notebook | 確認不是截圖或二手轉述。 |
| agent score 的 benchmark 名稱 | 不同 benchmark 96.9% 意義差很多。 |
| Qwen3 2B VL 的模型來源與 license | 商用與部署限制需確認。 |
| 1GB VRAM 的量化格式 | 可能是 INT4 / KV cache 條件下的推論記憶體。 |
| 是否包含工具調用 / browser / vision | 「agent」能力不能只看文字問答。 |
對 Allen 的判斷
可以追,但暫時不要以此作為產品承諾。若要投入,應設一個內部 benchmark:手機/邊緣裝置上跑「看畫面→決策→工具調用」的最小任務,實測 latency、成功率、發熱與耗電。