載入中...
載入中...
Threads @aiposthub 介紹 General Reasoning 的 BackSearch:讓 LLM 搜尋指定日期當下的網路,避免預測回測時混入後來更新的新聞,造成 temporal leakage。本文整理其評估價值:選舉/股價/球賽/地緣政治預測、量化策略回測、benchmark 可重現性,都需要區分「模型現在知道什麼」與「模型在那個時間點可知道什麼」。
Apple Machine Learning Research 的 NeurIPS 2025 論文用可控 puzzle environments 檢驗 Large Reasoning Models,提出三個複雜度區間:低複雜度標準 LLM 可能更好;中等複雜度 LRM 有優勢;高複雜度兩者都崩潰,且 LRM 會在仍有 token budget 時降低 reasoning effort。
Claw-Eval-Live 用 105 個市場訊號導向的 workflow tasks 評估 13 個 frontier models,第一名也只過 66.7%。真正重點不是分數,而是 benchmark 的 evidence contract:用 traces、audit logs、service state 與 artifacts 驗證 agent 是否真的完成工作。
這篇 Threads 真正有價值的地方,不是單純宣稱中美 AI 差距擴大,而是指出大模型競爭的核心其實是『真實世界資料迴圈』。當產業被 benchmark 與跑分文化綁架,再高的榜單成績也可能只是表面進步;真正拉開差距的,是誰能持續獲得真實使用者回饋、快速迭代並形成完整產品閉環。
這則 Threads 最值得記錄的,不是某張卡跑分多高,而是它清楚展示:在本地 LLM 推理裡,模型能否完整塞進記憶體,往往比紙面頻寬更決定真實體感。一旦開始 swap,理論優勢很快就會被 SSD 速度懲罰吞掉。
EsoLang-Bench:用冷門程式語言戳破 LLM 的「真正推理」假象——標準測驗 95%,換個語言直接 0%