載入中...
載入中...
RAGU 把 GraphRAG 的知識圖譜建構拆成兩階段萃取、DBSCAN 去重、LLM 濃縮與 Leiden 社群偵測;論文聲稱 7B Meno-Lite 在知識圖譜建構上相對 Qwen2.5-32B 有 +12.5% harmonic mean,GraphRAG-Bench Medical 證據召回最高 0.84。適合作為「管線內 LLM 不必越大越好」的架構訊號,但仍需以實際語料重測。
Threads @aiposthub 介紹 General Reasoning 的 BackSearch:讓 LLM 搜尋指定日期當下的網路,避免預測回測時混入後來更新的新聞,造成 temporal leakage。本文整理其評估價值:選舉/股價/球賽/地緣政治預測、量化策略回測、benchmark 可重現性,都需要區分「模型現在知道什麼」與「模型在那個時間點可知道什麼」。
Langfuse 是 open-source AI engineering platform,將 prompt management、eval/dataset、LLM-as-a-judge、trace、token/cost/latency 與 self-host 部署串成 AI 產品的工程閉環。重點不是單一工具,而是讓 prompt 與模型變更可版本化、可評估、可回溯。
整理 Threads 對 AgentOpt 研究的反直覺觀察:Ministral 8B 當 Planner、Opus 當 Solver 在 HotpotQA 上可達 74.27%,而 Opus 放 Planner 可能因直接回答而破壞委派流程。重點不是弱模型比較好,而是模型要符合節點角色;Planner、Solver、Advisor 的責任邊界要先定義。