AI Evaluation / Research
BackSearch:讓 LLM 回測只能看到「當時已公開資訊」,避免偷看未來
Threads @aiposthub 介紹 General Reasoning 的 BackSearch:讓 LLM 搜尋指定日期當下的網路,避免預測回測時混入後來更新的新聞,造成 temporal leakage。本文整理其評估價值:選舉/股價/球賽/地緣政治預測、量化策略回測、benchmark 可重現性,都需要區分「模型現在知道什麼」與「模型在那個時間點可知道什麼」。
2026年7月25日1 分鐘閱讀👁 5
LLM Evaluation × Temporal Leakage × Backtesting
AI 預測能力要可信,第一步是不能偷看未來
BackSearch 的重要性在於把 web search 加上時間邊界:測 2026/3/1 的預測,就不能讓模型看到 2026/3/2 之後的答案與事後解釋。
它解決什麼問題
一般搜尋引擎會把「事件發生後」的新聞、分析、修正頁面混進結果。當你用 LLM 回測選舉、股價、球賽或國際事件預測時,模型可能無意間讀到答案,導致 benchmark 看起來很準,實際上是資料洩漏。
| 沒有時間邊界 | 有 BackSearch 類時間邊界 |
|---|---|
| 搜尋結果混入事後新聞與後來更新內容。 | 只允許指定日期以前已公開資料。 |
| 預測準確率被高估。 | 更接近真實世界「當下資訊」決策。 |
| benchmark 難以重現。 | 可凍結資料環境,提升可重現性。 |
適用場景
- 事件預測:選舉、體育賽事、政策結果、地緣政治。
- 量化金融:避免把事後公告、修正財報、後來分析混進策略回測。
- AI agent 訓練:模擬某時間點的真實資訊環境。
- Benchmark:區分「模型推理能力」與「資料外洩」。
Kate caveat:目前 Threads 說 BackSearch 先開放 2026 年新聞領域的小部分索引;我沒有找到可直接查證的公開 BackSearch 產品頁。這篇先收概念與評估框架,實際 API/索引覆蓋率要等官方文件或 demo 明確後再補。