OpenAI ARC-AGI-3 報告:retained reasoning 與 compaction 讓同一模型分數翻三倍
OpenAI 報告指出,ARC-AGI-3 官方 harness 因丟棄 private reasoning 與 rolling truncation,讓 GPT-5.6 Sol 難以累積互動經驗;改用 Responses API 的 retained reasoning 與 compaction 後,公開集 RHAE 從 13.3% 到 38.3%,output tokens 降 6 倍。
OpenAI 這篇 ARC-AGI-3 報告的重點不是「模型突然變聰明」,而是:互動式 agent benchmark 測到的不只是裸模型,也測 harness、API 設定、記憶保留、上下文壓縮與 prompt 設計。同一個 GPT-5.6 Sol,在官方 generic harness 下只拿 13.3% RHAE;改用 OpenAI 自家 Responses API 的 retained reasoning 與 compaction 後,分數升到 38.3%,output tokens 還少 6 倍。
OpenAI 發現的兩個問題
| 官方 harness 行為 | 造成的問題 | OpenAI 替代做法 |
|---|---|---|
| 每個 game action 後丟棄 private reasoning | 模型可看到過去 moves 與簡短 notes,但看不到形成策略的 plans / insights / thoughts;等於每回合重新理解遊戲。 | Retained reasoning:透過 Responses API 傳 previous response ID,跨 tool calls / turns 保留 reasoning。 |
| Rolling truncation | 上下文超過限制後直接丟掉最舊訊息,長局中連早期 actions / observations 都消失。 | Compaction:用摘要壓縮保留關鍵經驗,而不是粗暴截斷。 |
數字
- 官方 harness:GPT-5.6 Sol 在 ARC-AGI-3 public set 得分 13.3% RHAE。
- Responses API harness:開啟 retained reasoning + compaction 後得分 38.3%。
- output tokens:約降為原本的 1/6。
- OpenAI 另提到 GPT-5.6 Sol 原榜分數曾為 7.8%,GPT-5.5 約 0.4%;本文核心比較以官方文中 13.3% → 38.3% 為準。
為什麼 retained reasoning 會省 token
官方 harness 每一步都讓模型失去前一輪完整推理,因此模型必須反覆重新理解遊戲規則。保留 reasoning 後,模型不必每回合重建策略;compaction 又能把早期觀察與規則猜測濃縮保留。結果是:模型每步需要輸出的思考更少,行動更連貫。
Threads 討論中的重要反方
- 通用性問題:這套 harness 是否能換到不同遊戲、不同互動方式仍有效?如果需要針對任務改寫,就有 benchmark-specific optimization 的疑慮。
- 上下文成本:保留多少 context 給 harness、多少給任務本身,是工程取捨,不是免費午餐。
- 評測公平性:François Chollet 對 ARC 類 benchmark 的立場通常區分「為 benchmark 客製的 harness」與「所有 API 使用者都可用的一般設定」。這條線要說清楚。
對 Allen / Hermes 的含意
Agent 不要失憶
長任務中要保留 plan、已試過的路、失敗原因與環境觀察,不要只留最後輸出。
Compaction 比 truncation 好
上下文滿了不該直接砍舊紀錄;要把 durable facts、策略、工具結果與風險 caveat 壓成結構化 state。