AI Agent
/prewalk:便宜模型何時接手?重點不是交接計畫,而是交接「已探索過的 context」
Threads 轉述 Can Bölük / Stencil 的 /prewalk:昂貴 frontier model 先深入閱讀、建立 todo、並完成第一個 edit,再把完整軌跡交給便宜模型接手。核心洞察是 coding agent 的 token 成本主要在閱讀而非寫入;傳統 /plan 只交接摘要會讓便宜模型重讀整個 repo,反而可能更貴。搜尋結果與相關 repo 轉述 Stencil SWE-Bench Pro 實驗主張:保留約 92–97% frontier pass rate、成本約減半,特定設定下成本降 41%、速度 1.9×。
2026年7月23日2 分鐘閱讀👁 5
Coding Agents · Model Routing · Cost Optimization
讓昂貴模型先寫計畫、便宜模型照計畫做,聽起來合理;但如果便宜模型只拿到幾千 token 摘要,沒有探索軌跡,它往往得重新讀完整 repo。/prewalk 的洞察是:交接 trajectory,不是交接 plan。
查證狀態:Threads 連到 Stencil 原文
stencil.so/blog/prewalk,但實測 Jina reader 回 520;DuckDuckGo 摘要與多個 GitHub 實作 repo 仍可互相印證主張:/prewalk 在 SWE-Bench Pro 上保留約 92–97% frontier pass rate、成本約降半,特定轉述為 41% lower cost、1.9× faster。這些數字應視為 Stencil / repo claim,非 Kate 重跑 benchmark。Threads 原文重點
- 同一 SWE-Bench Pro 任務:Opus 4.8 規劃、Flash 執行成本 $3.18;Opus 自己做完 $2.78,通過率相同,傳統 plan handoff 反而貴 14%。
- 18.1 億 token 用量統計顯示:edit/write 僅約 9%,agent 成本主要在閱讀。
- /plan 失敗原因:frontier 模型讀完整 repo 後只交給便宜模型摘要;便宜模型沒有路徑,只能重讀。
- /prewalk:frontier 模型先深入閱讀、列 todo、開始動手;第一次 edit 落地後切到便宜模型,保留完整 context trajectory。
/plan vs /prewalk
| 模式 | 交接內容 | 問題 / 優勢 |
|---|---|---|
/plan | 一份計畫書 / spec 摘要 | 便宜模型看不到探索軌跡,容易重讀、誤解或漏掉約束。 |
/prewalk | 完整上下文、探索、todo、第一個 edit 後的狀態 | 便宜模型像是「自己剛探索完」接續執行,避免雙重閱讀成本。 |
對 Athena / Hermes 的設計啟發
Frontier prewalk phase
高階模型負責讀 repo、找風險、建立 todo、確認測試入口,並完成第一個低風險 edit。
Context-preserving handoff
交接 transcript / tool ledger / todo / diff,而不是把長上下文壓成短摘要。
Cheap executor phase
便宜模型在既有 trajectory 上做剩餘 edit、跑測試、修小錯。
Frontier reviewer phase
必要時最後回到高階模型做 code review / risk check,而不是全程昂貴模型。