Superpowers 6:Fable 自主研究 25 次實驗,把 sub-agent 開發流程成本砍 60%
Jesse Vincent 用 Fable 對 Superpowers 的 subagent-driven development 流程做 autoresearch:36 小時、25 次實驗,找到預先打包 reviewer packet、合併 spec/code review、條件式 Haiku implementer 等成本優化。作者宣稱 wall-clock 快 50%、token spend 降 60%。真正重點不是單一 prompt,而是 AI 已能建立研究 harness、假說紀錄、實驗與自我抓漏流程。
這篇 Threads 抓到一個很重要的 agent ops 訊號:最強模型的價值不只是「寫更多程式」,而是能自主建立研究系統,對 agent workflow 做實驗、記錄假說、修正測量錯誤,最後把流程成本打下來。
Jesse Vincent 在 Superpowers 6 文章中描述,他用 Fable 對 Superpowers 的 subagent-driven development build loop 做成本與速度優化。作者原本希望省 15% token,最後宣稱在約 36 小時、25 次實驗後,Superpowers build 的 wall-clock runtime 降 50%、token spend 降 60%。這些數字是作者與 repo 報告主張,本文未重跑 benchmark。
Fable 做了什麼
/goal once this is done, run an autoresearch loop to improve cost-efficiency of the superpowers build loop. test with opus as the coordinator. make an hypothesis log. run experiments. run at least 25 experiments.
這個 prompt 的重點不是文字本身,而是它讓 Fable 啟動了一個完整 autoresearch loop:
- 建立 hypothesis log,實驗前先登記預測。
- 跑至少 25 次實驗,另有 backlog。
- 使用 Opus 作 coordinator 測試。
- 把結果寫入 durable eval docs。
- 在過程中抓出測量 bug,例如 grep 誤計、harness 沒真的 inline diff、regex 漏 newline。
實驗找到的主要優化
| 優化 | 效果 / 意義 |
|---|---|
| Reviewer packet 預先打包 | 把 diff 與 metadata 先整理好,避免 reviewer subagent 自己跑大量 git commands。作者說單這點約省 10%。 |
| 合併 spec compliance reviewer 與 code quality reviewer | 減少 agent 間 handoff 與重複審查,作者說額外省約 15%。 |
| Terse reviewer contract | Reviewer output 減 41%,但 verdict 保持可用。 |
| Narration recipe | 輸出量減 54%,且 variance 低。 |
| Conditional Haiku implementers | 簡單實作下放便宜模型,每 run 約省 0.5–1 美元;但系統會拒絕把 prose plans 交給 Haiku。 |