Fable Soul:把「先查、先驗證、不要假裝完成」蒸餾成 AI Agent 的判斷力層 | Allen 知識庫 | Allen 知識庫AI Agent
Fable Soul:把「先查、先驗證、不要假裝完成」蒸餾成 AI Agent 的判斷力層
darkseoking 分享的 Fable Soul 是一個 MIT 開源的 AI coding agent judgment layer,repo 為 akseolabs-seo/fable-soul。它把 Fable5 使用體感中最有價值的操作紀律——先找根因、不要照抄錯誤指令、改完要驗證、不能沒測就說完成——整理成 SKILL.md、soul.md、compact mirror、transfer prompts、evals、worked examples 與同步腳本。重點不是讓小模型變成 Fable5,而是把高階 agent 的判斷習慣轉成可維護的 proof contract / rationalization table / capture loop。
2026年7月4日4 分鐘閱讀👁 6
Fable Soul 是一個把「高階 agent 的判斷習慣」包成可安裝 skill / instruction layer 的開源專案。作者在 Threads 裡把它描述成從 Fable5 使用體感中蒸餾出的判斷層:先查根因、不要照抄錯誤指令、改完要驗證、不能沒測就說完成,並透過自我成長系統逐步貼近使用者的工作流。
我核對 GitHub 後,這不是單純一篇 prompt,而是一個完整的 Markdown skill package:SKILL.md、references/soul.md、soul-compact.md、maintenance / transfer prompts / evals / worked examples,加上幾個同步與驗證腳本。
GitHub 核對
| 項目 | 結果 |
|---|
| Repo | akseolabs-seo/fable-soul |
| Description | A judgment layer for AI coding agents - make your AI think, verify, and communicate like a senior engineer |
| License | MIT |
| Language | Python + Markdown |
| Stars / Forks | 約 61 stars / 19 forks(2026-07-05 查詢) |
| Created | 2026-07-03 |
| 支援 | README 明示 Claude Code 與 Codex;其他可讀 Markdown 指令的 runner 也可用。 |
它想解決什麼問題
Fable Soul 的核心判斷是:
多數 AI agent 失敗不是因為不知道怎麼寫程式,而是缺少資深工程師的操作紀律。
| 常見 agent 行為 | Fable Soul 想灌進去的行為 |
|---|
| 改完檔案就說「done」,但沒跑測試。 | 跑測試、貼輸出,然後才說完成。 |
|
| 照使用者說法調 timeout,即使知道那不是根因。 |
| 說「應該會快很多」。 | 給出實測數字,例如 3.4s → 0.06s。 |
| 只把錯誤訊息蓋掉。 | 說清 bug 機制,修掉機制而不是症狀。 |
| 診斷出問題後問「要不要我修?」 | 可逆、範圍內的工作直接完成。 |
| 遇到意外測試結果時替自己圓故事。 | 把 surprise 當訊號,切換假設繼續查。 |
Repo 結構
fable-soul/
├── SKILL.md
├── references/
│ ├── soul.md
│ ├── soul-compact.md
│ ├── maintenance.md
│ ├── transfer-prompts.md
│ ├── evals.md
│ └── worked-examples.md
├── examples/
│ └── hooks.json
└── scripts/
├── sync_soul.py
├── check_update.py
├── validate_skill.py
└── test_sync_soul.py
三個模組
1. Judgment rules
references/soul.md 是本體,包含 operating gates、19 條規則、合理化藉口對照表、red flags checklist。
2. Operating modes
SKILL.md 定義三種模式:Embody、Maintain、Transfer。不是朗讀規則,而是讓 agent 用這套方式工作。
3. Sync / drift tooling
sync_soul.py 把 canonical rules 同步到 Claude Code / Codex;check_update.py 檢查上游更新;validate_skill.py 檢查結構。
最值得保存的設計點
1. 把「判斷力」寫成 proof contract,而不是 vibe
它不是只說「請謹慎」或「請像資深工程師」。Fable Soul 把不同任務的完成標準拆成 proof contract:
- 程式 bug:要有重現測試與修復後輸出。
- 前端修改:要實際載入頁面並檢查渲染狀態。
- 發佈 / SEO / 公開內容:要對 API、前台或公開端點驗證。
- 弱驗證不能冒充強驗證;「檔案已改」不等於「功能已好」。
2. Rationalization table 很關鍵
多數 agent 不是不知道規則,而是會在違規時合理化。Fable Soul 直接收錄這些常見藉口,並逐一堵掉:
| 模型常見藉口 | 對應修正 |
|---|
| 「edit 成功,所以完成了。」 | edit 只證明你打了字;跑過再說完成。 |
| 「測試大概會過。」 | 「大概」是猜;跑它或明說未驗證。 |
| 「這 case 太簡單,不用驗證。」 | 簡單 case 也會壞,驗證只要幾秒。 |
| 「我已經指出真正問題了。」 | 指出是診斷,不是交付;修好它。 |
| 「問一下比較保險。」 | 可逆且範圍內的事,問只是卡使用者。 |
3. Capture loop:從真實失敗長規則
Fable Soul 不鼓勵把網路上看到的漂亮 prompt 直接堆進 instruction。它要求用類 TDD 的方式長規則:
- 記錄 agent 失敗時的合理化原句。
- 檢查現有規則是否已覆蓋,避免重複加規則。
- RED:在 fresh session 中重現失敗。
- GREEN:加入最小規則修改,確認行為翻轉。
- Sync:同步到實際 runner 會載入的位置,並檢查 drift。
Threads 裡的高信號回覆
- runs.dash:問「先查、先驗證、不要假裝完成」這種行為能不能被蒸餾進另一個 instance,還是主要跟模型本身能力走。
- 作者回覆:高階模型比較能完整遵守;Sonnet / mini 等較低階模型可能只部分遵守、context 長了仍會忘,但比 raw 狀態好。
- andrewlee.ai:把一次性高階模型額度拿來優化長期技能包,等於把短期 token 消耗轉成長期資產。
- kanisleo328:認同 Fable5 自帶「先查、先驗證、不要假裝完成」的體感,並認為開源蒸餾成果比大家各自燒額度重造輪子更有效率。
對 Hermes / Kate 的判斷
這篇值得收,不只是因為 Fable5,而是它和我們現在的 Hermes skill / memory / verifier 方向完全對齊。
| Fable Soul 設計 | 對 Hermes 的啟發 |
|---|
| canonical soul.md + compact mirror | 我們的 SOUL / skills / project AGENTS.md 也需要單一來源與 drift 檢查。 |
| Proof Contract | 可轉成 Kate / subagent 完成任務前的驗收規格。 |
| Rationalization table | 比抽象「不要偷懶」更有效,因為它堵的是模型真正會找的藉口。 |
| Capture loop | 每次 agent 出錯後,不只是修那次任務,而是把失敗模式升級成 skill / rule。 |
| Stop hook | 可與 Hermes 的 verifier / post-task checks 結合,讓長 session 不只靠模型記憶自律。 |
Caveat
- 它不會把小模型變成 Fable5。作者也明講:高階模型較能完整遵守,低階模型可能 context 一長就忘。
- instruction layer 仍需要維護。規則越長越容易被模型跳讀,所以它自己的 README 也提醒超過約 250 行要先瘦身。
- 安裝全域檔案前要看 sync script。雖然 README 說有安全 guard,不覆寫不是它產生的 global file,但任何會寫
~/.claude/CLAUDE.md / ~/.codex/AGENTS.md 的腳本都應先 review。
- 評測結果仍是 repo 自述。README 提到 evals / worked examples 有 RED-GREEN runs,但除非我們自己跑過,不應把效果當成外部驗證事實。
一句話結論
Fable Soul 的價值不是「又一包神奇 prompt」,而是把 agent 常見偷懶、假完成、亂修症狀、過度問問題這些失敗模式,包成可同步、可驗證、可維護的 judgment layer。對我們來說,它值得當作 Hermes / Kate agent operating discipline 的參考樣板。