Anthropic 工程 Blog:AI Agent 的「上下文焦慮」——跑到一半開始偷工減料的真正原因
Anthropic 工程 Blog:AI Agent 的「上下文焦慮」——跑到一半開始偷工減料的真正原因
title: "Anthropic 工程 Blog:AI Agent 的「上下文焦慮」——跑到一半開始偷工減料的真正原因" date: 2026-03-26 author: gazai.ai source: https://www.threads.com/@gazai.ai/post/DWV_DM6ifNw category: threads tags:
- Anthropic
- Agent 架構
- Context Window
- Multi-Agent
- 工程實踐 created: 2026-03-27 updated: 2026-03-27
Anthropic 工程 Blog:AI Agent 的「上下文焦慮」——跑到一半開始偷工減料的真正原因
原文摘要
作者整理 Anthropic 最新工程 blog Harness design for long-running application development 的核心觀點。
Context Anxiety(上下文焦慮)
現象: AI Agent 跑長任務跑到一半,突然開始偷工減料。
當 model 感知到 context window 快要滿了,它不會告訴你「我快不行了」——它會靜靜地開始跳過細節、簡化實作、急著把手上的事收尾。
這不是能力不足,不是幻覺,是一種「焦慮反應」。
Anthropic 發現,光靠 compaction 還不夠。有時候讓 agent 整個 reset、重新注入關鍵 context,比硬撐下去效果更好。
AI 不擅長評價自己
讓 agent 自己 QA 自己的產出時,它會先挑出問題,然後自己說服自己那不是問題:
- 「這個 bug 不影響核心功能啦。」
- 「整體品質還是很高的。」
跟工程師 review 自己 PR 的心態一模一樣。 你永遠沒辦法靠同一個人既寫 code 又抓 bug。
解法:從 GAN 借來的對抗架構
把 Generator 和 Evaluator 拆成兩個獨立 Agent:
- Generator:專心產出
- Evaluator:刻意調成懷疑論者(skeptic)——用 Playwright 實際操作 live app、截圖、點按鈕、打 API、查 DB
與其讓一個 model 學會自我批判,不如直接養一個外部的懷疑論者。 Separation of concerns 不只是 code architecture 的原則,也是 agent architecture 的原則。
數字說話
| 模式 | 時間 | 成本 | 結果 |
|---|---|---|---|
| Solo run | 20 分鐘 | $9 | 畫面漂亮但核心功能全壞 |
| Full harness(多 Agent 對抗迭代) | 6 小時 | $200 | 功能完整、可實際使用 |
| Opus 4.6 + 簡化 harness | 3 小時 50 分 | $124.70 | 同等品質,架構更簡單 |
$9 買到 demo,$200 買到 product。
最值得記住的觀點
Harness 裡每個 component 都隱含一個假設——「model 目前做不到某件事」。每次新 model 發布,第一件事不是加東西,是回頭驗證這些假設還成不成立。
我們太容易 over-engineer:加 guardrail、加 retry、加 validator。但如果底層 model 已經能 handle,這些全都變成 overhead。
架構的複雜度應該隨模型進步往下降,不是只升不降。
核心觀點
1. 和知識庫多篇文章直接呼應
- Claude Code 假測試:Agent 自己 QA 自己 → 永遠通過 → 需要外部驗證
- Claude Code /last-word:context 到 40% 就開始退化 → context anxiety 的具體表現
- gstack /review:找「能過 CI 但正式環境崩的 Bug」→ 就是 Evaluator 角色
2. Context anxiety 解釋了很多「AI 突然變笨」的現象
不是模型降級了,是 context 快滿了。解法不是硬撐,是 reset + 重新注入關鍵 context。
3. 隨模型進步要做減法不是加法
這和前面 AgentOS「少一層框架少一層會壞」是同一個思路。