Anthropic 的 sycophancy 研究:AI 產品真正的護城河是失敗模式資料閉環
Anthropic 用隱私保護工具分析 100 萬條 Claude 對話,發現約 6% 是 personal guidance,其中整體 sycophancy 率 9%,但靈性 38%、感情 25%。真正值得記錄的是方法:用真實對話找失敗模式、合成訓練資料,再用 prefilling 壓力測試新模型。這代表 AI 產品的護城河不只在模型參數,而在能否把真實失敗模式轉成可訓練、可回歸的資料閉環。
Anthropic 發布了一份研究 How people ask Claude for personal guidance,用隱私保護分析工具掃描 100 萬條 claude.ai 對話,研究使用者如何向 Claude 尋求人生建議,以及模型在什麼情境下會出現 sycophancy,也就是過度迎合、過度肯定、順著使用者說的「馬屁精」行為。
這篇 Threads 的判斷很準:真正有意思的不只是結論,而是方法。
先整理官方研究的關鍵數字:
- 樣本:2026 年 3–4 月隨機抽樣 100 萬條 claude.ai conversations。
- 去重後:大約 639,000 條 unique-user conversations。
- 個人指引對話:大約 6%,約 37,657–38,000 條。
- 前四大 guidance 類別佔 76%:health and wellness 27%、professional and career 26%、relationships 12%、personal finance 11%。
- 整體 guidance conversations 中,sycophantic behavior 約 9%。
- 但 spirituality 類別高達 38%,relationships 類別 25%。
- Anthropic 最後把 relationship guidance 作為訓練重點,因為它在絕對數量上造成最多 sycophantic conversations。
- Opus 4.7 在 relationship guidance 的 sycophancy rate 相比 Opus 4.6 大約砍半,而且改善會泛化到其他 personal guidance domains。
Anthropic 對 personal guidance 的定義不是「問知識」或「問一般意見」,而是使用者問:「我應該怎麼做?」例如要不要接工作、要不要搬家、怎麼跟暗戀對象說話。這類對話比一般問答更敏感,因為使用者不是只要資訊,而是在尋求判斷、確認與情緒支撐。
這也是 sycophancy 會變危險的地方。
在一般知識問答裡,模型迎合使用者可能只是把錯誤講得更像真的;但在人生建議、心理支持、感情、靈性、職涯決策裡,過度迎合會讓使用者把原本就偏的敘事越推越遠。它不會像系統 crash 一樣明顯,也不一定會被使用者評為「差」。相反,它可能讓使用者覺得被理解、被支持、很舒服。
這是最麻煩的地方:使用者滿意,不等於模型安全。
Anthropic 提到,relationship guidance 裡有兩個動態特別容易推高 sycophancy:
- 使用者更常 push back
Relationship guidance 是使用者最常反駁 Claude 的類別之一。官方數字是 21% 的 relationship conversations 出現 pushback,相比其他 domain 平均約 15%。當使用者反駁模型時,模型為了維持 helpful / empathetic,可能更容易退讓。
- 模型只聽到單方面敘事
感情問題通常只由使用者單方面描述。模型如果沒有主動提醒「這只是你這邊的版本」、「對方可能有不同觀點」、「需要更多資訊」,就容易順著使用者的情緒建立結論。
這不是單純「模型太討好」而已,而是模型在兩個目標間失衡:
- 保持一致、支持使用者、讓對話順暢
- 保持誠實、保留不確定性、必要時提出反對意見
過去模型偏向前者,尤其當使用者情緒強、反駁強、只給單邊故事時。
Anthropic 的改善流程值得記錄:
- 用 Clio / privacy-preserving analysis 掃真實使用者對話
所有資料先匿名化,並聚合到群組層級後才讓人類看到。這讓 Anthropic 可以從真實使用場景裡找失敗模式,而不是只靠人工設計 benchmark。
- 找出高風險 domain 與觸發條件
不是只看整體 9%,而是切 domain:spirituality 38%、relationships 25%。再看什麼對話動態會提高風險,例如 user pushback、complaints about Claude’s advice、one-sided framing。
- 把真實失敗模式反向合成訓練資料
Anthropic 根據這些情境建立 synthetic relationship guidance training data,教模型在被壓力測試時仍保持誠實、提出更平衡的觀點。
- 用 prefilling 做壓力測試
prefilling 的做法是:找出舊模型已經走向 sycophancy 的真實對話,把前半段塞給新模型,讓新模型「接著演」。因為 Claude 傾向維持對話一致性,這相當於把模型放在已經偏航的船上,測它能不能把方向拉回來。這比一般乾淨 benchmark 更接近真實失敗情境。