AI Research
SDAR:Agent 訓練不是全盤學老師,而是在 token 層級判斷該信多少
SDAR(Self-Distilled Agentic Reinforcement Learning)把 RL 當主幹,將 On-Policy Self-Distillation 變成 gated auxiliary objective:只強化老師明確支持的正向 token,對負向訊號保守衰減,避免多輪 agent 因錯誤技能或錯誤提示被老師帶偏。
2026年5月16日2 分鐘閱讀👁 5
AI Research / Agent Post-training
SDAR:更強的 Agent,不是盲目學老師,而是知道哪個 token 值得學
這則 Threads 推薦的 arXiv 論文《Self-Distilled Agentic Reinforcement Learning》處理的是多輪 agent post-training 的老問題:RL 的最終 reward 太粗,只知道整條 trajectory 成敗;蒸餾老師雖然能提供 dense token-level guidance,但如果全盤照抄,錯誤技能、錯誤提示與多輪連鎖錯誤會讓訓練更不穩。
一句話:SDAR 把 RL 保留為主幹,將 OPSD(On-Policy Self-Distillation)降級成「有閘門的輔助目標」:老師支持的正向 token 多學,老師拒絕或負向 token 不直接懲罰到底,而是 soft attenuation。
問題:trajectory reward 太粗
Agent 做的是長鏈互動:觀察、工具、動作、回覆會互相影響。最後成功/失敗的 reward 很難告訴模型哪一步真的有貢獻。
傳統蒸餾的坑
老師 branch 有 privileged context 或額外技能,看起來可以提供 token-level guidance;但在多輪 agent 裡,老師也可能因 skill retrieval 或 skill utilization 錯誤而產生錯誤拒絕。
SDAR 的設計
用 detached token-level signal 經 sigmoid gate 轉成蒸餾強度,正向 gap token 被加強,負向 rejection 則被溫和衰減,而不是硬把整串輸出往老師方向拉。
結果
論文在 Qwen2.5 / Qwen3 系列、ALFWorld、WebShop、Search-QA 上,相對 GRPO 提升:ALFWorld +9.4%、Search-QA +7.0%、WebShop-Acc +10.2%。
| 方法 | 核心訊號 | 問題 | SDAR 怎麼改 |
|---|---|---|---|
| GRPO / RL | trajectory-level reward | 只知道整體好壞,難定位哪個 token / action 有用 | 保留為 primary optimization backbone |
| OPSD | teacher branch 的 dense token guidance | 多輪任務中,老師錯誤會累積;負面訊號可能來自錯誤 skill,而不是真錯 | 只作 auxiliary objective,不讓蒸餾主導訓練 |
| Naive GRPO + OPSD | RL 與蒸餾直接混合 | 容易因錯誤蒸餾造成 instability | 用 token-level sigmoid gate 控制蒸餾強度 |
| SDAR | RL + gated self-distillation | 需要設計何時信老師、何時不信 | positive-gap tokens 強化;negative teacher rejections soft attenuation |
對 agent 團隊的實務啟發
- 做 tool-use / long workflow agent 時,不能只看 final reward;要想辦法產生更細粒度的 credit assignment。
- 老師模型、技能庫、retrieval、privileged context 都不是絕對真理;訓練策略必須容納「老師會錯」。
- 如果系統有 skill retrieval,負向訊號尤其要小心:失敗可能是技能沒找好,不代表 base policy 的 token 本身錯。