Models / LLM / Infra
MAPD:用結構化 protocol 蒸餾,讓開源模型學會 agentic search 的「怎麼想」
arXiv 2607.24280 提出 Multi-Agent Protocol Distillation,將閉源老師模型的探索軌跡轉成任務類型、推理計畫與事實依據 JSON,再與 RL 目標共同訓練開源學生模型。
2026年7月30日2 分鐘閱讀👁 7
Threads 摘要了一篇 arXiv 論文:From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search(arXiv:2607.24280)。核心訊號是:要讓小型開源模型做好 agentic search,直接模仿閉源老師的回答不夠;更好的方法是把老師「怎麼拆題、怎麼找證據、怎麼修正搜尋」轉成結構化 protocol,再讓學生模型學這個中間表示。
一句話:MAPD 把「怎麼想」和「怎麼說」拆開。學生不是硬學老師語氣,而是學任務類型、推理計畫與 grounded facts,再用自己的策略生成答案。
問題背景
- Agentic search 需要模型一邊推理一邊檢索,常見於知識密集 QA、deep research、工具型 agent。
- Outcome-based RL 只告訴模型最後答對或答錯,回饋稀疏,學得慢。
- 閉源老師模型 推理能力強,但不提供 logits,tokenizer 也不一定相容;直接模仿自然語言 trajectory 容易學到風格而非能力。
MAPD 的做法
| 階段 | 做法 | 目的 |
|---|---|---|
| 離線 MAS 探索 | 多 agent 系統分解 query、檢索證據、修復失敗搜尋 | 產生比單次答案更豐富的探索軌跡 |
| Protocol 化 | 把探索軌跡轉成 JSON,包含 task type、reasoning plan、extractive grounding facts | 消除老師語氣差異,保留可學的推理結構 |
| Privileged branch | 訓練時只有學生 policy 的特權分支看得到 protocol | 用該分支 token distribution 當 dense distillation signal |
| Joint objective | 結合 protocol distillation 與 sparse RL objective | 同時獲得密集指導與任務結果對齊 |
論文結果
- 在七個 QA benchmark 上,MAPD 打贏競爭性的蒸餾與 RL 方法。
- 平均成功率:Qwen3-1.7B 約 39.4%,Qwen3-4B 約 44.4%。
- 不同 proprietary teacher 下表現仍穩定,並降低 style drift 與 verbosity degeneration。
對 agent 工程的含意
不要只存最後答案
真正有訓練價值的是 query decomposition、tool trajectory、evidence grounding 與 repair path。
Protocol 比 CoT 更可控
結構化 JSON 可審計、可過濾、可版本化,也比較不綁老師模型的語氣。
Hermes 可借鏡
session transcripts、tool calls、KB citations、verification results 可轉成 regression cases 或 skill 改進資料。
Caveat
- 論文結果是 benchmark claim;未在 Allen 環境重跑。
- Protocol 品質高度依賴離線 MAS 的檢索與修復能力;若 evidence 本身錯,學生會學到錯的 grounded facts。
- 若要落地,必須設計資料清洗、隱私去識別、citation 保存與 eval gate。