Databricks 真實 PR coding agent benchmark:模型不是全部,harness 與 context 管理會直接改變成本效率
Threads @ryy.dev 分享 Databricks 用內部真實 PR 建立 coding agent benchmark,重點結論是:模型能力、token 單價、task-level cost 與 harness/context 管理都要一起看;同模型同 effort 下,Pi harness 在部分組合可用約 3x 少 context per turn、成本便宜 1.2–2.08x 且品質接近。本文查證 Databricks 官方 benchmark 與 Omnigent meta-harness / GitHub,整理對 BigIntTech/Hermes agent ops 的啟發。
Threads 這篇在講什麼
@ryy.dev 看到 Databricks 的 benchmark 後,特別注意到最後一點:Harnesses have a major impact on efficiency。Databricks 在固定模型與 reasoning effort 的情況下,比較 Claude Code / Codex native harness 與 Pi harness,結果 Pi 的極簡 harness 在部分組合中成本低很多、品質差不多。
作者也補充:Databricks 文章有方法說明,但偏分享性質,並不是一篇完整嚴格定義的論文。這個 caveat 很重要,避免把圖表數字當成跨公司、跨 repo 的通用定律。
Databricks 官方 benchmark 的四個主結論
Databricks 官方文章列出四個結論:
| 結論 | 意思 | 對 agent ops 的啟發 |
|---|---|---|
| Pareto frontier 混合多家模型 | OpenAI、Anthropic、open model 都可能在不同 cost/quality 區間有效 | 不要單押一家模型;要有 model routing |
| Open models 已能做 coding | Databricks 指出 GLM 5.2 可進入高能力 tier,且 task cost 低於 Opus 4.8 | 地端/開源模型值得納入 daily driver 候選 |