4 種 AI Agent 實測比較:誰最像真的能把陌生專案跑起來的工程師
4 種 AI Agent 實測比較:誰最像真的能把陌生專案跑起來的工程師
title: 4 種 AI Agent 實測比較:誰最像真的能把陌生專案跑起來的工程師 date: 2026-03-14 author: harryspeaks_ source: https://www.threads.com/@harryspeaks_/post/DV40SJNj02x?xmt=AQF0KR99kjf5Gn5FIw1y-SHvcwyy2myvuWLposN1KCFzqzmELe3SPL8mvTgxWISSMwr4DbcY&slof=1 category: threads tags:
- AI Agent
- Claude Code
- Cursor
- Gemini CLI
- Jules
- Codebase
- 開發工具比較 created: 2026-03-15 updated: 2026-03-15
4 種 AI Agent 實測比較:誰最像真的能把陌生專案跑起來的工程師
原文摘要
作者花了一整天,把 4 款常用 AI Agent 放在同一個測試條件下比較:
- Cursor(Agent mode)
- Jules
- Claude Code
- Gemini CLI
測試任務只有一個:在沒有任何事先說明的情況下,分析一個程式碼庫,並理解如何在本機跑起來。
這個測試很實際,因為它不只是比「會不會講」,而是比誰能在陌生 repo 裡真正找到正確執行路徑。
四款工具的實測印象
1. Cursor:積極、快速,但容易邊猜邊撞
作者把 Cursor 形容成「會亂猜但很勤奮的實習生」。
它一開始動作很快,會立刻檢查 package、找指令、試圖跑起來;但問題是,它常常沒有先真正理解專案結構,而是透過大量試錯逼近答案。
- 優點:速度快、上手容易
- 缺點:很燒 token、容易繞遠路、陌生 setup 風險高
2. Jules:比較像先讀文件的新同事
Jules 的風格和 Cursor 相反。它比較會先翻 README、找設定檔、慢慢拼湊出專案全貌,推理路徑也比較乾淨。
但它的弱點是,一旦卡住,就不太會主動切換策略。它比較像會給出一個合理推測,但少了持續驗證到底的狠勁。
- 優點:文件導向、理解節奏乾淨
- 缺點:彈性不足、卡住時不夠兇猛
3. Claude Code:最像真的要把事情做完的工程師
作者給 Claude Code 的評價最高。關鍵不只是它會分析,而是它會:
- 先理解架構
- 判斷真正該驗證的地方
- 直接執行
- 失敗後根據錯誤訊息調整方向再試
這種「理解 → 驗證 → 修正」的節奏,讓它最接近真正工程師的工作方式。作者也明講,對他來說真正有價值的不是 agent 會不會講,而是能不能把東西跑起來。
- 優點:完成度高、會自我修正、執行感強
- 缺點:成本較高、需要較好的上下文
4. Gemini CLI:理解不差,但常停在顧問角色
Gemini CLI 在 codebase 理解上比作者原本預期更好,能掌握整體結構,也擅長分析可能原因與提出建議。
但它的問題在於,很多時候停在「分析得很好」這一步。若目標是整理思路、做初步診斷、快速讀陌生程式碼,表現不錯;但若要它幫忙真正把專案跑起來,往往還差最後一哩。