AI Evaluation
OpenAI GeneBench-Pro:評測科學 AI 的重點,從會不會回答轉向有沒有 research taste
OpenAI 發表 GeneBench-Pro,用更真實、混亂且需要判斷的 computational biology 任務測試模型。它強調 research taste:模型是否知道資料能回答什麼、何時修正假設、何時結果足以支持決策。
2026年6月30日1 分鐘閱讀👁 6
AI Evaluation × Science
OpenAI GeneBench-Pro:評測科學 AI 的重點,從會不會回答轉向有沒有 research taste
GeneBench-Pro 的核心不是再做一個問答 benchmark,而是評估 AI 在真實科學研究裡的高階判斷。
核對提醒:已核對 OpenAI GeneBench-Pro 官方文章;問題集與第三方測試開放狀態以 OpenAI 最新說明為準。
官方定義
OpenAI 把 research taste 定義成一連串影響分析品質的判斷:資料能支持什麼問題、早期診斷如何改變模型或 estimand、何時需要修正初始計畫。
為什麼重要
科學資料通常不會附上清楚說明,真實研究需要處理 noise、ambiguous context、dirty datasets 與反覆修正假設。
更廣泛啟發
企業 agent 評測也應從「答對題目」升級到「做對判斷」:知道何時資料不足、何時需要改計畫、何時結果可交付。