載入中...
載入中...
OpenAI 發表 GeneBench-Pro,用更真實、混亂且需要判斷的 computational biology 任務測試模型。它強調 research taste:模型是否知道資料能回答什麼、何時修正假設、何時結果足以支持決策。
Apple Machine Learning Research 的 NeurIPS 2025 論文用可控 puzzle environments 檢驗 Large Reasoning Models,提出三個複雜度區間:低複雜度標準 LLM 可能更好;中等複雜度 LRM 有優勢;高複雜度兩者都崩潰,且 LRM 會在仍有 token budget 時降低 reasoning effort。