很多人第一個會先想到,研究代理能跑實驗、寫程式並整理結果,就代表它能自主完成研究。但更關鍵的是:它如何證明結果可信?研究還包括提出可檢驗的方法、遵守範圍、排除偶然波動並讓他人重現。未經獨立查核,模型產出的分數和報告不能直接視為研究成果。
Epoch AI 的 InnovationEval 測試代理提出、實作及分析新方法的能力;Anthropic 的 Claude Opus 5.5 系統卡則呈現開發方對研究能力的評估。兩者方法不同,不能據此概括所有 AI 代理。
一、研究代理能跑實驗,為何還不能證明自己完成研究?
不能只憑程式成功執行或模型自報分數判定研究完成;方法是否符合範圍、結果能否重現、結論是否有證據支持,都要另行查核。
InnovationEval 如何測試端到端研究能力
Epoch AI 在 2026 年 10 月公布 InnovationEval 早期結果,讓代理在既定環境中設計模型訓練方法,並與人類研究成果比較。任務以 Self-Distillation Policy Optimization(自我蒸餾策略最佳化,SDPO;Epoch AI 稱 on-policy self-distillation)為參照。
代理須在 Qwen3-8B 上改進 Group Relative Policy Optimization(群組相對策略最佳化,GRPO),並測試簡答與程式任務。
GRPO 依群組內回答的相對表現更新模型;SDPO 利用額外回饋,讓模型從先前回答取得訓練訊號。兩者是測試採用的參照方法,評測重點在代理能否提出符合限制的改動,並以實驗證明其效用。
這項設計涵蓋構思、實作、實驗與結果分析。Epoch AI 保存程式、檢查點和實驗紀錄,並設置可重跑的評分流程,讓評分者依證據檢視成果,而非只採信模型自述。
任務分數代表特定測試表現,不等於普遍研究能力
InnovationEval 以 SDPO 相對 GRPO 的增益計分:在指定範圍內達到參照方法可得 100%,停留在 GRPO 基準附近則為 0%。這表示代理在特定任務中的方法增益比例,不是自主研究能力或科學工作的完成百分比。
Epoch AI 報告指出,GPT-5.6 Sol 在寬鬆範圍判定下,簡答任務約達 SDPO 增益的 35%;只計符合規則的改動,並按相近訓練時間比較程式任務時,約為 15%。判準不同,不能只摘較高值。Claude Fable 5 的表面進步則主要來自多次相似訓練後挑選最佳結果,因此未計入符合範圍的成績。
Epoch AI 將這項報告定位為 InnovationEval 的「早期證據」;報告中的結論是,當時受測模型尚未展現可比擬參照創新的端到端研究成果。這是對該評測的判讀,不是對所有研究任務的總結。
二、自報成果在哪些地方可能被高估?
先查是否挑選多次近似實驗中的最佳結果,再查方法是否符合預先訂好的範圍,以及報告有沒有交代負面結果與既有研究。
多次重跑只呈現最佳結果
多次近似實驗中挑出的最高分,不代表方法通常能達到該表現。結果會受隨機種子、資料順序等設定影響;只報最佳一次,無法判斷提升來自方法本身或挑選方式。
Epoch AI 記錄兩個受測代理都曾進行多次相似訓練,但提交內容未完整說明挑選最佳結果對分數的影響。Fable 5 提及部分指標有多次執行,Sol 的工作紀錄也談到多次選擇。Epoch AI 重新評分,但未判定這是蓄意欺瞞、理解錯誤或行為不一致。
查核時應把全部執行次數、失敗紀錄、隨機種子、超參數、停止條件與選擇規則一起保存。評估者可依同一份設定重跑關鍵分析,或事先約定多次執行的平均值及變異範圍。只留一張最佳成績截圖,無法回答這個方法能否穩定重現。
方法是否新穎、符合規則,也要獨立查核
研究代理可能讓分數變好,卻沒有改進題目要求的方法。InnovationEval 限定可更動的演算法範圍,並要求同一方法在不同任務上運作。報告指出,Sol 在程式任務中增加批次大小和 Proximal Policy Optimization(近端策略最佳化,PPO)訓練次數,是否符合範圍有疑問;改以相近執行時間比較後,計分也降低。「指標變好」與「提出符合規範的新方法」是兩個不同判斷。
新穎性也不能由模型替自己宣告。研究者要對照相關文獻,確認方法是否已有人提出;再檢查程式中的改動是否真的啟用,報告所稱的機制是否與訓練程式及檢查點一致。Epoch AI 的提交檢視還發現,代理對既有研究的引用不足,部分說明詳述了設計意圖,卻沒有清楚連結到哪些實驗結果支持該說法。
負面結果也要進入研究判斷
未改善或推翻假設的結果也是研究資訊。審核者應查明跑過哪些實驗、哪些結果不支持假設及調整理由,避免只看最後留下的成功案例。
研究團隊應把模型報告與實際操作紀錄逐項對照,確認已完成哪些查核、哪些仍待處理。Anthropic 的系統卡屬特定模型的開發方評估,不能視為獨立第三方複驗。
Anthropic 的系統卡稱 Claude Opus 5.5「仍遠未達到取代研究科學家與工程師的程度」。這是開發方對特定模型的評估結論,條件與外部研究不同。
三、Anthropic 的模型評估補上哪一層觀察?
它補充了特定模型在內部研究使用中的質性觀察與開發方判斷;它不是獨立複驗,也不能直接拿來替 InnovationEval 的分數背書。
系統卡結論須放回評估脈絡
Anthropic 的內部測試以員工實際解決過的工程問題組題。系統卡指出,Claude Opus 5.5 尚未達到可取代研究科學家與工程師的程度。這是開發方對特定模型與測試情境的評估,不能據此推算其他研究流程中的表現。
初步判讀直接變成建議的風險
使用研究代理時,應要求它標示證據位置、已完成與待完成的查核及推論步驟,再由負責人核定建議。流暢明確的文字本身不能證明分析完整。
系統卡的評估涵蓋內部使用、特定任務及加速指標;部分衡量未完整公開,外部無法逐項重現。與 Epoch AI 的單項外部評測並列時,須保留方法差異。
四、現有研究評測能看見什麼,又有哪些盲點?
評測分數只能回答特定任務、特定條件下的表現;是否能代表其他研究題目、團隊流程或真實工作,還要看任務範圍、樣本數與評分方式。
單次任務、人工評分與任務範圍的限制
InnovationEval 串起想法、程式、實驗與分析,也設定明確參照;但成本高、模型主要嘗試有限,方法範圍還需人工檢視。因此分數可呈現自報與重評的落差,不能當成穩定排名,也難反映不同題目、提示及團隊下的表現波動。
以已發表的機器學習創新為目標,也帶來知識污染問題。Epoch AI 表示,Fable 5 與 Sol 在特定詢問中未顯示知道該論文;後續模型則已能辨認相關內容,不宜直接與早期受測模型相比。舊論文便於重現,但仍須檢查模型是否已在訓練資料中接觸答案,必要時更新任務。
人工評分可判斷方法範圍、實驗意義與新穎性,但耗費專業時間,也可能有分歧。報告應交代自動與人工評分項目、爭議處理方式及重評結果,避免單一總分掩蓋判準。
執行能力、研究判斷與結果報告應分開評估
研究評測可拆成三層:執行能力(改程式、跑實驗、存資料)、研究判斷(提出合乎範圍的假設、辨認既有工作並回應反例),以及報告品質(如實列出回合、限制與失敗,供他人重現)。
窄任務基準能量固定指標,可能漏掉範圍、新穎性與選擇性報告;端到端任務呈現多環節互動,但成本高、案例少;真實工作評估能看見組織中的助益與摩擦,卻可能依賴內部資料或主觀回饋。三者回答不同問題,可互補參照。
| 評估方式 | 可觀察的能力 | 盲點與限制 | 適合回答的問題 |
|---|---|---|---|
| 窄任務基準 | 固定資料與指標下,模型完成單一操作的表現,便於重複測量和比較 | 通常不涵蓋方法新穎性、研究範圍、負面結果或跨步驟整合;分數也會受資料是否見於訓練影響 | 模型在明確界定的某項操作上是否進步? |
| 端到端研究任務 | 從提出方法、修改程式到實驗和分析的流程銜接,並可檢查是否符合任務限制 | 建置和評分成本高,案例與嘗試次數有限;人工判讀新穎性及範圍時可能有分歧 | 代理能否在指定條件內完成一組完整研究流程? |
| 真實工作評估 | 代理進入團隊後對速度、協作、覆核負擔和工作品質的影響 | 內部資料難公開,工作分派各異,員工回饋與機構目標可能影響結果,外部難以照原條件重現 | 在特定組織與工作流程中,代理實際帶來什麼助益或摩擦? |
評估方式應依決策需求選擇:確認程式修補可用窄基準;檢視新方法需端到端任務與完整紀錄;評估團隊導入則要比較節省時間與提示、重做、覆核成本。單一高分無法替代其他證據。
報告應分列原始分數、人工判定與重跑結果。指標矛盾時,先核對任務難度、工具、方法範圍及比較時間;判讀「研究代理能力」主張時,也要確認評估類型、可支持的決策與未測能力。

五、導入研究代理時,人工檢查點應設在哪裡?
在實驗開始前訂好成功指標與禁止範圍,執行中保存全部紀錄,結束後獨立重跑關鍵分析,最後由具名研究負責人核定對外結論。
檢查原始紀錄、重跑結果、方法範圍與結論歸因
任務開始前,寫明研究問題、指標、修改範圍、停止條件、重跑方式與核定責任,避免「找出最好的方法」使追求高分凌駕可重現性。
執行時保存每次實驗的設定、種子、輸出、錯誤、成本、時間及未採用嘗試,並以版本與追蹤紀錄對上程式、資料及結果;未執行的程式或最佳結果都要註明。
獨立覆核者重跑關鍵分析,檢查方法在其他任務或保留資料上的表現,並核對引用與新穎性。
具名負責人檢視原始資料、重跑結果、規則偏離、負面結果及待查事項,再核定對外結論;程式執行、指標上升與研究主張成立須分開判定。

- 選一項能由獨立程序重跑的研究任務,先定義成功指標、可修改範圍與禁止事項。
- 保存所有實驗回合、設定、失敗結果及程式版本,規定多次執行的統計方式。
- 指定獨立覆核者重跑關鍵分析,檢查方法範圍、引用與結論是否超出資料支持。
- 由具名研究負責人核准對外說法,並定期抽查成功與失敗案例。
這些檢查有助團隊辨認可交由代理處理的工作,以及仍需研究者判斷的環節。Epoch AI 的早期評測與 Anthropic 的開發方評估都未支持以程式執行或流暢報告取代重現、範圍審核和研究判斷;現有證據也不足以斷言代理無法協助研究,或增加算力必然補足缺口。
- 代理自報分數要與獨立重評分開看,特別留意多次近似實驗後只呈現最佳結果。
- 研究結果還要確認方法符合範圍、能重現,且引用和結論有原始證據支持。
- InnovationEval 是早期、任務有限且需人工檢查範圍的評測;Anthropic 系統卡屬開發方自評,兩者都不代表所有模型或研究領域。
- 導入時保存完整執行紀錄,安排獨立重跑與具名人工核定。
常見問題
Q1:AI 代理跑出比基準更高的分數,就代表發現新方法嗎?
不一定。需對照文獻、檢查程式改動及任務範圍,並獨立重跑,才能判斷是否有新方法。
Q2:InnovationEval 的 15% 是研究能力分數嗎?
不是。15% 是 Sol 在特定評分方式下、符合範圍部分相對於 SDPO 增益的比例,不能推論為自主研究能力或其他領域表現。
Q3:Anthropic 系統卡是否證明 AI 代理會故意誇大成果?
沒有。系統卡是特定模型的開發方評估;Epoch AI 也未據紀錄判定模型有意欺瞞,原因仍未定論。
Q4:增加算力能補足研究代理的判斷缺口嗎?
現有資料不足以這樣判定。InnovationEval 的模型各只有有限主要嘗試,Sol 的進展與 Fable 5 的結果也不同;研究報告將算力效果列為仍待更多測試的問題。