AI代理(AI agent)第一次整理健檢資料、擷取藥品資訊,或替行政人員完成一段流程,第二次卻可能改用另一個判斷路徑。輸入看起來相同,結果卻出現差異,這種情況提醒團隊:一次成功只能說明代理具備某種能力,還不足以證明它能穩定交付。
對台灣的數位健康團隊來說,真正要評估的是任務可靠度。代理能否在相同條件下重複完成?換一批相似資料後是否仍能工作?碰到例外、權限不足或高風險決策時,是否知道何時停止並交給人處理?這三個問題,比單一排行榜分數更接近上線後的風險。
一、為什麼一次成功率不足以代表 AI 代理可靠
一次成功率只回答代理「有沒有做對過」,沒有回答同一任務「能不能持續做對」。若任務會影響健康資料、用藥提醒或分流結果,重複性與失敗後的處理方式都必須納入評估。
把同一任務獨立執行 k 次,Mean@k 是平均通過率,Pass^k 是每次都成功的任務比例,Pass@k 則是至少成功一次的比例。三者須在相同任務集、相同 k 與相同評分規則下計算才能互相對照,否則直接比較會失真。可重試、失敗成本低的工作可參考 Pass@k;健康流程更應看 Pass^k、失敗嚴重度與一致性差距(Mean@k 減去 Pass^k),這是診斷代理穩定度的指標,不是可跨研究通用的分數。
Hugging Face 發表的 IBM Research 技術文章(公司公開實驗,非臨床或台灣數位健康場域驗證)以 AppWorld 測試 ReAct 代理:GPT-4.1 五次重跑的平均成功率為 77.4%,五次全成功的任務比例只有 53.0%,相差 24.4 個百分點。這組數字只適用於該測試設定,示範平均數如何遮住波動;報告時仍要註明指標、重跑次數、任務集與評分方式。
「Report Pass^k next to Mean@k.」這是 Hugging Face/IBM Research 對代理評測的建議,重點在把平均表現與重複成功並列觀察。
二、AI代理如何從平均表現走向逐任務穩定
先逐任務重跑並比對軌跡,定位工具呼叫、參數填寫、資料篩選與停止時機等分歧點。每次執行保留輸入、模型、提示、工具與資料版本,以及代理決策、停止原因和人工介入點,才能定位波動來源。
Consistency Analyzer 會從軌跡找出分歧步驟,再轉成行為指引。在該文的測試設定與介入方法下,一致性差距由 24.4 個百分點降至 12.0 個百分點。同一組介入也讓 Pass^5 在相同任務提高 16.0 個百分點、相似任務提高 13.0 個百分點。這些數字是該次實驗的觀察結果,不是一般部署可預期的改善幅度,仍須在目標場域重新驗證。
三、遊戲訓練能力能否泛化到真實工作
遊戲訓練可提供密集且可驗證的回饋,卻不能直接證明代理能處理真實工作的資料、責任與例外。能否泛化,要看訓練任務是否包含相近的目標、工具使用與長程決策結構,仍需在目標場域重新驗證。
上一節的重複性回答「同一任務能否反覆完成」,這裡要問的是另一條軸線:換了任務或情境之後,代理是否仍能完成目標,兩者不能互相取代。遊戲有規則、狀態和明確結果,容易判定行動是否完成目標,也能快速重置並重複試驗。Good Start Labs 公開的鐵路遊戲案例(經 Latent Space 整理討論,屬公司公開研究,非臨床或台灣數位健康場域驗證)比較訓練方式:單輪問答式訓練對財務研究評測影響有限,多輪工具使用、規劃與環境適應則在其測試中出現改善。
這顯示互動形式會影響能力轉移,卻不代表遊戲技能自然適用於醫療行政、病歷整理或用藥安全。模型、記憶、工具、權限與停止條件都會改變結果,健康流程仍須重新測試。
四、台灣數位健康團隊可作為起點的三層評測框架
先從低風險、可驗證的流程建立基線,再依序測試同一任務、相似任務與陌生情境。每層記錄成功率、失敗類型與人工介入,才能把分數變化連回實際原因。
第一層:同一任務多次執行與 Pass^k
挑選已定義完成條件的低風險任務,在固定條件下重跑,並同時報告 Mean@k、Pass^k 與失敗步驟。測試前先定義通過條件,例如欄位完整、來源可追溯,以及工具只操作允許資料。
第二層:相似任務與資料變體測試
保持目標不變,替換日期、欄位順序、文件格式或缺漏值,觀察代理是否維持流程。這測的是有限範圍的泛化能力;例如更換健檢報告版面,檢查代理是否誤填或臆測。
第三層:陌生情境、例外處理與人工升級
加入權限不足、來源矛盾、工具逾時、資料過期與規則衝突等情境。在這類測試中,可把停止、說明原因、保留紀錄並升級人工列為通過條件之一。
高風險數位健康流程中的使用者、慢性病患者、長期服藥者、孕婦與兒童,都需要更嚴格的例外測試。若代理接觸健康資料,必須限制資料權限、記錄工具呼叫,並避免把測試結果直接視為醫療判斷。遇到藥物交互作用、診斷、治療、用藥、分流或個人健康決策時,應在流程中預先設置人工核准與明確升級條件。
| 評測層級 | 主要問題 | 可觀察指標 | 適合的交付範圍 |
|---|---|---|---|
| 同一任務重複性 | 相同條件能否反覆完成? | Mean@k、Pass^k、失敗步驟 | 低風險、可回復的行政整理 |
| 相似任務泛化 | 換資料外觀後是否仍能依規則工作? | 變體通過率、臆測率、資料追溯率 | 人工抽查下的半自動流程 |
| 陌生情境適應 | 遇到例外是否停止並升級? | 告警率、錯誤嚴重度、升級正確率 | 受限權限與人工核准流程 |
五、如何設計人類監督與交付門檻
只要錯誤可能改變健康決策、暴露敏感資料或造成不可逆的外部操作,就應設計人工核准。人類監督屬於可靠度的一部分,因為系統能否在不確定時正確停下,同樣是交付能力。
把流程依錯誤後果分級。公開衛教資料摘要可先人工抽查;涉及個人健康資料的個人化建議,應限制自動化範圍。診斷、治療、用藥、分流與即時警訊不宜由代理單獨完成最後判斷,實際作法仍須依適用法規、機構風險評估與授權專業流程確認,本文不作為法律或醫療執業指示。
監督畫面需呈現來源、時間、工具、資料、未確認欄位與建議動作,並留下模型、提示、資料版本、停止理由和人工修改紀錄。測試宜使用去識別或合成資料,權限只開到任務所需範圍;NIST 與 WHO 的指引也都把可信度、倫理、人權與責任納入 AI 評估。
交付範圍可依錯誤嚴重度分級:低風險任務保留抽樣稽核,中風險任務由人員確認後寫入,高風險任務只提供可追溯資訊,最後判斷與外部操作交由授權人員處理。錯誤嚴重度應由機構指定責任人依錯誤後果、資料敏感度、可逆性與外部操作權限訂定,並對照前一節三層評測框架的失敗率、告警率與升級正確率,定期覆核調整。
- 選定低風險、完成條件明確的日常流程,在固定條件下計算 Mean@k、Pass^k。
- 加入相似資料、權限不足與工具故障,記錄泛化失敗及停止升級行為。
- 依錯誤嚴重度設定自動完成、人工抽查或人工核准的範圍,再逐步擴大測試。
六、結論:先問能否穩定交付,再問能否一次做對
最先要看代理在指定任務、工具與資料條件下能否重複交付,並在不確定時正確停止。一次成功率可作為能力線索,Pass^k、相似任務測試、例外升級與錯誤嚴重度,才共同構成上線判斷。
AI代理評測要從「曾經答對嗎」移到「在什麼條件下能穩定完成,出錯時會怎麼做」。數位健康團隊可先從可回復、可查證的資訊整理流程建立基線,再依軌跡、例外與錯誤嚴重度決定是否擴大自動化。
- Mean@k、Pass^k、Pass@k 回答不同問題:平均表現、同一任務多次都成功的比例、多次嘗試至少成功一次的比例;遊戲的可驗證回饋有助於訓練與評測,但能力轉移到數位健康前,仍要經過相似任務、陌生情境與人工升級測試。
- 高風險健康流程應限制資料權限、記錄工具呼叫,並在診斷、治療、用藥、分流與個人健康決策前設置人工核准。
常見問題
最容易被忽略的是重跑條件與失敗後果。若沒有固定測試條件,也沒有區分低風險與高風險錯誤,分數就很難支持交付決策。
常見問題
Q1:Mean@k 高,就代表 AI 代理可靠嗎?
不代表。Mean@k 可能掩蓋只在部分重跑中成功的任務,應與 Pass^k 和失敗軌跡一起看。
Q2:Pass^k 一定比 Pass@k 更好嗎?
兩者用途不同。Pass^k 適合要求重複穩定的流程,Pass@k 適合可重試且能驗證結果的任務。
Q3:遊戲訓練可以直接用來證明醫療流程可靠嗎?
不行。遊戲提供可驗證回饋,數位健康流程仍須在目標場域測試個資、責任、資料品質與人工核准要求。
Q4:數位健康團隊應該從哪種任務開始?
可先選低風險、可回復、完成條件明確的資訊整理或行政流程,再加入資料變體和例外情境。
Q5:同一套評測結果可以比較不同模型嗎?
測試條件與評分方式需一致或清楚記錄差異;更換重要條件後,應重新建立基線。
參考來源
- Duesterwald E, et al. (2026). Your Agent Aced the Task. Will It Do It Again? *Hugging Face/IBM Research
- Good Start Labs. (2026). What a Railroad Game Taught a Model About Finance. *Good Start Labs Research
- National Institute of Standards and Technology. (2023). AI Risk Management Framework. *NIST
- World Health Organization. (2021). Ethics and governance of artificial intelligence for health. *WHO