醫療 AI 偏誤要用分層效能測出來,不能只看全體準確率。把預期病人族群、醫院場域與實際輸入拆開,至少比較敏感度、特異度、陽性預測值、陰性預測值及信賴區間,才知道模型在哪一群人身上失準。台灣 TFDA 的 2026 年 GMLP 原則已把族群代表性、獨立測試、外部驗證與上市後監控放進醫療器材生命週期。

我的驗收順序會先問三件事:模型服務誰、資料來自哪裡、錯一次的臨床代價是什麼。醫院若還在討論「準確率 95% 能不能買」,應先回到醫療 AI 導入要過的五道臨床關卡,把預期用途和工作流寫清楚,再談分數。

醫療資料分析介面呈現不同年齡與性別族群的病人資料分布
模型的資料來源與病人組成,會影響後續的偏誤檢查。(示意圖)

醫療 AI 偏誤是什麼

醫療 AI 偏誤,指模型在特定病人、資料來源或使用環境中,持續出現系統性的效能落差。落差可能來自訓練資料少了某類病人,也可能來自標註方式、檢查設備、醫院轉診流程或疾病嚴重度分布;2023 年一篇全球回顧把資料與人口代表性不足列為醫療 AI 泛化與偏誤的主要風險來源之一。PubMed 收錄的回顧研究支持這個判斷。

這裡要先分清「公平」與「每一群分數一樣」。不同疾病盛行率、檢查條件和臨床代價,會讓同一個門檻在不同子族群產生不同的陽性預測值;驗收應先說明產品用途、錯誤成本與可接受的風險,再決定要比較哪些指標。WHO 的醫療 AI 治理原則把包容、公平、責任與持續評估列為設計和使用時要處理的事項。

醫療 AI 偏誤怎麼測

先畫出預期族群和資料地圖

第一張表不用寫模型架構,先列出預期使用者、病人年齡、生理性別、族群背景、地理位置、醫療狀況、使用環境與量測輸入。台灣 TFDA GMLP 明確要求訓練、測試與監測資料具備預期病人族群代表性;使用非本土資料訓練的模型,還要評估在國內族群的適用性與效能差異。TFDA 原則第 3 項把這些欄位列為臨床評估的基礎。

產品團隊常把「台灣資料」當成一個勾選框,這不夠。台北醫學中心、地區醫院、急診和門診的病人組成、設備與轉診路徑可能不同;若模型只在單一院所測試,總體分數很容易掩蓋場域差異。這也是衛福部把跨體系醫院、FHIR 資料標準與外部驗證放在同一個驗證架構的原因。臨床 AI 取證驗證中心的公開說明指出,跨院資料可用來檢查模型在不同醫療環境的適應性。

訓練、驗證、測試要真的分開

第二張表記錄每一筆資料進過哪個階段,並把病人、院所、設備和收案時間可能造成的相依性一起檢查。TFDA 問答集沒有規定所有產品必須採用固定比例,也沒有訂一個通用的最小樣本數;它要求訓練、驗證與測試資料彼此獨立,申請人說明分配策略的理由,並評估資料來源與多樣性。TFDA 查驗登記問答集提供了這個實務邊界。

如果同一批病人的影像同時出現在訓練和測試資料,測出的高分沒有辦法代表新病人。對醫院來說,採購文件應要求廠商交代資料切分規則、外部測試院所、參考標準,以及每個子族群的樣本數,這些資料比一張總體 ROC 曲線更能揭露模型的適用範圍。

臨床研究人員在醫院螢幕上比較醫療 AI 不同族群的效能指標
子族群的敏感度、特異度與信賴區間,應和總體結果一起看。(示意圖)

每個子族群都要報效能與不確定性

第三張表才是偏誤驗收的核心。依產品任務列出敏感度、特異度、陽性預測值、陰性預測值、偽陽性與偽陰性,再依年齡、生理性別、疾病嚴重度、資料來源院所與設備分層;FDA 的 AI 醫材生命週期文件也要求說明重要子族群的效能,並在適用時依不同操作點呈現分層結果。FDA 文件的性能與子族群段落支持這種報告方式。

每個數字旁邊要放信賴區間和樣本數。小族群出現 5 個百分點差異,可能代表真實落差,也可能只是估計不穩定;沒有不確定性,採購者容易把排名當成結論。FDA 的透明度原則也把信賴區間、資料代表性缺口、已知偏誤與失效情境列為應讓使用者知道的資訊。FDA《機器學習醫材透明度原則》有明確說明。

我的取捨是:高風險分流先盯偽陰性和漏掉誰,再看平均分數;提醒型工具則要追蹤偽陽性造成的回診、檢查或人力負擔。這不是替所有醫療 AI 設一個公平門檻,產品用途不同,驗收指標就該不同。

台灣現在能做到哪裡

TFDA 在 2026 年 6 月公告的 GMLP 共列十項原則,適用對象是應用機器學習技術的醫療器材,涵蓋產品設計、資料集代表性、臨床評估、人機互動與上市後性能監控。TFDA 公告頁說明這套原則是供業者在產品設計、開發與維護時參考。這給醫院一個實用翻譯:偏誤檢查要寫進採購、驗證、上線和更新流程,不能只放在研究報告附件。

衛福部的臨床 AI 取證驗證中心已公開跨院資料驗證的做法,包括以 FHIR 和 TW Core 整合電子病歷、建立譯碼檢索字典與資料清理工具,並支援聯邦學習平台。中心公開頁面也指出,跨院、跨層級資料是檢查模型適應性與一致性的基礎。對台灣團隊而言,這條路比直接把外國論文的 AUC 搬進簡報更有用,因為它開始處理資料欄位、醫院層級和病人組成的差異。

資料來源仍要單獨審查。健保資料的欄位、目的外利用和受控流程,和醫院完整電子病歷不是同一件事;要用健保資料訓練模型的團隊,可以先看健保資料能訓練 AI 嗎?三道門檻看懂,再把資料授權、欄位品質和跨院驗證寫進專案需求。

台灣醫院資訊團隊在跨院醫療資料平台上檢視 AI 驗證流程
跨院外部驗證要同時處理資料標準、場域差異與病人族群代表性。(示意圖)

上線後還要盯什麼

模型通過一次測試,只代表那一批資料和那個版本的結果。病人組成、檢查設備、轉診流程或資料欄位改變,模型輸入分布就可能改變;TFDA GMLP 將資料漂移、模型劣化、重新訓練與上市後不良事件追蹤都放入持續監控要求。GMLP 第 10 項原則要求監控要依風險設計,更新活動也要納入品質管理系統。

我會在上線前要求醫院留下四個可執行欄位:每個子族群的最低監測樣本數、觸發人工覆核的條件、模型暫停後的替代流程、以及版本更新重新驗證的責任人。這四欄讓偏誤從一份報告變成臨床流程,也讓醫師知道何時不能再把輸出當成可靠訊號。FDA 的透明度原則同樣要求揭露更新、已知限制、失效模式與持續監測方式。

醫師在臨床工作站檢視 AI 建議並進行人工覆核與異常處置
模型上線後仍要保留人工覆核、異常通報與停用回復流程。(示意圖)

常見問題

看全體準確率,能判斷醫療 AI 有沒有偏誤嗎?

不能。全體準確率可能把少數族群的漏診或誤報平均掉,至少要依預期病人與使用場域分層,並附樣本數和信賴區間。

台灣 TFDA 有規定訓練、驗證、測試資料的固定比例嗎?

TFDA 問答集沒有訂所有 AI/ML 醫療器材共用的比例或最小樣本數。申請人仍要讓資料彼此獨立,說明分配理由,並證明資料與預期用途及目標族群相符。

外國資料訓練的模型可以直接在台灣使用嗎?

不能只憑外國測試分數判定。TFDA GMLP 要求評估非本土資料訓練模型在國內族群的適用性與效能差異,醫院也應把台灣場域的外部驗證和工作流測試列入導入條件。