先給結論:健保資料可以訓練醫療 AI,但申請通過不等於模型就能進診間。資料目的、欄位品質、實際臨床效能要分開驗證,少一關,專案都不該上線。
台灣現在有可執行的路徑。健保署說明,目的外利用採事前申請、專家審查、受控場域與資料進出審查;FHIR 讓 AI 讀懂跨院病歷的前提則處理另一個常被混淆的問題:資料能交換,仍不代表資料適合拿來做臨床決策。
健保資料訓練 AI,先搞懂「目的外利用」
健保資料原始蒐集目的在醫療費用申報。把就醫、用藥、影像或檢查資料拿去做研究、模型訓練或政策分析,會進入健保署所稱的「目的外利用」範圍;健保署目前列出的資料類型包括承保資料、就醫及用藥紀錄、醫學影像與病理報告、檢查與檢驗結果。健保署的資料庫說明也把這類利用放在明確目的、審查與受控環境下處理。
這裡的判斷很直接:研究團隊不能只拿「資料已去識別化」當通行證。計畫仍要說清楚模型要解決哪個醫療問題、需要哪些欄位、預期產出什麼,以及哪些結果可以帶出資料環境;健保署的申請流程要求明確使用目的與研究成果預期,資料使用期限原則為一年、可展延一次,最長兩年。健保署資料使用流程支持這些申請與期間要求。
三道門檻怎麼運作
第一關:授權與退出權
《全民健康保險資料管理條例》已在 2026 年 8 月 10 日施行,衛福部說明,法律把健保資料特定目的外利用、監督防護、退出權與罰則放進法規架構。衛福部公布的法案說明也明定,民眾可依程序請求停止個人健保資料的特定目的外利用。
健保署目前提供臨櫃與健保快易通 APP 申請,退出可以選擇承保、就醫用藥、影像病理、檢查檢驗等資料範圍;生效後不再提供給新的使用申請案,但生效前已授權的資料仍可繼續使用,這項退出不溯及既往。退出權的範圍與生效規則已逐項列出。
對產品團隊來說,需求文件要多寫一欄「退出後怎麼辦」。模型版本、資料集版本、研究案編號與資料使用期限都要留存,才能回答某一批訓練資料是否已取得授權、是否落在退出生效日前。這是治理設計,不是上線後補一張同意書。
第二關:資料品質與代表性
健保資料的優勢是診斷碼、藥品碼與申報格式相對標準化,衛福部臨床 AI 取證驗證中心也指出,這種標準化有助於跨院研究與 AI 開發。中心的資料標準化說明同時提醒,欄位定義不一、資料孤島與缺少統一識別碼,會限制多中心 AI 的發展。
模型訓練前至少要查四件事:資料是否完整、標記是否正確、不同院所的欄位語意是否一致、樣本是否涵蓋模型要服務的年齡與疾病族群。這不是我個人的檢查清單偏好;一篇涵蓋 103 篇研究的 EHR 資料品質系統性回顧,整理出完整性、正確性、一致性、合理性、時效性、符合規範與偏誤等品質面向,並指出目前仍沒有單一標準方法。《JAMIA》系統性回顧支持這項資料品質判讀。
因此,健保資料很適合做族群層級的風險分析、醫療利用分析與研究假設產生;若要拿來支援單一病人的即時判斷,就得補上個案當下的生命徵象、病程、用藥依從性與醫師判讀等脈絡。健保資料的欄位清單可查,但每個模型需要的臨床上下文仍要由使用場域逐項確認。
第三關:跨院臨床驗證
模型在健保資料上拿到好看的 AUC 或準確率,只代表它在那份資料與標記規則下表現良好。WHO 對健康 AI 的治理指引建議,演算法要在實際使用場域嚴格測試,並檢查資料特性、輸出決策,以及不同年齡、性別與族群的效能差異。WHO 健康 AI 治理指引把持續評估與獨立監督列為治理建議。
台灣的臨床 AI 驗證中心已分享跨院聯邦學習案例:臺大醫院、林口長庚、中山附醫與國泰醫院合作開發心臟驟停風險預測模型,並提醒少數案例與控制組比例偏高會造成資料不平衡。衛福部臨床 AI 取證驗證中心案例顯示,跨院合作可以降低資料搬移,但模型驗證仍要處理族群與案例分布。
這也是我會把「健保資料訓練」與「臨床導入」拆成兩個採購階段的原因。第一階段看資料能否支持研究問題,第二階段看模型在指定院所、指定流程、指定病人群體中能否安全工作;兩階段的驗收指標、責任人與紀錄都應分開。聯邦學習如何讓病歷留在院內可補充資料不離院的技術路徑,但它不會自動完成臨床效能驗證。
台灣現況:有制度,申請時程正處銜接期
健保署目前公開的流程是事前申請、專家審查、受控場域操作、資料攜入與攜出審查;使用者透過虛擬桌面連線到資料主機,資料不直接落到申請人的本機。健保署資料使用流程也要求使用結果與研究發表回報。
本文發布日是 2026 年 8 月 25 日。衛福部統計處公告,健保資料管理條例在 8 月 10 日施行後,資科中心依規定於 8 月 10 日至 9 月 8 日暫停受理新申請案,舊案照常執行。統計處施行公告是申請排程的即時依據,之後仍應以公告更新為準。
這段期間最適合做的工作是整理資料字典、標記規則、IRB 文件、模型版本控管、跨院驗證計畫與上市後監測指標。美國 FDA、加拿大衛生部與英國 MHRA 的機器學習醫材指引也把部署後效能監測、再訓練風險與變更控制列為模型生命週期管理的一部分。FDA 等機關的 GMLP/PCCP 指引可作為台灣醫療 AI 團隊設計版本治理時的參考。
實務上該怎麼判斷能不能做
我會把一個健保資料 AI 提案壓成五個問題:
- 這個模型要改善哪一個醫療流程,輸出由誰看、誰能否決?
- 每個欄位的來源、定義、缺值與時間點是否有資料字典?
- 訓練資料的族群與實際部署族群是否相近,差異怎麼補驗?
- 民眾退出後,資料集、模型版本與已產出的報告怎麼標記?
- 模型更新、效能下降與錯誤事件由誰監測,何時停用?
五題答不出來,模型分數再高也還不到臨床導入。WHO 指引主張健康 AI 的設計、部署與使用把人權與責任放進治理;FDA 的機器學習醫材指引則列出面對模型或演算法變更時管理安全性與效能的原則。這兩份規範的共同訊息很實用:資料治理、臨床責任與版本管理要在產品設計期一起決定。WHO 指引與FDA 變更控制原則都支持這個判斷。
常見問題
健保資料可以直接下載給公司訓練模型嗎?
健保署公開流程採事前申請與審查,並在指定或受控環境中使用資料,資料攜入與攜出也要經審查。實務上應依計畫目的、資料範圍與適用法規申請,不能把「去識別化」理解成無限制下載。
民眾退出後,已經訓練好的 AI 模型要刪掉嗎?
健保署說明退出不溯及既往,生效日前已授權的資料仍可繼續被使用。個別研究案、資料使用條件與模型是否包含可回溯資料,仍需在計畫與治理文件中留下可查的判定紀錄。
健保資料模型準確率高,就能放進醫院嗎?
不能直接這樣判斷。模型還要在實際院所與目標族群做外部驗證,檢查資料分布、工作流程、錯誤處理與持續監測,才能決定是否適合臨床使用。
參考來源
- 衛生福利部中央健康保險署:健保資料庫說明
- 衛生福利部中央健康保險署:健保資料請求停止目的外利用
- 衛生福利部:立法院三讀通過全民健康保險資料管理條例
- 衛生福利部統計處:全民健康保險資料管理條例及其子法施行公告
- Lewis AE, et al. Electronic health record data quality assessment and tools: a systematic review
- World Health Organization: Ethics and governance of artificial intelligence for health
- 衛生福利部臨床 AI 取證驗證中心:聯邦學習與資料標準化
- FDA, Health Canada and MHRA: Predetermined Change Control Plans for Machine Learning-Enabled Medical Devices