醫療 AI 合成資料能補足稀缺病例、標註成本與隱私限制,卻不能單獨替臨床安全蓋章。及格的驗證流程,最後仍要用與訓練資料獨立、符合目標病人族群與真實工作流程的資料確認效能,並把上線後監測寫進產品生命週期。FDA 的 GMLP 原則把資料代表性、訓練與測試獨立、臨床情境測試、人機團隊表現與部署後監測放在同一套框架裡。

先補一個站內脈絡:合成資料的基本原理與模型崩潰風險解釋資料怎麼生成;這篇往下一層,處理醫院真正要驗收的問題。若模型最後要讀 EHR 或接健保相關資料,還要把醫療 AI 認證與 FHIR Box 的導入關卡列入介接測試,因為資料能交換不等於資料已經適合臨床使用。

合成資料驗證在驗什麼

合成資料是用計算方法生成的人工資料,可以補足真實病人資料難取得、標註昂貴、隱私受限或疾病盛行率低等問題。FDA 的醫療 AI 研究頁面把合成資料列為補充病人資料集的方向,也把研究題目直接寫成「超越相似度指標的合成醫療資料評估」,這已經說明「看起來像真的」只能當起點。FDA 的研究說明支持合成資料用於較安全地取得帶標籤案例,沒有把它描述成臨床效能的替代證明。

醫療場景還要把「模型開發」與「模型驗證」分開。FDA 2025 年的 AI 醫療器材文件目前仍標示為草案,明確提醒不要把資料整理、模型訓練或調校階段混稱為 validation;驗證要回到預定用途,拿客觀證據確認要求能否持續被滿足。FDA 草案頁面的法規文字不能直接取代台灣查驗登記,但很適合拿來校正醫院與廠商的用語。

這個分界會影響採購文件。廠商交出「合成資料通過相似度檢查」時,醫院還要追問它如何代表預定族群、是否保留罕見案例、測試資料是否獨立,以及模型放進實際工作流後誰看結果、誰覆核、誰處理失效。

醫療 AI 團隊檢視合成資料品質與臨床驗證條件的工作畫面

怎麼運作:五道驗收檢查

第一關:資料履歷與代表性

先要求一張資料卡,寫清楚合成資料由哪些真實資料產生、涵蓋哪些病人、標註怎麼來、生成器與資料版本是什麼、哪些欄位經過改寫,以及哪些族群沒有被涵蓋。FDA 的 GMLP 原則要求臨床研究參與者與資料集代表預定病人族群,並把年齡、性別、種族、族裔、使用方式與量測輸入列為需要充分代表的特徵。官方原則也把資料代表性和模型能否推廣到目標族群連在一起。

我的驗收表會把「統計像不像」拆成三欄:整體分布、重要子群、臨床邊緣案例。疾病盛行率低的案例、不同影像設備、缺值、不同檢驗單位與不同照護場域,都應標出是否有資料支持。這些欄位不是為了把資料卡做得漂亮,目的是讓團隊知道模型在哪些人身上可能表現較差。

第二關:訓練與測試能不能真正分開

合成資料若從訓練病歷生成,測試集就不能把同一批病人、同一個資料取得來源或高度相依的樣本混進去。GMLP 明確要求訓練與測試資料保持獨立,還要處理病人、資料取得方式與機構地點等依賴來源。FDA 的原則清單支持把資料獨立性當成單獨的驗證項目。

實作上,我會要求廠商交出資料切分規則、去重結果、來源機構、時間區間與例外處理紀錄。測試資料最好保留真實臨床資料的外部區段,合成資料用來補開發或壓力測試;這樣才看得出模型遇到新病人、新設備或新場域時是否退化。

醫療資料驗證流程把訓練資料、合成資料與獨立測試資料分開

第三關:用臨床任務選性能指標

醫療 AI 的任務不同,驗證方式就不同。FDA 的 AI 評估研究指出,分類、估計、影像分割、事件時間分析與異常偵測各有相應的性能評估問題,輸出如何呈現、資料怎麼收集,也會影響適合的指標。FDA 的 AI 評估方法說明支持先定義任務,再決定性能與不確定性怎麼量。

所以我不接受一張只有單一準確率的驗收報告。分類模型至少要交代預定族群、重要子群、臨床門檻與錯誤代價;影像模型要說清楚標註標準、病灶位置與設備差異;文字模型則要驗證輸出是否能被醫療人員快速核對。這些項目要回扣預定用途,不能把研究室指標直接當成病房效益。

第四關:測試人機團隊與工作流

模型單獨跑得好,醫師在介面上仍可能讀錯、看不到警示,或沒有時間處理結果。GMLP 要求把人機團隊表現放進評估;FDA 的透明度原則也要求交代醫療目的、輸入、輸出、工作流位置、已知限制與資料代表性缺口。FDA 透明度原則還把在地驗收、持續監測與變更管理列為可採用的做法。

這一關要測的東西很具體:醫師在哪個畫面看到結果、模型延遲多久、警示是否打斷既有流程、人工覆核怎麼留下紀錄、模型無法判讀時怎麼退回人工處理。站內的醫療 AI 五道臨床導入關卡已整理用途定義、資料、FHIR、人機分工與上線監測;合成資料驗證要接在那條導入鏈上,不能停在資料科學團隊的報告裡。

第五關:上線後追蹤資料漂移與版本

醫療現場會換設備、換檢驗流程、換病人組成,模型輸入分布也可能改變。GMLP 第 10 項要求部署後監測模型表現,若模型持續訓練,還要管理過度擬合、非預期偏差與資料漂移造成的退化風險。FDA 官方原則支持把版本、監測、再訓練與失效處置放在同一份生命週期紀錄。

醫院採購時應把三件事寫進合約與驗收表:何種資料變化會觸發重測、誰能核准模型更新、出現明顯退化時如何停用或回復上一版。TFDA 2026 年公告的人工智慧醫療器材優良機器學習實務,也把訓練與測試資料集、臨床評估、上市後性能監控列為業者設計、開發與維護時的參考範圍。TFDA 公告讓這份驗收要求有了台灣法規實務上的對照點。

醫院監測醫療 AI 上線後的版本、資料漂移與臨床表現

台灣現況:FHIR 介接要跟驗證一起做

TFDA 在 2026 年 6 月 8 日公告人工智慧醫療器材優良機器學習實務,公告文字說明訂定背景包括訓練與測試資料集、產品臨床評估與上市後性能監控,並將文件定位為供相關業者在產品設計、開發與維護時參考。TFDA 的原文公告支持的範圍到這裡;它沒有替每種合成資料產品訂出單一數值門檻,也不能直接替代個案的醫材分類與查驗登記。

資料交換是另一個常被低估的驗收面。HL7 將 FHIR 定義為電子交換健康資訊的標準,FHIR 以 Resource 作為基本建構單位,涵蓋病人、診斷、檢驗、用藥與照護流程等資料模型。FHIR 官方說明能支持交換格式與結構設計,但資料的代碼對應、時間戳、缺值、權限、病人識別與臨床脈絡仍要由導入醫院驗收。

我的做法是把一條完整證據鏈列成採購交付物:資料履歷、合成資料品質報告、獨立外部測試、子群表現、工作流測試、FHIR 欄位對照、版本變更規則與上線監測儀表板。每一項都要能回到預定用途與臨床責任人,採購、資訊、醫療與法遵才有共同的判斷基礎。

醫療資訊團隊以 FHIR 資料交換與 AI 驗證證據鏈檢查導入狀態

我的導入判斷

合成資料最適合放在開發、資料擴增、罕見案例模擬與系統測試等位置。臨床效能的最後一道確認,仍要看獨立資料、適用族群、真實工作流程與上線後表現;這個取捨能讓資料隱私、模型效能與醫療責任各自留下可追蹤的證據。

遇到以下三種交付物,我會先暫停導入:只有合成資料的測試結果、拒絕交代資料代表性與版本變更、沒有退版與持續監測規則。FDA 的 GMLP 與透明度原則都把獨立測試、資料缺口、工作流、人機團隊及部署後監測列為需要管理的項目,這些要求正好可以轉成醫院的採購條款。

醫療 AI 的驗證成本不會因為資料是合成的就消失。它只是把成本從病歷取得,部分轉移到資料履歷、真實世界測試、臨床工作流和生命週期管理;這筆成本沒有被寫進專案,就會在上線後以錯誤警示、人工覆核負擔或版本失控的形式出現。

常見問題

合成資料可以取代真實病人資料嗎?

它可以補足開發階段的資料缺口,特別是稀缺病例、標註成本與隱私限制造成的不足。臨床效能仍要用與訓練獨立、符合預定病人族群與臨床情境的資料確認,這是 GMLP 對資料代表性、獨立測試與臨床條件的基本要求。

合成資料驗證通過,醫院就能直接上線嗎?

還要完成預定用途、外部臨床測試、人機工作流、資料交換與上線監測的驗收。TFDA 公告把臨床評估與上市後性能監控一起列入 AI 醫療器材實務參考範圍,合成資料報告只能構成證據鏈的一部分。

FHIR 能解決合成資料的品質問題嗎?

FHIR 能提供交換健康資訊的標準與 Resource 資料模型,讓系統較容易對接。資料是否代表目標病人、標註是否可靠、模型是否在外部場域有效,仍要用資料與臨床驗證處理。