合成資料是用演算法生成出來的資料集,統計特性貼近真實資料,但每一筆紀錄都不對應任何真實存在的病患。醫療 AI 需要大量病歷才練得起來,偏偏病歷受個資法保護、難以跨院流通,合成資料因此成為補這個缺口的手段之一。但這條路不是萬靈丹:如果 AI 模型一路只靠 AI 生成的資料訓練下一代,品質會隨世代遞減,這個現象叫「模型崩潰」(model collapse)。

合成資料是什麼

合成資料由生成模型產出,常見做法包括生成對抗網路(GAN)、擴散模型,近年也有人直接拿大型語言模型生成結構化的假紀錄。目標是讓產出的資料集在統計分佈、變數之間的關聯性上盡量貼近真實世界,卻不含任何一筆能對應到真實個人的紀錄。一份由 FDA 研究人員參與撰寫的放射影像合成資料綜述指出,這類技術能用來擴增稀缺或類別不平衡的資料集,也能在不動用真實患者影像的情況下做品質保證測試,好處是降低病患風險、簡化資料取得、可擴充規模,但同一份綜述也強調,要讓合成資料真正發揮潛力,還需要額外的驗證工作才能確認生成出來的樣本沒有失真或遺漏臨床上重要的邊緣案例。

跟解決「資料要不要離開醫院」這個問題的聯邦學習不同,合成資料處理的是另一層問題:聯邦學習讓模型巡迴到各醫院用真實病歷訓練、資料本身不動;合成資料則是乾脆生成一批不對應任何真人的假資料,訓練時根本不需要真實病歷在場。兩者可以互補,一個解決「資料能不能被搬動」,一個解決「有沒有足夠資料可以練」。

醫院機房伺服器與資料線纜畫面(示意圖)

台灣現況:個資法的目的拘束原則卡在哪

台灣醫院的病歷能不能被拿去訓練 AI,第一關要先問個資法。個人資料保護法第20條規定,非公務機關利用個人資料原則上應限於蒐集時的特定目的範圍內,只有法律明文規定、增進公共利益、當事人書面同意、學術研究機構基於公共利益進行統計或研究等七款例外情形才能做目的外利用。病歷在蒐集當下的特定目的是診療,事後想拿去訓練商用 AI 模型,等於超出原本目的,除非能落入七款例外之一,否則原則上不能做。執業律師的分析進一步指出,實務上企業慣用的「概括同意條款」(如同意公司將本人資料用於各種業務目的)未必能被認可為有效同意,應該採「分項同意」讓當事人可以選擇性地同意特定用途,這代表就算走同意這條路,門檻也不像想像中低。

合成資料常被拿來討論的定位,是繞過「原始病歷要不要離開醫院」這個問題本身:既然生成出來的資料不對應任何真實個人,理論上就不落在個資法規範的「個人資料」範疇。但這個推論並非自動成立,能不能真的被認定為去識別化、有沒有被重新識別的風險,仍要看生成方式與驗證程度而定,台灣目前對合成資料本身尚無專門子法給出明確答案。

台灣手上其實握有全球數一數二完整的健保資料庫,規模龐大卻不能直接拿來訓練商用 AI,這也是健保健康存摺SDK採政府認證第三方App生態、而不是把資料庫整包開放的原因之一:資料治理的設計本身就要在「資料好用」跟「資料安全」之間畫線,合成資料是這條線上的其中一種折衷方案,不是唯一解。

法規文件與檔案畫面,象徵個資法對資料使用的限制(示意圖)

該注意什麼:模型崩潰的風險

合成資料解決了「有沒有資料可以練」,但沒解決「一直用合成資料練下去會不會出問題」。Shumailov 等人的研究把這個現象定義為模型崩潰:用模型生成的內容訓練後續世代的模型,會讓新模型出現不可逆的缺陷,原始資料分佈中比較少見的「尾部」內容會逐漸消失,這個現象在語言模型、變分自編碼器、高斯混合模型上都觀察得到,這篇論文後來以《AI models collapse when trained on recursively generated data》為題,刊登在2024年《Nature》631期。研究團隊做了一個具體實驗:拿中世紀建築的文本當原始輸入做遞迴訓練,模型一代一代只學上一代自己生成的內容,到了第九代,輸出已經完全跑題,變成一串跟建築毫無關聯的「野兔清單」,且多代之後的輸出普遍出現重複短語,是效能劣化的另一個徵兆

放到醫療 AI 的脈絡裡,這代表合成資料不能是訓練資料的唯一來源,而是要跟真實病歷資料搭配使用、定期用真實資料校正,避免模型在一代一代的合成資料循環裡把罕見但臨床重要的病徵樣態(例如少見疾病的影像特徵)給遺忘掉。這正好呼應前面放射影像綜述提到的重點:合成資料能擴增資料量,但保真度與邊緣案例的覆蓋度需要額外驗證,不是生成出來就直接能用。

數位雜訊與失真圖樣,象徵資料品質逐代劣化(示意圖)

常見問題

合成資料跟去識別化的真實資料是同一回事嗎?
不是。去識別化資料仍然是從真實個人紀錄處理而來、理論上仍有被重新識別的風險;合成資料則是由演算法憑統計特性生成、不對應任何真實存在的個人,兩者的資料來源與風險性質不同。

用合成資料訓練醫療 AI,在台灣就不受個資法規範了嗎?
不必然。個資法規範的是「個人資料」的蒐集、處理、利用,合成資料理論上因為不對應真實個人而可能不落入規範範疇,但實際能不能被認定為真正去識別化、有沒有重新識別的風險,仍取決於生成與驗證的品質,台灣對此尚無專門子法明確定義。

什麼是模型崩潰,跟合成資料有什麼關係?
模型崩潰是指 AI 模型如果只靠上一代 AI 生成的內容遞迴訓練、缺乏真實資料校正,輸出品質會逐代劣化,原始資料分佈裡比較少見的內容會率先消失。這代表合成資料能補資料量的不足,但不能完全取代真實資料,否則長期下來模型會偏離真實世界的分佈。