個資去識別化,是把資料加工到難以直接或間接辨識特定人的流程;健康資料拿掉姓名後,仍可能因日期、地點、罕見病史或外部資料被重新連回個人。台灣法務部的判斷重點是加工後是否還能識別特定人,不能只看畫面上有沒有姓名欄位。法務部函釋將去識別化說明為讓資料失去直接或間接識別性的加工處理。

若想先了解醫院如何在資料不出院的情況下合作訓練 AI,可延伸閱讀聯邦學習如何讓病歷留在醫院內。要看健保資料進入 AI 專案前的授權與資料品質門檻,也可參考健保資料能不能訓練 AI 的三道門檻

個資去識別化是什麼

資料欄位、遮罩符號與隱私光譜組成的去識別化示意圖
去識別化要降低資料和特定個人的連結,判斷範圍包含直接與間接識別資訊。(示意圖)

《個人資料保護法》把姓名、出生年月日、身分證字號、病歷、醫療、基因、健康檢查等列為個人資料,只要資料能直接或間接識別個人,都在定義範圍內。個資法第 2 條也把記錄、儲存、編輯、檢索、刪除、輸出、連結與內部傳送列為「處理」,所以把病歷複製到另一個資料庫,本身就屬於資料處理行為。

可以先把欄位分成三層:

類型健康資料例子常見處理方向
直接識別姓名、身分證字號、電話、病歷號移除、遮蔽或改用受控代碼
間接識別出生日期、住址、就診時間、罕見疾病組合概略化、分組、刪除或限制查詢
敏感健康資訊診斷、用藥、基因、檢驗結果依目的最小化,並加上權限與使用紀錄

去識別化、匿名化與假名化也要分開看。假名化通常是用代碼取代直接識別資訊,對照表仍由受控單位保管,因此資料還可能回到某個人;匿名化則要求在合理可用的資料與方法下,已無法直接或間接辨識特定人。美國 HHS 也提醒,合格的健康資料去識別化仍可能保留很小、但不等於零的重新識別風險。HHS 去識別化指引說明代碼、專家判定與重新識別管理的差異。

個資去識別化怎麼運作

資料治理流程包含欄位盤點、遮罩、權限鎖與風險測試
去識別化流程從使用目的開始,接著盤點欄位、處理資料、測試風險並管理權限。(示意圖)

實務上可用五個步驟理解。NIST 將去識別化視為一組方法與治理安排,包含移除識別資訊、轉換準識別欄位、合成資料、資料使用模式與重新識別測試;只做欄位遮罩的工具,不一定足以完成風險評估。NIST SP 800-188提供這套完整的治理框架。

1. 先寫清楚資料要拿來做什麼

研究、模型訓練、統計報表與公開資料的需要不同。台北市政府的去識別化流程要求先釐清使用目的,再依資料最小化原則挑選必要欄位;目的越窄,通常越能減少需要保留的資料。台北市政府標準作業流程將目的、欄位、處理方式、效果評估與隱私風險列為連續步驟。

2. 盤點直接與間接識別資訊

姓名和身分證字號容易被發現,出生日期、郵遞區號、就診日期、罕見疾病與影像中的文字則可能藏在結構化欄位、自由文字或檔案中。HHS 指出,醫療紀錄的欄位不一定標示得很清楚,資料管理者需要記錄哪些欄位或衍生值屬於識別資訊。HHS 醫療紀錄去識別化說明

3. 選擇適合目的的處理方式

移除欄位會減少資訊,概略化會降低精細程度,代碼化則保留跨時間串接的可能;合成資料可以另建資料集,但仍需確認統計特性與模型用途。NIST 列出的方法包含移除識別資訊、轉換準識別資訊與用模型產生合成資料,並提醒資料用途與隱私風險要一起評估。NIST 方法與治理說明

4. 把對照表、金鑰與原始資料分開

需要追蹤同一位病人的研究,可能會以代碼取代姓名,再把代碼和身分的對照表放在另一個權限區。HHS 的規範要求重新識別用的代碼不能從個人相關資訊推導,重新識別方式也只能由獲授權人員掌握。HHS 重新識別規範

5. 用外部資料做重新識別風險測試

測試問題可以是:拿到資料的人知道某人居住區、就診月份與罕見疾病時,能否把資料列和公開資料對上?NIST 把重新識別風險定義為第三方重新辨識資料主體的可能性,並建議依預計分享對象與資料環境評估,不能用一次處理結果永久代表安全程度。NIST 重新識別風險詞彙

台灣個資去識別化走到哪裡

台灣醫院資料庫、法規文件與健康資料治理的抽象畫面
台灣健康資料治理同時受到個資法、醫療場域流程與資料使用目的約束。(示意圖)

台灣現行個資法已把病歷、醫療、基因與健康檢查列入個人資料;其中第 6 條對這類資料原則上限制蒐集、處理或利用,例外包含法律明文、公務或法定義務、研究統計且資料經處理後無從識別特定當事人,以及當事人書面同意等情形。個資法第 6 條因此,健康資料送進 AI 訓練流程時,資料是否已降低識別性只是其中一項判斷,使用目的、法定事由與安全維護也要一起確認。

法務部曾針對身分證照片轉成不可逆特徵值說明,若加工後已無從直接或間接識別特定人,就不屬個人資料;這個判斷依賴具體的資料呈現方式與可用的識別方法。法務部行政函釋同一份函釋也把去識別化定位為加工處理,企業不能只用「已去識別」四個字取代測試紀錄。

台北市政府 2023 年公布的標準作業流程,要求去識別化處理人員與檢驗人員分開,並定期評估隱私洩漏風險;流程包含釐清目的、辨識直接與間接識別資訊、選擇處理方式、評估效果及檢視風險。台北市政府個資去識別化平臺標準作業流程這是地方政府的行政規則,不能直接當成所有醫院或企業的全國統一規格,但可作為台灣資料治理的實務參考。

全國法規資料庫目前標示《個人資料保護法》修正日期為 2025 年 11 月 11 日,部分修正條文的施行日期仍標示未定。個資法沿革與施行狀態企業若正要簽資料合作或 AI 委託合約,應把適用版本、資料保存期限、再利用範圍與修法後的調整責任寫清楚。

一般人把健康資料交給 AI 前要注意什麼

使用者在筆電前檢查健檢報告、隱私設定與資料遮罩欄位
上傳健檢報告前,先檢查直接識別欄位、檔案中隱藏資訊與 AI 服務的資料用途。(示意圖)

一般人最容易遇到的場景,是把健檢報告、處方箋、影像報告或就醫紀錄貼給 AI 整理。先刪除姓名、身分證字號、病歷號、電話、地址、條碼與 QR code,再檢查出生日期、就診日期、醫院名稱、罕見病史及檔案名稱;這些欄位組合起來仍可能縮小到單一個人。HHS 將姓名、地址、生日與健康資訊的連結列為可識別健康資訊,並提醒去識別化後仍可能存在連結回個人的風險。HHS 健康資訊識別風險說明

上傳前可以依序檢查四件事:

  1. 服務是否說明輸入內容的保存、訓練用途、管理者存取與刪除方式。
  2. 報告是否仍留有姓名、病歷號、條碼、院所、完整日期或罕見病史組合。
  3. AI 需要的是完整原檔,還是只需要一段經過整理的數值與問題描述。
  4. 回答是否只用來整理資訊,涉及診斷、用藥或治療決定時,是否回到原始報告與正式醫療流程。

這些做法可降低暴露範圍,但不能把公開 AI 服務自動變成醫療資料處理環境。健康資料在台灣個資法下有較高的保護要求,提供資料前仍要確認蒐集目的、利用範圍與接收者。個資法第 6 條

企業導入健康資料 AI 的治理清單

企業團隊以資料治理儀表板檢查健康資料 AI 專案的權限與稽核項目
企業 AI 專案要把資料目的、欄位處理、權限、紀錄與風險測試放在同一張清單。(示意圖)

企業或醫院在把健康資料交給內部模型、雲端 API 或外部研究團隊前,可要求專案文件至少包含以下項目:

  1. 目的與最小資料集:說明模型要完成的任務、輸出對象、保留期間與每個欄位的必要性,並刪除任務不需要的資料。
  2. 識別資訊盤點:把直接識別、間接識別、自由文字、影像文字、檔名與中繼資料列入同一份資料字典。
  3. 處理與對照表管理:說明哪些欄位移除、概略化或代碼化,原始資料與對照表由誰保管,誰能重新連結。
  4. 存取與紀錄:設定角色權限、查詢範圍、下載限制、保存期限與稽核紀錄;委外時把子處理者與資料位置列入合約。
  5. 再識別與品質測試:用預計接收者可取得的外部資料測試連結風險,也檢查去識別化是否改變疾病分布、缺值比例與模型效能。
  6. 事件與退出流程:定義發現可重新識別、誤傳、權限異常或用途變更時的通報、停用、刪除與通知責任。

NIST 建議在資料分享前先評估目標、風險與資料分享模式,模式可包含公開資料、合成資料、受控查詢介面或安全的封閉環境;NIST 也建議以可量測的標準與重新識別研究檢查結果。NIST 資料分享治理對醫療 AI 而言,這代表「模型能不能讀」與「資料能不能交給模型」要拆成兩份驗收紀錄。

健康資料的去識別化還要和資料品質、臨床驗證及模型安全分開管理。資料處理成功,不能直接推導出模型可用;模型在研究資料上表現良好,也不能推導出所有病人與所有院所都適用。NIST 的資料分享治理框架將資料用途、隱私風險與分享模式分開評估,也把資料效用的取捨納入治理。

常見問題

去識別化資料與外部資料交叉連結後出現重新識別風險警示
重新識別風險來自資料本身與外部資訊的連結,需依分享對象和環境持續評估。(示意圖)

去掉姓名就算完成個資去識別化嗎?

不一定。出生日期、地點、就診時間、罕見疾病、影像中的文字與檔案中繼資料,都可能成為間接識別資訊;台灣法規的判斷也包含能否以間接方式識別特定人。個資法第 2 條

假名化和匿名化差在哪裡?

假名化通常保留受控的對照表,授權單位仍可能把資料連回個人。匿名化的判斷則要求在具體資料、可用方法與使用環境下,已無法直接或間接識別特定人;實務上仍要留存風險評估與處理紀錄。

去識別化資料可以直接拿去訓練 AI 嗎?

先確認資料使用目的、法定事由、接收者、保存方式與再識別風險,再決定是否可用。AI 專案還要檢查資料品質、代表性、模型效能與輸出是否可能洩露個人資訊,去識別化本身不會替這些環節完成驗證。