健康資料平台的信任很難用一句承諾換來,它得靠一條一條規則寫進流程、慢慢疊起來。台灣健康網路平台這種國家級規模的系統,成敗常常不在技術多漂亮,而在那些看不見的細節有沒有做對。以下整理健康資料平台上線前最容易被低估、後果又最嚴重的六個陷阱,每一個放到國家級平台,只會更關鍵。

一道由許多細節磚塊堆疊而成的信任高牆

一則利益揭露與範例說明

本文以醫療 AI 合規守門工具 goalkeeper 為例說明。goalkeeper 讓 AI 產出的醫療內容在發布前先過五道台灣法規檢查。利益揭露:goalkeeper 為本文作者參與的專案,此處僅作為設計範例,非推廣。以下六個陷阱都是實作這類工具時會直接撞上的,而它們在台灣健康網路平台這種規模的系統上一個都躲不掉。

這類工具會出現,是被法規逼出來的。2025 年底,立法院三讀通過《人工智慧基本法》,把國科會定為主管機關,AI 治理從行政指引升級成正式立法;隔年 5 月,衛福部再函頒醫療機構應用生成式人工智慧指引要求醫院用生成式 AI 產出的內容主動揭露、避免 AI 幻覺延誤就醫。合規從一句口號變成要落地的工程,而落地的過程全是細節。以下六個陷阱,是最容易被低估、後果又最嚴重的幾個。

衛福部生成式 AI 指引讓合規從口號變成要落地的工程

稽核日誌可能是最大的外洩點

合規要求保留稽核紀錄以便事後追查。但如果圖方便,把原文和個資原值都寫進稽核日誌,這個為了合規而生的稽核系統,本身就成了整套架構最大的個資外洩面。留痕留得越認真,能被洩漏的面就越大,這是實作後才會撞見的反直覺之處。

解法是把順序擺對:去識別化要在判定「之前」就完成,稽核只留遮罩後文本的雜湊值加上狀態摘要,原文與個資原值永遠不寫進稽核。事後仍然重現得出「當時判了什麼、結論是什麼」,卻永遠拿不回原始個資。到了台灣健康網路平台這種跨院匯集的規模,去識別化的順序一旦擺錯,等於把外洩點砌進地基,事後再補都來不及。

稽核日誌若存原始個資反而變成外洩點的示意

去識別化只是門檻,隔離與遮蔽才是真功夫

不少平台會用「已經做了去識別化」來讓使用者安心,但去識別化的保護有邊界。它擋得住直接把資料回推成某個人,卻擋不住兩件事:一是把多個去識別化資料集交叉比對後重新識別出個人,二是「合法二次利用」的範圍被悄悄放寬。

英國的 care.data 就是前車之鑑。當年把去識別化講得像護身符,結果資料被提供給商業公司、退出機制又講不清楚,信任在 2016 年蕩然無存、整個計畫喊停。去識別化是門檻,稱不上保險。真正撐住安全的是治理,還有實作上兩件苦工:把資料留在該留的地方,以及把個資遮得夠乾淨。

第一件是隔離。goalkeeper 的做法是所有原始文件的向量索引都在地端完成,只有在查詢當下,才把去識別化後的內容送到雲端 LLM 運算。雲端從頭到尾拿不到原始文件,只在提問時取得必要的業務脈絡,個資外洩的風險就被實體隔離擋在門外。負責建索引的向量模型,選型前得先量化實測,再依結果彈性替換,別憑名氣挑。上線前實測比較過幾個開源多語模型,各有取捨:

模型供應商體積侷限但也有的優點
Multilingual-E5Microsoft560M輸入上限 512 token,長文件容易被截斷生態最成熟
Arctic-Embed 2.0Snowflake568M需要 GPU 才跑得動;供應商本業是雲端服務,長期維護的定位偏弱輸入長度可達 8192 token
Nomic Embed v2Nomic AI475M新創供應商,長期維護的保證較弱連語意距離的定義都公開
LaBSEGoogle471M輸入上限 512 token;架構較舊、準確度偏低多語涵蓋廣、老牌穩定

第二件是遮蔽,goalkeeper 用兩層把個資抓乾淨。第一層規則式,靠格式與前綴詞抓身分證、地址、電話、信用卡、銀行帳號、民國日期這類有跡可循的欄位。第二層是命名實體識別,補規則式抓不到的人名與機構名,這一層接的是中研院 CKIP 的中文 NER。兩層疊起來,才擋得住「格式不固定但一看就知道是誰」的漏網個資。到了跨院匯集的國家級平台,隔離和遮蔽做不紮實,去識別化就只是紙上的一句宣稱。

判讀要能重現,對話要能溯源

法規會改,模型會更新。今天判「可以發」的一段內容,換了規範版本或模型版本之後,結論可能就不一樣。如果稽核不能重現「當時是依哪一版規範、判成什麼」,那份稽核形同無效,出事時說不清楚當初的判斷依據。

所以每一筆判讀都要綁定規範版本,鎖定之後可以重現。這在單一工具上是好習慣,在國家級平台上是底線。健保資料庫二次利用之所以被憲法法庭盯上,其中一個缺口就是對資料的處理欠缺獨立監督與課責的明文機制。可重現,是課責的前提。

光能重現還不夠,對話內容本身也要壓得住幻覺。goalkeeper 沿用醫療領域的經驗,設三道關卡把關:混合檢索過濾先把不相干的資料擋在外面,知識綁定約束讓模型只能依綁定的知識回答、不能自由發揮,自我校驗核實再回頭確認每句話都有依據。三關走完,把幻覺壓到最低,以每一句都追得回出處、100% 可溯源的對話為目標。對國家級平台來說,能不能溯源,決定了它出事時說得清還是說不清。

每筆判讀綁定規範版本以便日後重現的示意

機器只給狀態,最後由人拍板

這一條的核心是責任歸屬。一個合規檢查工具最偷懶也最危險的做法,是直接回覆「可以發」或「不可以發」。它一旦替使用者做了決定,就等於把臨床與法律的責任,推給一個不該扛、也扛不起的機器。

比較負責任的設計,是只回各個關卡的狀態,整體要不要放行由人依狀態自行判讀,例如全部通過才自動放行、任一項不合格就擋下、有疑慮的轉人工覆核。goalkeeper 就是只回各關卡狀態,把整體放行留給人。這樣的設計對得上 AI 風險治理框架,也能依已經三讀通過的《人工智慧基本法》建立合規報告,讓專業人員從頭到尾保有監督與覆核的權力。機器做前置篩選,人做最後決定。同樣的道理擺到台灣健康網路平台:如果它讓 AI 直接對民眾的資料下決策,把專業人員晾在一邊,信任邊界就守不住。工具給框架、給狀態,最後的判斷留給人,這在醫療 AI 是老原則,不會因為換了個大平台就改變。

保護資料的工具,別先漏了自己的金鑰

還有一個容易被忽略的漏洞。一個用來保護別人資料的工具,最先洩漏的可能是它自己的金鑰。原因往往很單純:日誌或錯誤訊息的遮蔽規則沒涵蓋到金鑰用到的某些字元,憑證就這樣完整印在輸出裡。保護資料的系統,自己反而破了一個洞。

解法是把「祕密不外洩」也當成一條要驗的規則:讀取含憑證的檔案時不回傳含值的那一行、遮蔽規則要涵蓋金鑰會用到的完整字元集、憑證一旦可能曝光就立刻輪替。這條偏工程,道理卻很簡單:資安沒有做完一次就了結這回事,每次改動都得重驗,是一種紀律。國家級平台匯集了千萬人的資料,任何一個這種小洞,代價都不是它自己承受得起的。

保護資料的系統自身金鑰外洩的反諷示意

合規對醫院是成本、不是收入,這才是最難的一關

最後這個陷阱最難,而且它跟前面每一條技術陷阱都不同,它是商業問題。對醫院和診所來說,導入 AI 本來就已經要花錢,再多花一筆做合規檢查的誘因並不強。合規的價值是「什麼壞事都沒發生」,而沒發生的事看不見,這種東西天生難以推銷。

這其實跟前一篇談的電子病歷交換卡十年是同一個病根,都是誘因問題。解法有三層,由軟到硬。第一,別賣「合規」,賣「所避開的那個風險」,一次越權診斷、個資外洩或幻覺內容流出,法律責任、裁罰和商譽的代價,遠大於守門的費用,它其實是很便宜的保險。第二,把邊際成本壓到趨近於零,同一個網址同一把金鑰、按次計費,別讓它變成另一個沉重的整合案。第三,也是最硬的一半:在法規強制或有機構真的受害之前,這類工具的採用永遠落後,而《人工智慧基本法》三讀通過、衛福部指引落地,正是誘因開始翻轉的訊號。與其強調「這個工具很有價值」,不如先承認這一點,反而更站得住腳。

合規是成本中心而非利潤中心導致推廣困難的示意

國家級平台,一開始就要做對

六個陷阱指向同一件事:健康資料的信任是設計出來的,不是喊出來的。稽核怎麼存、去識別化擺在哪一步、資料有沒有隔離、判讀能不能重現、對話能不能溯源、機器該不該替人決定、祕密會不會漏,以及誰有誘因把這些都做對,少做一條都會在那裡破一個洞。

台灣健康網路平台鎖定的是全台千萬人的資料,這幾條對它而言不是選修,是必修。一開始就做對,這個平台就能少走許多冤枉路,也才撐得起千萬人的信任。健保資料庫的退出權,也是在被判違憲之後才在 2023 年 8 月上路的,制度往往是被逼出來的,但資料一旦匯進去就很難重來,因此更值得一開始就做對。這也呼應第一篇的主張:這件事值得參與,而參與的底氣,就是這些看不見的細節有沒有真的做到位。

常見問題

把去識別化後的資料送到雲端 LLM,個資不會外洩嗎?
關鍵在只送去識別化後的內容,而且原始文件的向量索引都在地端完成。雲端只在查詢當下拿到必要的業務脈絡,拿不到原始文件,再加上規則式與命名實體識別兩層遮蔽,個資被實體隔離擋在雲端之外。

醫院用 AI 已經要花錢了,為什麼還要多花成本做合規檢查?
因為合規本質上是保險,不是額外開銷。一次越權診斷、個資外洩或 AI 幻覺內容流出,法律責任與商譽損失遠大於守門成本。衛福部指引已要求醫院對 AI 產出內容主動揭露、避免幻覺延誤就醫,加上《人工智慧基本法》三讀通過,合規從選配變成義務,不做的風險正在變大。

資料做了去識別化,是不是就不用擔心隱私了?
不是。去識別化擋得住直接回推身分,擋不住交叉比對重新識別,也擋不住二次利用範圍被放寬。care.data 當年就因為把去識別化講得太滿、資料又流向商業公司而信任盡失。真正撐住隱私的是治理,包括退出機制、獨立監理和明確使用界線。

合規檢查工具可以直接告訴使用者這份內容能不能發布嗎?
負責任的設計不會這樣做。工具應該只回各關卡的狀態,整體放行與否由人依狀態判讀,因為臨床與法律責任不該交給機器承擔。機器做前置篩選,專業人員做最後決定,責任歸屬才清楚。


本文為資訊整理與觀點分析,涉及之合規做法為通則性說明,不構成法律意見或個案的資安建議。文中作為範例的 goalkeeper 為本文作者參與的專案,已於文首揭露。