
醫療AI的黑箱決策問題,近期隨企業級AI導入熱潮再度被攤上檯面。一篇分析企業導入AI現況的報導指出,多數AI系統存在「黑箱」問題:即使開發者本身,也無法完整說明模型為何得出特定答案(Technews報導)。報導同時點出,AI在自信語氣下產出錯誤資訊(幻覺)的問題,至今仍未被業界完全解決。這類黑箱風險在行銷發想等低風險場景影響有限,但一旦進入醫療診斷等高風險領域,容錯空間就大幅縮小。
企業AI的黑箱焦慮,為何在醫療場域被放大
**同樣是黑箱,商業場景頂多是決策效果打折,醫療場景卻直接連上病患安全與臨床責任歸屬。**這也是為什麼醫療AI對可解釋性的要求,遠高於一般商業應用。
企業導入AI時,黑箱問題最常見的後果是「不敢全信」。使用者看得到輸出結果,卻看不到推論過程,於是每一項輸出都得靠人工覆核,原本期待省下的時間與成本,就在查核環節被吃掉大半。這是前述報導點出的核心矛盾:AI要真正創造效益,前提是查核成本低於它取代的人力成本,但黑箱模型讓查核幾乎無法簡化,只能逐案覆核。
決策不透明如何影響採用意願與責任歸屬
一般商業場景裡,AI給錯建議,代價通常是重做一次、多花一點時間。醫療場景不同:一項診斷建議一旦被採信、又剛好是錯的,代價可能是延誤治療或誤用藥物。責任歸屬也隨之複雜化,臨床醫師若完全依賴一套自己說不清楚推論邏輯的系統,一旦出現爭議,很難證明自己盡到了應有的判斷義務。這正是多國衛生主管機關近年陸續要求AI醫療器材揭露演算法邏輯、資料限制與使用條件的原因之一。
醫療決策的特殊性:從商業風險到病患安全
醫療決策的特殊性在於,它同時牽涉專業判斷與病患知情同意。病患信任的對象是醫師,醫師背後那套推論邏輯若說不清楚,責任就無從釐清。
台灣衛生福利部食品藥物管理署已於「智慧醫療器材專案辦公室」成立說明中指出,該辦公室的成立目的之一,是為導入人工智慧或機器學習技術的醫療器材業者,提供法規輔導與資訊平台,協助釐清技術資料、資料限制與使用環境限制等揭露要求(衛生福利部)。醫療AI要能合法上市,本來就不能只交出一個「結果對就好」的黑箱。
案例:老藥新用研究如何借助可解釋性AI找出新線索
它能把「AI建議這個藥」的推論路徑,攤開成研究人員看得懂、查得證的推理鏈,而不是只丟出一個答案要人接受。COVID-19疫情期間的老藥新用案例,正是這種做法被拿出來檢驗的第一波實戰場。
AI模型如何從既有藥物資料中發掘潛在新適應症
COVID-19疫情爆發初期,英國AI藥物研發公司BenevolentAI的研究團隊,運用結合生醫文獻、藥物、蛋白質與臨床試驗資料的知識圖譜,交叉比對病毒感染機制與既有藥物的作用標的。團隊發現,一款原本用於治療類風濕性關節炎的藥物「巴瑞替尼」(baricitinib),其抑制的AAK1酶,正好與新型冠狀病毒進入細胞所需的路徑(胞吞作用)高度相關,同時巴瑞替尼本身還具有抗發炎特性。
這項發現後續發表於期刊《Frontiers in Pharmacology》(Smith et al., 2021)。
後續發表於期刊《Vaccines》的臨床研究,進一步整理了巴瑞替尼在COVID-19治療上的臨床效益證據(Richardson et al., 2022)。
值得比較的是,同一段時間也有另一種完全不靠AI的老藥新用路徑。今年稍早,英國伯明罕大學與牛津大學團隊發表於《Psychological Medicine》的研究,測試一款慢性便祕處方藥「普如卡必利」(prucalopride)是否能改善憂鬱症康復患者的認知功能。
這項研究的假設來自傳統藥理邏輯:普如卡必利作用的5-HT4血清素受體,同時存在於腸道與大腦,臨床前研究顯示這類受體促效劑可能促進海馬迴突觸可塑性、增加乙醯膽鹼釋放。
團隊招募曾兩度發作憂鬱症、目前已康復且未服用其他藥物的患者,連續服用7到10天後,接受認知功能測試(技術新報報導)。
這項研究目前仍屬早期人體試驗、樣本規模有限,尚未有大型隨機對照試驗證實其對憂鬱症或認知功能具備確立的治療效果,普如卡必利用於憂鬱症或認知改善也非其核准適應症,不能視為現行治療選項。
兩個案例對照之下可以看出:巴瑞替尼的發現路徑,是AI從龐大資料中揪出人類研究者未必第一時間想到的關聯;普如卡必利的發現路徑,則是研究人員憑藥理機制的既有知識做出理性推論。兩者都算是「老藥新用」,但只有前者真正涉及AI黑箱與可解釋性的問題,也就是研究人員該如何驗證、理解AI給出的候選藥物,是不是真的合理。
BenevolentAI研究團隊在論文中形容,知識圖譜查詢的過程是「專家使用者與系統之間的對話」:使用者一步步探索圖譜中存在什麼、不存在什麼、還有哪些可能性,而不是被動接受一個現成答案。
可解釋性工具如何呈現推論依據,讓研究更可信
BenevolentAI採取的做法,是把知識圖譜的推論過程做成可視覺化、可互動查詢的介面,讓研究人員能親自追蹤每一步關聯的來源,而不是只看到「系統建議這個藥」的結論。
這種做法呼應了近期一篇發表於《JMIR AI》的系統性回顧:該回顧分析十項實證研究後發現,半數研究顯示可解釋性AI確實能提升臨床醫師的信任感,尤其當解釋內容「清晰、簡明且切合臨床實務」時效果最明顯;但也有兩成研究顯示可解釋性AI同時可能增加或減少信任,關鍵在解釋本身的複雜度與一致性是否得當。
研究團隊在論文中提醒,未來的方向應是持續精進信任的衡量方式,避免臨床端陷入「過度信任」或「過度懷疑」兩個極端(Rosenbacke et al., 2024)。
《JMIR AI》系統性回顧團隊指出,可解釋性AI的價值關鍵在於解釋是否清晰、簡明且與臨床實務相關,解釋量的多寡並非重點;未來研究應持續精進信任的衡量方式,在過度信任與過度懷疑之間找到平衡。

醫療AI該如何設計,才能守護病患權益
**決策路徑要能被攤開檢視,最終判斷權要留給人類,而且不同風險等級的決策,該有不同程度的信任門檻。**這三點,是目前多數討論可解釋性醫療AI時反覆出現的共同方向。
決策路徑可視化與人類最終判斷權的保留
參考BenevolentAI案例與現行醫療器材法規揭露要求,醫療AI系統若要真正進入臨床,設計上通常需要具備以下幾項要素:
- 推論路徑可視化:系統除了給出建議,也要能呈現支持這項建議的關鍵依據(如相關文獻、影像特徵、檢驗數值),讓臨床醫師能核對邏輯是否合理。
- 標示資料限制與適用範圍:清楚說明模型訓練資料的來源與族群限制,避免在資料未涵蓋的族群(如兒童、孕婦)上被誤用。
- 保留人類最終判斷權:AI的角色是輔助決策,不是取代醫師簽核,任何治療決定都應由醫師依專業判斷確認。
- 建立回饋與追蹤機制:記錄AI建議與醫師最終決定是否一致,作為後續調校與究責的依據。
建立分級信任機制,而非全有或全無的仰賴
不同臨床情境對可解釋性的要求並不一樣,行政排程與初步分流可以容許較高的自動化程度,但涉及診斷、用藥與治療決策時,就需要更嚴謹的人工覆核與說明。以下用風險層級做簡單對照:
| 決策風險層級 | 常見應用情境 | 對可解釋性的要求 | 人類覆核程度 |
|---|---|---|---|
| 低風險 | 掛號分流、衛教內容推播 | 較低,重點在使用便利性 | 抽查即可 |
| 中風險 | 影像初步標記、用藥交互作用提醒 | 中等,需標示判斷依據 | 醫事人員逐案確認 |
| 高風險 | 診斷建議、治療方案、藥物新適應症研究 | 高,需完整推論路徑與資料來源 | 專業人員全案審核、保留最終決定權 |
- 企業AI的黑箱問題,進入醫療場域後風險倍增,因為它牽動的是病患安全而非單純商業效率
- BenevolentAI以知識圖譜識別巴瑞替尼作為COVID-19治療藥物,是可解釋性AI落地藥物研究的具體案例
- 同期的普如卡必利憂鬱認知研究,路徑是傳統藥理推論,並非AI驅動,兩者不宜混為一談
- 醫療AI的設計原則應包含推論路徑可視化、標示資料限制、保留人類最終判斷權,並依風險層級建立分級信任機制
- 涉及精神科用藥或跨適應症使用時,須由醫師評估,不得自行停藥、換藥或自行嘗試新用途
結語:可解釋性不是選項,是醫療AI的入場門檻
**這套系統的建議,必須說得出理由,而且理由要能被研究人員與醫師逐步追問、逐步驗證。**這是COVID-19藥物篩選案例與近期藥理研究共同指向的結論。
企業導入AI遇到的黑箱疑慮,商業場景多半能靠事後查核彌補,但醫療場景的容錯空間小得多。從COVID-19期間的知識圖譜藥物篩選,到近期針對憂鬱症認知功能的藥理研究,兩條路徑都說明了同一件事:任何要進入臨床的新發現,最終都得經得起研究人員與醫師逐步追問「為什麼」。
可解釋性因此已經不只是醫療AI錦上添花的加分項,它直接決定了這套系統能不能被醫療體系採信、能不能守住病患權益。對機構與臨床端而言,導入任何一套醫療AI工具前,值得先確認這套系統的建議是否真的說得出理由。
常見問題
Q1: 醫療AI的「黑箱」問題,跟一般AI黑箱有什麼不同?
本質上是同一種技術限制,即模型無法完整說明推論過程,但醫療場域的後果更嚴重。錯誤建議一旦被採信,可能影響診斷或治療決定,而非單純的商業損失,這也是醫療AI對可解釋性要求更高的原因。
Q2: 巴瑞替尼和普如卡必利都是老藥新用,兩者一樣嗎?
不一樣。巴瑞替尼被辨識為COVID-19候選藥物,是透過AI知識圖譜交叉比對大量生醫資料找到的關聯;普如卡必利用於憂鬱症認知功能的研究,則是研究人員依既有藥理機制(5-HT4受體同時存在腸道與大腦)做出的理性推論,並未借助AI模型。
Q3: 普如卡必利可以用來治療憂鬱症的認知問題嗎?
目前不行。相關研究仍屬早期人體試驗,樣本數有限,尚未有大型隨機對照試驗證實其治療效果,這也不是核准的適應症。孕婦、兒童、慢性病患者與長期服藥者若有相關需求,應由醫師評估,不可自行嘗試。
Q4: 可解釋性AI一定比黑箱AI更值得信任嗎?
不一定。系統性回顧顯示,可解釋性AI確實有機會提升臨床醫師信任,但若解釋內容過於複雜或前後不一致,反而可能讓信任下降。關鍵在解釋是否清晰、簡明且切合臨床實務,而不是解釋的量有多少。
Q5: 一般民眾在意醫療AI的可解釋性,可以怎麼做?
可以留意就醫院所或產品是否公開說明AI輔助工具的適用範圍與限制,並確認最終診斷與治療決定仍由醫師負責,而非全權交給系統。若涉及用藥調整,務必透過醫師評估,不要自行停藥或換藥。
參考來源
- Smith DP, Oechsle O, Rawling MJ, Savory E, Lacoste AMB, Richardson PJ (2021). Expert-Augmented Computational Drug Repurposing Identified Baricitinib as a Treatment for COVID-19. *Frontiers in Pharmacology*, 12:709856
- Richardson PJ, Robinson BWS, Smith DP, Stebbing J (2022). The AI-Assisted Identification and Clinical Efficacy of Baricitinib in the Treatment of COVID-19. *Vaccines (Basel)*, 10(6):951
- Rosenbacke R, Melhus Å, McKee M, Stuckler D (2024). How Explainable Artificial Intelligence Can Increase or Decrease Clinicians' Trust in AI Applications in Health Care: Systematic Review. *JMIR AI
- de Cates A, Murphy SE, et al. (2026). Pro-cognitive effects of 5-HT4 receptor agonism in individuals with remitted depression. *Psychological Medicine
- 衛生福利部(2021)。食品藥物管理署智慧醫療器材專案辦公室成立
- 技術新報(2026)。「便祕藥」竟可能是憂鬱症救星?研究揭曉背後的認知功能關鍵
- 財經新報(2026)。Beyond the AI Hype: Sober Reflections on Black-Box Risks & Enterprise Adoption Realities