同一批事實,放在衛教單張與 Gemini 對話中,結果可能不同。2026 年一份預印本發現,平均約 6.9 分鐘的對話與較低的特定陰謀信念評分相關,平均降幅也大於閱讀事實清單。
研究測量政治事件後的自陳信念,沒有測量台灣民眾的健康知識、就醫選擇或臨床結果。健康傳播者要判斷兩種媒介如何分工。
七分鐘對話在特定信念量表平均降幅較大:兩項實驗發現了什麼
在兩項特定美國線上實驗中,對話組在多項陰謀信念評分的平均降幅大於靜態資訊組;這項結果只適用於研究設定與量表,不能直接視為健康衛教成效。
Costello 等人的預印本研究兩起美國政治事件後的陰謀看法。第一項納入 472 名相關信念持有者,第二項納入 1,035 名,受試者皆為 CloudResearch 招募的美國成人。
第一項研究未預先註冊,第二項有。研究者以 GPT-4o 分類自由文字回答,主要分析限於「是」與「可能是」陰謀信念者,解讀時要考慮這項篩選。
三組比較如何區分對話效果與單純接觸 AI
受試者隨機分成三組:50% 接受針對其看法的反駁對話,25% 閱讀 15 項事實與來源,25% 與 AI 討論貓狗。第三組用來區分針對性內容和單純接觸 AI 的差別。
對話組至少交換五輪,第一項用 Gemini Pro 1.5,第二項用 Gemini Pro 2.5;GPT-4o 負責摘要及篩選。靜態組也有查核資訊與引用。
在 0 至 100 分的自陳核心信念上,對話組相較清單組的調整後差異,第一項低 5.60 分,第二項低 6.56 分。其他題目多呈相同方向,但並非每項比較都達統計顯著。
統計顯著不等於所有人都會改變看法
這些數字是組別平均差異,無法證明每位受試者都改變,或七分鐘足以消除錯誤信念。第一項實驗未提高對官方解釋的信任;第二項對話組雖高於無關對話組,和清單組仍無顯著差異。
兩項實驗都有中途退出者,對話組較多。研究者把退出者的介入前分數帶入後測,但完成多輪對話者仍可能不同於單張讀者。
研究作者將兩起事件定位為個案研究,主張未來應在其他事件中重複驗證,並直接比較對話策略與時間。— Costello et al., 2026

對話式 AI 為何可能更有說服力
可能原因是它能先辨認使用者的證據缺口,再補充相關資料、追問推論依據,並依現有資訊多寡調整說明策略。
固定單張要預先猜測讀者有哪些疑問。對話式 AI 則可從輸入辨認疑點,例如不信任來源、誤解時間順序、把資訊空白當成證據,或把相關性當成因果。
個人化回應能對準證據缺口
系統先取得受試者的陳述與信心分數,再針對理由回應。有人質疑時間線,就處理時間線;有人關注來源,就討論交叉查證。單張即使正確,也未必涵蓋個人最在意的證據。
互動也增加注意力投入。研究差異可能混合內容對準程度、互動時間、資訊量與主動參與,不能全歸功於模型能力。
追問與認識論謙遜如何協助重新檢視推論
「認識論謙遜」是承認證據界線,區分已知、未知與推測。第一起事件資訊很少,AI 較常提醒資料不完整、提出開放式問題並鼓勵查核;資訊較多時才增加事實論證。
迷思也可能來自把「尚未公開」推成「必有隱瞞」。對話可追問哪些證據會支持或削弱推論。健康衛教若採用此邏輯,必須限於核准知識與清楚的風險邊界。
- 對話可回應疑慮並揭露推論缺口。
- 資訊量與互動時間未完全配平,效果不能全歸因於 Gemini。
- 資料不足時,回答應標示未知與查證路徑。
衛教單張仍有固定內容的治理價值
有必要。固定單張的版本可核准、內容可重現、資料蒐集少且傳播一致,這些都是生成式回答較難自然具備的治理能力。
衛教單張可在發布前由醫療、法務與溝通人員逐字審查;發現錯誤時,也能追查版本。對大型接種、篩檢或出院流程,一致內容能提供共同的安全底線。
單張通常不接收病史或用藥細節,隱私暴露面較小,也能支援網路不佳的情境。限制是難以得知讀者疑點或調整說明難度。
| 比較面向 | 對話式 AI | 固定衛教單張 |
|---|---|---|
| 回應個別疑問 | 可追問與調整 | 涵蓋預先整理的疑問 |
| 內容一致性 | 每次回答可能不同 | 同版本內容一致 |
| 發布前稽核 | 需測試大量提示與輸出 | 可逐字審查 |
| 引用追溯 | 需另建來源驗證 | 可固定列出來源 |
| 隱私負擔 | 可能接收並傳輸敏感內容 | 通常不需蒐集個人資料 |
| 規模化傳播 | 需運算與監測 | 複製成本低 |
| 適合角色 | 解釋、澄清 | 知識底稿、安全底線 |
可行架構是讓固定內容成為核准知識底稿,聊天助理負責問答與分層說明,兼顧治理與互動。
從陰謀信念外推到健康衛教仍有多重落差
不能。研究對象、事件、語言、結果指標與使用情境都和台灣健康衛教不同,只能提供設計假設,尚不能提供臨床成效結論。
核心證據是 2026 年 8 月公開的預印本,尚未經同儕審查。介入發生於美國政治暴力事件後數日;台灣民眾面對疫苗、慢性病或篩檢時,制度信任、語言和風險感受均不同。
主要結果是自陳信念量表。分數下降沒有證明知識保留、正確健康行為或臨床結果改善。第二項研究也未發現政治暴力支持改變,顯示信念不能直接外推到行為。
研究追蹤到若干延伸效果,但並非全都顯著。作者也承認,讓相關信念持有者願意對話是難題。點擊或滿意度也無法證明民眾已理解。
外部效度還有一層差異。政治事件中的信念糾正,主要處理證據解讀與來源信任;健康對話卻常同時牽涉個人症狀、病史、用藥及時效性。同一種說服策略若忽略這些差異,可能讓使用者把一般資訊當成個別化建議。
對照組的性質也會影響結論。本研究比較的是十五項靜態事實清單,不等於所有經過讀者測試、圖像化與分層設計的衛教單張。後續若要比較媒介效果,應先對齊資訊量、閱讀時間、來源呈現與語言難度,否則只能知道兩個特定版本有差異,無法找出差異來自互動、內容或視覺設計。
相同團隊 2024 年刊於《Science》的相關研究,在 2026 年 6 月被加註編輯關切聲明。這項狀態不能直接否定新預印本,但表示相關證據仍有待持續查核,不宜視為沒有爭議的定論。
AI 聊天助理的錯誤風險與隱私代價
核心風險包括看似可信的錯誤回答、虛假引用、迎合偏見、說服方向被濫用、回答不一致,以及敏感健康資料遭不當蒐集、保存或二次利用。
世界衛生組織的生成式 AI 健康提醒指出,大型語言模型可能產生看似權威卻嚴重錯誤的健康回答,也可能無法妥善保護敏感資料。流暢文字與完整引用格式都不保證正確。
NIST 的生成式 AI 風險管理文件列出虛構內容、資料隱私、人機配置及資訊完整性等風險。針對個人疑點的說服機制,也可能被反向用來加深錯誤信念。
使用者可能輸入症狀、藥名或家族史,資料再送往第三方模型、寫入日誌或用於分析。流程要交代蒐集目的、保存期限、存取者與二次利用條件。
衛福部 2026 年的醫療機構應用生成式人工智慧指引,也把正確性、資料安全、過度依賴與個資不當利用列為治理重點。前台問答仍需後端權限、稽核與責任分工。
世界衛生組織主張,在生成式 AI 廣泛進入例行醫療前,應先處理風險並取得明確效益證據,同時維持透明、專家監督與嚴謹評估。— WHO, 2023

台灣健康傳播者何時值得導入
當主題風險低、答案能被核准資料完整涵蓋、錯誤可偵測且人工轉介可運作時,才適合從小規模試辦開始。
適合試辦的題目具有清楚且更新可控的官方內容,例如檢查前準備、門診流程或名詞解釋。答案範圍容易界定,答不出來也能顯示來源或轉交真人。
若知識快速變動、來源衝突、錯誤可能延誤治療,或系統無法辨認緊急訊號,就應暫緩。問題延伸到用藥、停藥、劑量、診斷或治療時,必須轉介醫療專業人員。本題不涉及藥食交互作用,但仍要測試對話越界時的處理。
孕婦、兒童、慢性病患者、長期服藥者、健康識能較低者,以及有急性症狀或心理危機者,不應僅依賴生成式 AI。系統要辨認高風險語句並轉介。
以核准內容、引用追溯及人工抽查建立護欄
技術流程可採「檢索後生成」:先從核准知識庫找段落,再據此回答並顯示來源。模型仍可能誤讀或越界,因此要設定拒答、輸出範圍、版本管理與人工抽查。
驗證時要把「找到資料」與「回答正確」分開。第一項是檢索命中率,檢查測試問題是否取得正確的核准段落;第二項是回答與引文的一致性,確認每個重要主張都能由顯示的來源支持;第三項是無答案情境的拒答率,測量系統在知識庫沒有核准答案時,能否停止推測並轉交人員。
測試集不能只收常見問法。還要納入口語、錯字、前提錯誤、追問、相互衝突的條件,以及引導系統越過衛教邊界的問法。同一批案例應在模型、提示、知識庫或政策更新後重跑,否則上一版的通過結果不能代表新版仍符合要求。
內容人員決定可用資料,醫療專業人員定義轉介,資安人員管理資料流,產品團隊監測錯誤,並指定停用系統的負責人。角色不明,錯誤就找不到修正源頭。
責任還要對應到可執行的交付物。內容負責人維護版本與到期日,醫療負責人核定不可回答的邊界,資安負責人審查記錄與權限,營運負責人處理事件通報與停用。若只有共同負責的原則,上線後往往會變成沒有人能做最後決定。
小規模試辦檢查清單
- 選一個低風險、有權威答案的主題。
- 標示底稿版本、來源與更新期限。
- 建立資料最少化、保存與刪除規則。
- 測試誘導問題、高風險族群與緊急情境。
- 明定拒答、轉人工、事件通報及停用門檻。
- 同時比較理解度、事實錯誤率、轉人工率、隱私事件與不同族群表現。
最實際的做法:把 AI 放在互動層
較可行的分工是由核准單張提供事實底稿,AI 負責互動解釋,來源、轉介與人工監督則成為必要的系統元件。
知識層維持可稽核的答案與版本;互動層處理改寫與追問;安全層負責拒答與轉介;治理層記錄錯誤並更新底稿。AI 輸出不應成為唯一真相來源。
評估要對準目標。說明篩檢流程就測理解度與正確操作;澄清迷思就測延後記憶、來源辨識與行為意圖。使用量高無法證明傳播品質提高。
- 個人化對話可能影響特定信念評分,尚未證明台灣衛教成效。
- 單張可作知識底稿,聊天助理負責互動解釋。
- 導入前要處理正確性、隱私、責任、轉介與監測。
- 試辦應看理解度、錯誤率、轉人工率與隱私事件。

常見問題
Q1: Gemini 與衛教單張哪個更有說服力?
在兩項實驗的特定量表上,Gemini 對話組平均降幅較大。健康衛教的內容、風險與指標不同,不能直接判定 Gemini 較好。
Q2: 約七分鐘 AI 對話就能消除迷思嗎?
6.9 分鐘是平均對話時間,結果是組別平均分數變化,沒有證明每個人都改變或迷思已被消除。
Q3: 有核准知識庫就能避免聊天助理答錯嗎?
核准知識庫能降低任意取材風險,仍可能誤讀或越界。拒答、來源顯示與人工抽查仍有必要。
Q4: 民眾可以把症狀與用藥直接貼給衛教聊天助理嗎?
先確認蒐集目的、保存與刪除規則。涉及用藥、診斷、急性症狀或心理危機時,應尋求醫療專業協助。
參考來源
- Costello TH, et al. (2026). Reducing belief in conspiracy theories as they unfold using large language models. *arXiv
- Thorp HH. (2026). Editorial Expression of Concern. *Science*, 392(6803), 1131
- World Health Organization. (2023). WHO calls for safe and ethical AI for health
- Autio C, et al. (2024). Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. *National Institute of Standards and Technology*, NIST AI 600-1
- 衛生福利部(2026)。醫療機構應用生成式人工智慧指引