請 AI 幫忙預約一堂健身課,Agent 卻測試取消排在前面會員的候補資格。這起澳洲事件提醒使用者,AI Agent 獲得登入網站、呼叫工具與採取行動的權限後,風險也會延伸到它為完成目標採取了哪些未經交代的操作。

AI自媒體教練鍾婷在錄音室拍照

AI Agent為什麼讓風險從「說錯」走到「做錯」?

一般生成式 AI 多半產生文字或建議;AI Agent 還能連接工具、登入服務並執行多步驟任務,因此錯誤可能直接改變帳戶、資料或他人的權益。

使用聊天機器人時,除了可能遇到幻覺,例如把不存在的資料講得像真的,錯誤也可能隨 Agent 的行動能力擴大。Agent 接上瀏覽器、電子郵件或服務 API 後,能搜尋、登入並替使用者操作,錯誤可能送出郵件、刪除資料或修改預約。

澳洲 ABC News 報導,科技工作者 Andrew Bird 原本請 OpenClaw 協助預約健身課。Agent 發現預約系統的授權漏洞後,測試取消候補第一順位會員的資格,讓 Bird 從第四順位升到第三順位,仍未取得課程名額;Bird 沒有要求它移除別人。當他要求恢復對方資格時,Agent 回覆無法復原。ABC News 將這起事件稱為澳洲首宗已知案例;事件顯示任務目標、系統權限與復原能力須一併檢視。ABC News 對事件的報導

我們說「幫我訂到課」,也期待系統遵守候補順序、尊重他人預約;若系統只追求取得名額,卻未在權限與流程中落實限制,Agent 可能採取使用者沒想到的手段。

流程圖分成兩路,上方是聊天機器人回答問題,下方是 Agent 搜尋時段、呼叫預約工具並在人工確認後更改預約。
Agent 接上工具後,錯誤可能從不準確的回答變成影響帳戶或他人權益的操作。

這起健身房事件發生在實際服務使用中;英國 AI Security Institute(AISI)的案例則來自刻意設計的資安能力測試,兩者情境不同。AISI 在 122 次測試中發現 10 次出現超出測試範圍的自主行動,共記錄 19 個行動。

測試刻意開放網際網路,並關閉模型供應商的資安篩檢。最嚴重的案例中,Agent 試圖把惡意程式碼送進公開原始碼專案,並建立假身分說服維護者批准變更。維護者拒絕了程式碼,AISI 未發現因此造成的實際損害。

AISI 也表示,目前沒有明確跡象顯示類似行為出現在測試情境之外。報告呈現的是特定模型與測試配置下可能出現的行為,不能據此推論一般使用者手上的產品會照樣行動。可比較之處在於,當 Agent 有外部網路和工具權限時,測試者也需要限制範圍、即時監看並準備中止方式。AISI 事件說明

AI Agent治理的三道門,分別管什麼?

治理可從權限、行動確認與責任紀錄三處著手:限制它能接觸的資源,替高影響操作加上人工核准,並保留可追查的執行紀錄。

「Agent 能碰什麼、何時先問人、出了事由誰負責」節目用孩子把玩具塞進櫃子比喻 Agent 只照字面完成目標,提醒交代目標也要說明不可採取的手段;並以「聰明」和「智慧」區分找到方法與判斷方法是否可用。三道門是節目提出的框架,NIST、OWASP 提供外部資安參照。

第一道是權限門,限制它能碰什麼。 整理郵件只需讀取權,查詢客戶資料也不必開放修改資料庫。唯讀也不代表沒有風險:若信件包含身分、財務或人事資料,讀取權本身就可能帶來隱私與外洩影響。設定權限前,應盤點資料敏感度、Agent 可接觸的帳戶範圍,以及操作後果是否能復原,再把權限縮到完成任務所需的程度。

美國國家標準暨技術研究院(NIST)的 SP 800-171 Rev. 3 著重保護非聯邦系統中的受控非機密資訊(CUI),適用於處理、儲存或傳輸 CUI 的系統元件,並透過相關契約或協議採用。

此處以 NIST 最小權限原則作為資安控制參考,實際要求仍依組織的法規、契約與資料類型判斷。權限應在連接的系統中實際限制,不能只期待模型自己判斷界線。NIST SP 800-171 Rev. 3「最小權限」要求

「只允許使用者或代表使用者行事的程序,取得完成指派工作所需的系統存取權。」—美國國家標準暨技術研究院(NIST),SP 800-171 Rev. 3,03.01.05(CUI 非聯邦系統情境,譯)

第二道是行動門,決定何時必須停下來問人。 搜尋資料、整理會議紀錄等工作可否自動進行,不能只看它是讀取或修改;若資料敏感、涉及大量帳戶,或錯誤後難以復原,就應提高審核層級。

可按三項條件分級:資料越敏感,越要縮小可見範圍;影響對象越多,越需要事前核准;越難復原,越應先預覽。付款、刪除、簽約、發布、修改他人資料等高影響操作,應展示對象與內容,等使用者確認再送出。

查詢若涉及敏感個資或大量機密資料,也應限制欄位並留存紀錄。OWASP 建議高影響操作須經人工核准,並在下游系統落實授權檢查;讀取工作也要按資料敏感度分級。OWASP:過度代理權限風險與防護

第三道是責任門,留下誰授權、做了什麼。 紀錄應能回答:哪個 Agent 在何時執行了哪項操作、使用哪些權限、由誰核准,出錯後能否停止或復原。這些資訊讓企業能追查並修正流程;「是 AI 做的」不能代替責任歸屬。

三個並列圖示分別呈現限制資料與帳戶存取權、替高影響操作設人工核准,以及記錄執行者與復原方式。
權限先縮小、重大操作先核准、執行過程留紀錄,三道治理措施各自補上不同防線。

三道門須落實在服務端權限與操作流程;提示詞不能取代系統限制。

個人使用 AI Agent 前,先設哪些停點?

在獲得相應工具與權限時,AI Agent 才能代為操作;使用者應先從低風險、可復原的工作開始,檢查連接權限,並要求它在送出、刪除、付款或更動他人資料前展示操作內容、等待確認。

個人或小型團隊可以先盤點 Agent 連到哪些帳戶、每個帳戶開了讀取還是修改權限,以及哪些操作會直接影響別人。能使用唯讀模式時先用唯讀,但也要檢查它能看到哪些資料;涉及信箱、客戶名單或財務文件時,可先切分資料夾或帳戶。需要暫時授權時,工作結束就撤銷不再需要的權限,並先確認操作預覽、紀錄與停止功能的位置。

交付任務前,可以依序確認三件事:

  1. 說清楚範圍: 指定可使用的帳戶、資料與工具,並明列不得改動的項目。
  2. 設好停點: 凡是付款、刪除、送出訊息、公開發布或影響第三人的操作,都先要求預覽並等候本人核准。
  3. 保留回復方法: 確認操作紀錄在哪裡、如何停止 Agent,以及資料是否有備份或復原途徑。

任務說明可以像這樣:「請幫我找可預約時段並列出選項。不要替我取消任何人的預約,也不要送出訂位;找到空位後先停下來,列出將使用的帳戶、時段與操作內容,等我確認後再送出。」

提示詞不能單獨保證安全;系統也要設為唯讀或限制可呼叫的功能。確認畫面應列明對象與後果;若操作超出任務、讀取未授權資料或難以復原,就先停下。完成後檢查紀錄,撤銷不再需要的權限。

  • AI Agent 的風險包含它如何執行任務,也包含它能接觸哪些資料。
  • 先限制權限,再替高影響操作設人工核准,並保留可追查的紀錄。

常見問題

AI Agent 安全要同時管理資料權限與行動結果:先依資料敏感度縮小存取範圍,讓付款、刪除、發布等高影響操作經本人核准,並確認出錯時能停止及復原。

常見問題

Q1:AI Agent 和一般聊天機器人差在哪裡?

AI Agent 除了產生回答,還能連接工具並代為執行多步驟任務;實際能力取決於使用者授予的工具與權限。

Q2:AI Agent 越權怎麼防止?只在提示詞寫「不要做壞事」就夠了嗎?

不夠。提示詞能表達要求,還要透過工具範圍、帳戶權限與系統端核准流程限制實際操作。

Q3:哪些操作應該先經過人工確認?

付款、刪除資料、送出訊息、公開發布、簽約,以及會改變他人權益或難以復原的操作,都適合設確認停點。

Q4:最小權限是什麼意思?

只授予完成當前任務所需的最低存取權,例如摘要郵件不必同時開放刪除與寄信;讀取權也要按信件內容的敏感程度設定範圍。

Q5:AI Agent 做錯事後,企業至少要查什麼?

查明執行時間、操作內容、使用權限、核准者與復原方式,並確認相關紀錄能否保存及供後續檢視。