很多人看到「本機 AI」四個字,第一個反應是資料不會離開電腦。Perplexity 在 Mac 導入混合推論後,這個判斷需要拆得更細:檔案可以留在本機,研究、規劃或推理工作仍可能交給雲端模型。保密程度取決於哪些資料走到哪裡、誰決定外送,以及系統是否留有可驗證的控制紀錄。

如果處理的是自己的健檢數值、用藥清單或就醫摘要,選錯架構可能增加不必要的外傳範圍。若小型團隊處理客戶、員工或個案的健康資料,問題還會延伸到告知、同意、權限、保存期限與事故責任。這篇文章從資料流出發,比較純雲端、純本機與混合架構,協助讀者判斷哪一種更符合實際情境。

一、什麼是混合推論?先看工作怎麼分配

混合推論是把同一項 AI 任務拆給本機模型與雲端模型分工處理。 它縮小部分敏感資料的外傳範圍,但不代表整項任務都在裝置內完成。

Perplexity 的官方技術說明指出,Mac 上的 Hybrid Compute 會協調雲端的前沿模型與本機模型。雲端模型負責研究與推理,本機模型則處理 Mac 上的私人檔案及應用程式。這是「分工」架構,不能只憑應用程式安裝在 Mac 上,就推定所有提示、上下文與輸出都留在 Mac。

從流程看,一個任務至少可拆成五個環節:讀取本機檔案、辨識敏感內容、形成給模型的上下文、執行推理、呼叫網頁或外部服務。混合推論可將前兩項留在裝置上,再把去識別或經核准的內容送往雲端。外傳範圍因此可能小於純雲端,但仍大於關閉所有雲端功能的純本機環境。

「Lily 是針對 Qwen3.6-35B-A3B 的小型 Metal 推論伺服器。」Perplexity 公開程式庫的說明,也列出其支援的模型格式與硬體條件。

Perplexity 公開的 Lily 是針對 Apple silicon 與 Qwen3.6-35B-A3B 的本機推論伺服器。它要求 M5 或更新的 Apple GPU、macOS 26,並限定特定的 4-bit 模型格式。這些條件說明本機推論已可承擔較大模型,也提醒讀者:特定硬體與模型格式的實作結果,不能直接套用到每一台 Mac。

二、保密不能只看模型位置,要畫出完整資料流

不一定。 模型在哪裡執行只是其中一層,檔案索引、外掛、網頁搜尋、診斷日誌、同步備份與團隊共享都可能形成其他外傳路徑。

這個問題要先定義清楚。「外傳」指的是資料離開原本受控裝置或內部網路,進入供應商伺服器、第三方模型、搜尋引擎、雲端硬碟或遙測系統。傳輸有加密、供應商承諾不拿來訓練,仍然屬於外部處理,只是風險控制條件不同。

真正要追問的是,系統送出的內容包含什麼。完整病歷、姓名加檢驗值、去除姓名但保留罕見疾病與日期,風險並不相同。去掉直接識別欄位也未必完成匿名化,多個間接線索仍可能重新指向特定個人。

混合架構通常需要一道本機隱私閘門,判斷資料要留在裝置、遮蔽後外送,或先向使用者要求核准。這能降低暴露面,卻不能把偵測器視為絕對防線。長對話可能在不同回合重複出現姓名、生日或病歷號碼;只要漏掉一次,敏感內容仍會越過邊界。

混合推論的五階段資料流程,由本機檔案讀取、敏感資料偵測及遮蔽核准,進入雲端推理後回到本機執行,旁側標示外掛、日誌、同步與搜尋的外洩路徑。
模型位於哪裡只是起點,外掛、日誌、同步與搜尋同樣可能讓資料跨出原本邊界。

因此,評估保密程度時應逐一詢問:原始檔是否上傳、提示是否外送、輸出存在哪裡、誰能調閱、保存多久、是否用於訓練、第三方模型是否另有條款、使用者能否刪除,以及管理者能否查到操作紀錄。少了其中任何一項,單靠「local」標籤都不足以形成治理結論。

三、純雲端、純本機、混合架構差在哪裡?

三者的核心差異在資料邊界與責任分配。 純雲端把主要推理交給供應商,純本機由使用者管理模型與設備,混合架構則多了一層路由與授權判斷。

比較面向純雲端助理純本機 Ollama混合推論
主要資料流提示與必要上下文送往供應商提示與推理留在本機;下載模型時仍需連網私密檔案可留本機,核准或非敏感工作可送雲端
外傳範圍通常最大,依功能與條款而異關閉雲端、搜尋與外掛後最小介於兩者之間,取決於路由與隱私閘門
推理能力容易使用大型前沿模型與即時搜尋受模型、記憶體與硬體限制一般工作在本機,複雜研究可升級到雲端
網路依賴高,斷網通常無法完成推理模型下載完成後可離線使用本機部分可運作,雲端與搜尋功能仍需網路
直接費用訂閱或按量計價本機模型無逐次雲端費用同時承擔訂閱/點數與本機設備成本
維運責任供應商負責大部分基礎設施使用者負責更新、權限、備份與監控雙方分工,還要管理路由政策
較適合公開資料研究、低敏感日常問答高敏感、可接受能力限制的固定工作需要本機資料與雲端能力並存的流程

Ollama 官方 FAQ 說明,本機執行時 Ollama 看不到提示或資料;也可停用雲端功能,代價是無法使用雲端模型與網頁搜尋。這才接近本文所稱的「純本機」。若模型名稱帶有 cloud、工具會搜尋網路,或本機 API 被代理服務暴露到外網,資料邊界就已改變。

「在本機執行時,Ollama 看不到你的提示或資料。」Ollama 官方 FAQ 同時提醒,使用雲端託管模型時,提示與回覆仍會由其服務處理。

純本機也有另一組風險。未加密的硬碟、共用帳號、過寬的資料夾權限、無驗證的區域網路 API、惡意模型檔與遺失設備,都可能造成資料外洩。資料沒有送給雲端供應商,不代表任何人都拿不到。保護邊界從供應商契約轉回設備、帳號與維運流程。

四、為什麼混合架構仍可能送出敏感健康資料?

原因在於系統必須先辨識敏感內容,才能決定如何路由,而辨識不可能保證每次都正確。 工具呼叫、長對話與間接識別資訊還會增加判斷難度。

健康資料很少只存在一個整齊欄位。使用者可能在第一回合提到年齡,第三回合貼出檢查日期,第五回合再加入罕見診斷。每段單看都像一般文字,合併後卻足以識別個人。若隱私閘門只掃描當前訊息,前文累積的風險可能被忽略。

另一個根因是工作需求互相牽動。要求 AI 比對最新治療指引,本身就需要外部搜尋;要求它替病歷摘要查藥物交互作用,雲端模型可能需要部分醫療上下文才有辦法推理。此時「完全不外送」與「使用雲端能力」形成明確取捨,系統必須選擇縮減上下文、遮蔽欄位、改用本機模型,或停止任務並要求核准。

使用者介面也會影響實際風險。如果核准視窗只寫「允許繼續」,沒有列出將送出的欄位、目的、接收者與保存方式,使用者很難做出知情選擇。小型團隊還需要回答誰可以批准、例外能維持多久,以及事後能否還原當時的路由決策。

多輪健康對話中的年齡、檢查日期與罕見診斷逐步匯聚,接著經過偵測遺漏、模糊核准及雲端工具呼叫而形成外傳事件,流程下方列出對應防護措施。
單一片段看似無害,多輪線索累積後仍可能識別個人,隱私檢查必須涵蓋完整上下文。

改善方法要對準這些原因:先限制可讀資料夾,再做欄位級遮蔽;預設拒絕高敏感資料外送;每次雲端升級顯示實際內容;把搜尋查詢與原始病歷分離;保存足以稽核、又不重複暴露全文的事件紀錄。這類控制通常比單純宣稱採用本機模型更有用。

五、成本與能力怎麼算?別只比較月費

不一定。 本機可降低按次或按 token 的雲端費用,但設備、電力、設定、更新、備份與故障處理都要納入總成本。

Ollama 官方於 2026 年 8 月公布的雲端方案以美元計價:Pro 每月 20 美元、Max 每月 100 美元、Team 每月 500 美元,各自包含不同額度;官網同時標示本機模型免費。這裡的「免費」指沒有本機模型的雲端用量費,不包含電腦購置、人力與電力。

本機模型的能力則受記憶體、模型量化、上下文長度與推論速度影響。小模型適合分類、摘要、格式轉換與敏感欄位遮蔽,遇到跨來源研究、複雜規劃或長篇推理時,品質可能不如大型雲端模型。混合推論的價值正在於把重複、敏感、可界定的工作留在本機,將少數高難度任務交給雲端。

對小型團隊而言,還要計算維運失敗的代價。若唯一懂部署的人離職、模型更新後輸出格式改變,或電腦故障導致服務中斷,省下的用量費可能很快被支援成本抵銷。較合理的比較單位是「完成一類工作並維持可控品質的總成本」,而非單次回答價格。

六、臺灣使用健康資料時,架構選擇還要通過個資檢查

要先確認資料是否可識別個人、處理目的與法律依據,再決定能否交給雲端或第三方。 技術上可用,不會自動等同於蒐集、處理與利用都符合規範。

臺灣《個人資料保護法》第 2 條將病歷、醫療、基因與健康檢查等列入個人資料;第 6 條對這些資料的蒐集、處理或利用設定較嚴格條件。第 8 條的告知事項還包括目的、資料類別、利用期間、地區、對象與方式。把可識別的健檢報告交給境外雲端模型,可能同時涉及委外處理與國際傳輸評估。

一般使用者整理自己的資料,與公司、診所、顧問或健康服務團隊處理他人資料,責任範圍不同。後者不應只靠員工自行勾選 AI 服務的消費者條款。組織需要確認蒐集目的、權限、契約、保存政策、刪除機制與事故處理,必要時由法務、資安及隱私負責人共同判斷。

AI 對健康資料的摘要或分析也不能取代醫療專業判斷。若內容將影響診斷、用藥或治療決策,模型能力、資料正確性、責任歸屬與人工覆核都必須另外設計。隱私架構只處理其中一部分風險。

七、一般使用者與小型團隊該怎麼選?

低敏感、需要即時研究的工作可優先考慮純雲端;高敏感且流程固定的工作偏向純本機;兩種需求同時存在時,再採混合架構。 最後決策要以可驗證的資料流與維運能力為準。

  1. 列資料:寫出任務會碰到的姓名、聯絡方式、健檢值、病歷、帳號憑證與內部文件。
  2. 分敏感度:區分公開、內部、可識別健康資料,以及依法或契約不得外送的資料。
  3. 畫資料流:標出模型、搜尋、外掛、記憶、日誌、備份與第三方服務,確認每一條跨出裝置的路徑。
  4. 設定預設值:高敏感資料預設留在本機;需要雲端時先遮蔽,並要求逐次核准。
  5. 做斷網測試:確認所謂本機模式在無網路時仍能完成預定工作,並檢查日誌是否顯示雲端功能已停用。
  6. 試算總成本:把訂閱、點數、硬體、電力、維護時間、備份與故障復原一併計入。
  7. 留稽核證據:記錄版本、政策、核准者、外送目的與例外,定期重查供應商條款。

個人若只是用公開資料查一般健康知識,純雲端最省維護時間,但不要貼入可識別病歷。需要整理自己的完整報告,又能接受較小模型的能力限制,可用 Ollama 純本機模式,關閉雲端與搜尋功能,並做好裝置加密及帳號保護。

小型團隊常見的合理起點,是先用純本機處理分類、去識別與摘要,再讓人工決定哪些最小必要資訊可以進入雲端。若缺乏路由紀錄、權限管理與例外審核能力,混合架構反而會增加看不見的複雜度。此時縮小使用情境,通常比快速接上更多模型更安全。

  • 混合推論降低的是部分資料外傳,不保證整項任務零外傳。
  • 純本機的隱私邊界較小,但設備安全與維運責任回到使用者或團隊。
  • 比較架構時要同時看資料流、能力、網路、總成本、權限與稽核證據。
  • 在臺灣處理可識別健康資料前,先確認個資法依據、告知內容與委外或跨境風險。
  • 高敏感資料採預設留置本機、最小化外送與逐次核准,較容易從源頭降低問題。

常見問題

Q1: Perplexity 的混合推論等於純本機 AI 嗎?

不等於。官方說明是由本機模型處理私人檔案與應用程式,雲端模型負責研究及推理,因此仍有雲端資料流。

Q2: Ollama 安裝後,資料就一定不會外傳嗎?

只有在使用本機模型、關閉雲端功能,且沒有啟用網頁搜尋、外部工具、代理或遠端 API 時,才能把主要推理限制在本機。設備 Ollama (2026). Ollama’s transparent pricing. Ollama Blog. https://ollama.com/blog/transparent-pricing 4. 法務部(2025)。《個人資料保護法》。全國法規資料庫。https://law.moj.gov.tw/LawClass/LawAll.aspx?pcode=I0050021