手機能不能在沒有網路時執行大型語言模型,過去常受記憶體與功耗限制。2026 年 9 月,TechNews 報導一項 A20 Pro 搭載的 iPhone 18 Pro 本機測試,指稱可執行 Bonsai-27B,生成速度約為 iPhone 17 Pro 的兩倍;PrismML 則另在產品公告說明 Bonsai-27B 的低位元模型版本與記憶體占用。這兩個來源涉及不同資料層級,不能視為同一組完整實測。
這項結果值得觀察,卻不能直接解讀成所有 27B 模型都能在手機順跑。選擇本地AI或雲端助理,要一起看模型能力、資料是否離開裝置、即時資訊需求、電力與費用,以及台灣使用者的帳號、網路與服務條件。
一、A20 Pro真的能在手機離線跑27B模型嗎?
依 TechNews 報導的特定 iPhone 18 Pro 示範,A20 Pro 搭載裝置可在本機執行該報導所稱的 Bonsai-27B;PrismML 的產品公告則指出,1-bit 版本約 3.9GB,適合在 iPhone 17 Pro 的記憶體預算內運作。這些資料分別說明一項裝置測試與一項模型版本設計,尚不足以推論其他 27B 模型也能同樣運作。
Bonsai-27B實測揭示了什麼
TechNews 報導的測試指出,搭載 A20 Pro 的 iPhone 18 Pro 在本機執行 Bonsai-27B,生成速度約為 iPhone 17 Pro 的兩倍,推理過程不需連線雲端伺服器。這是 A20 Pro 裝置的媒體實測,不等同 PrismML 對 Bonsai-27B 模型版本的產品說明;報導也未在同一段公開完整的模型量化、提示、上下文與長時間負載條件。
但目前資料仍是特定測試者、特定模型版本與特定提示的結果。完整測試腳本、上下文長度、連續運行時間、室溫、電量變化與降頻曲線尚未充分公開,讀者應把它視為可重現性值得追蹤的示範。
270億參數不等於模型檔案與體驗相同
PrismML 產品公告指出,27B 模型以 16 位元精度約需 54GB,傳統 4-bit 版本約 18GB;該公司推出的 1-bit 版本約 3.9GB,三元版本約 5.9GB。這組容量數字來自業者對模型版本的說明,不是 TechNews A20 Pro 實測所量出的檔案大小或速度。低位元量化降低了記憶體門檻,但這些仍是開發者資料,仍要用獨立測試確認品質與耗電。
參數量只代表模型規模的一個面向。實際執行還要負擔 KV cache、輸入內容、視覺模組、暫存空間與應用程式本身的記憶體。手機能放下模型檔案,和長對話中仍能維持速度,是兩個不同問題。
Apple 對 Core ML 的說明提到,裝置端模型可運用 CPU、GPU 與 Neural Engine,並以降低記憶體與功耗為目標;完全在裝置上執行也能減少網路依賴。這說明端側運算的系統優勢,不能替每個第三方模型提供通用保證。
「It can run a 27B model at double the speed of the 17 Pro.」—Adrien Grondin,TechNews 報導所引述的公開貼文
這句話描述的是該次 A20 Pro 與 iPhone 17 Pro 的比較結果。依目前公開示範,較保守的描述是,在支援的硬體、模型與量化設定下可執行,不能延伸成所有 27B 模型都能在手機上順暢離線執行。
二、本地AI與雲端助理的五個比較軸
本地AI與雲端助理至少要比較能力、速度、隱私、成本與可用性;單看參數量或單次回應速度,容易忽略兩者承擔的工作不同。
能力與即時資訊
本地模型適合摘要、改寫、分類與固定格式處理,部分低位元模型也支援影像輸入與工具呼叫。雲端助理則能持續更新模型,並在開啟功能時使用檔案、程式或網頁搜尋。OpenAI 官方文件說明,web search 可讓模型取得最新網路資訊並提供來源引用;Anthropic 文件也說明 Claude 網頁搜尋能存取即時內容並附引用,實際功能仍取決於產品與帳號設定。
速度與長文
離線AI少了上傳、排隊與網路往返,訊號不穩時更有優勢;持續生成的速度仍會受溫度、電量、背景程式與輸出長度影響。雲端服務在網路良好時,可能以更大的伺服器處理長文與多步工具流程。比較時應以完成整個任務的時間衡量,不能只看第一個 token 出現得多快。
隱私與資料流
推理留在手機可降低部分資料外傳機會,卻不等於應用程式沒有遙測、同步或第三方服務。雲端方案則要檢查資料保留、訓練用途、管理員權限、跨境傳輸與刪除方式。處理個資或公司機密時,先去識別化、切分資料與確認組織政策,通常比單純二選一更可靠。
成本與台灣使用條件
本地AI的成本包含較大記憶體、儲存、電力、散熱、模型授權與相容性維護;高頻率、固定任務才可能凸顯長期效益。雲端則以訂閱或用量付費,還要確認帳號層級、服務地區、付款方式、發票與企業管理設定,這些條件都可能變動。
裝置與服務的可用性
本地模型下載需要儲存空間,更新需要網路,還可能限制作業系統、晶片、相機或檔案權限。雲端助理也可能因方案、工作區政策或網路環境而無法使用。採用前應用目標帳號測試必要功能,不能用他人的方案與去年的價格推論目前體驗。

| 面向 | 本地AI/端側AI | 雲端助理 |
|---|---|---|
| 資料路徑 | 推理可留在裝置,仍要查應用程式與外掛 | 請求經網路,須查保留、權限與條款 |
| 最新資訊 | 離線時無法自行取得新網頁內容 | 開啟搜尋工具後可查即時資料 |
| 速度 | 少網路往返,長時間運算可能降速 | 受網路、排隊與服務負載影響 |
| 能力更新 | 受模型版本、硬體與儲存空間限制 | 由服務商更新,方案可能有限制 |
| 成本 | 硬體、電力、儲存與維護 | 訂閱、用量、付款與帳號管理 |
三、哪些工作適合交給手機端AI?
手機端AI適合資料不宜離開裝置、可接受固定模型能力、又不需要即時網路資料的任務;需要最新資訊、複雜研究或外部工具時,雲端助理通常較合適。
適合離線處理的任務
個人筆記整理、已下載文件摘要、離線翻譯、草稿改寫、相片分類與固定格式回覆,都可以先交給手機端AI。這些任務的共同點是輸入範圍明確,品質容易用自己的範例測試,資料也能留在裝置內。
訊號不穩、海外漫遊費用高或工作區域沒有網路時,本地模型也能作為備援。前提是權重與必要資料已先下載,使用者明白離線答案不會自動反映最新公告、價格或版本。
仍應使用雲端助理的任務
當問題涉及當日新聞、法規版本、股價、航班、庫存或研究資料,本地模型若沒有搜尋工具便無法更新資訊。長文交叉分析、程式庫查詢與多個外部系統串接,也較依賴雲端的檔案、搜尋與執行工具。
醫療、財務與法律等高風險問題,不能因為模型在本機執行就當成可靠判斷。端側AI可以協助整理問題或準備資料,但不應取代專業判斷,也不應成為個人決策的唯一依據。
四、本地AI與雲端AI的混合工作流
混合工作流可讓本地AI先處理敏感、固定與離線任務,再把去識別化摘要交給雲端完成搜尋或複雜推理,最後由使用者核對輸出與原始來源。
先替資料分級:可公開資料直接交給雲端;內部資料先刪除姓名、聯絡方式、帳號與精確地點;高度敏感資料則在沒有明確授權時留在裝置端。接著判斷工作是否需要外部世界,涉及最新日期、版本、價格或政策時,雲端搜尋的價值會提高。
流程還要設計回退方案。手機過熱、電量不足或模型載入失敗時,能否延後處理或改用雲端?雲端中斷時,是否仍有離線模型保留基本功能?把輸入、輸出、資料去向與人工檢查點寫清楚,系統才有機會穩定落地。
選擇前的四步檢查
- 標記任務輸入是否含個資、公司機密或未公開資料。
- 用同一份測試資料比較兩者的品質、速度、長文表現與錯誤類型。
- 實測離線狀態、連續運行、發熱、耗電、搜尋、檔案、付款與用量限制。
- 為資料外傳、服務中斷與回答錯誤設定回退流程,確認人工核對責任。
Apple Core ML 文件寫道:「Core ML optimizes on-device performance by leveraging the CPU, GPU, and Neural Engine while minimizing its memory footprint and power consumption.」這段說明的是 Core ML 框架的設計目標,不能替個別模型、應用程式或手機作出安全保證。

- A20 Pro 執行 Bonsai-27B 是特定硬體、模型與低位元設定的示範,不能代表所有 27B 模型都能在手機順跑。
- 本地AI可降低網路依賴與部分資料傳輸,雲端助理則強在模型更新、即時搜尋與工具整合。
- 敏感且固定的工作可先放在本地,需要最新資料與複雜研究的工作再交給雲端。
常見問題
Q1: A20 Pro 能執行所有 27B 模型嗎?
不能這樣推論。公開示範針對 Bonsai-27B 的特定低位元版本與特定手機,其他模型可能有不同檔案大小、量化方法與記憶體需求。
Q2: 本地AI離線執行就一定比較安全嗎?
不一定。推理留在裝置可降低部分資料外傳機會,但仍要檢查遙測、同步、搜尋、第三方工具、權限與服務條款。
Q3: 什麼時候應選 ChatGPT 或 Claude?
需要最新網頁資訊、長文件分析、程式工具或多步研究時,雲端助理通常較適合;仍要確認搜尋功能、方案、地區與資料政策。
Q4: 如何判斷手機端AI值不值得用?
用自己的任務做小型測試,記錄品質、速度、發熱、耗電、離線可用性與資料去向,再和雲端費用一起比較。
結論:27B手機AI仍需與雲端協作
A20 Pro 的示範顯示手機端AI的可行範圍正在擴大,但本地與雲端各有適合的任務,依資料敏感度、資訊新鮮度與工作負載混合使用更合理。
A20 Pro 與 Bonsai-27B 的示範,改變了大型模型靠近手機端的可行性邊界,也讓低位元量化、記憶體頻寬、神經網路引擎與裝置端軟體最佳化成為實際產品條件。
但端側AI能否成為日常工具,還要看模型品質、長時間負載、資料流揭露、硬體更新與回退設計。現有依據仍以媒體報導、業者資料與特定測試為主,正式硬體規格、不同量化版本、功耗、溫度、上下文長度和跨裝置表現,都需要更多獨立重測。
評估順序可以很務實:先問資料能否離開手機,再問工作是否需要即時資訊,接著比較實際速度、電力、費用與服務可用性。依任務選擇本地、雲端或混合工作流,比追逐單一參數數字更能降低導入後的落差。
參考來源
- TechNews 科技新報編輯台 (2026). 告別雲端連網!A20 Pro 實測:iPhone 18 Pro 成功於本機直跑 270 億參數大模型. *TechNews 科技新報
- PrismML (2026). Announcing Bonsai 27B: The First 27B-Class Model to Run on a Phone. *PrismML
- Apple Developer (2026). Core ML. *Apple Developer Documentation
- OpenAI (2026). Web search. *OpenAI API Documentation
- Anthropic (2026). Web search tool. *Claude Platform Docs