AI 模型量化是把模型的權重或啟動值,從 FP32 等高精度格式改用 FP16、INT8、INT4 等較低位元表示,目標是減少記憶體占用,並在支援的硬體上改善推論效能。它會帶來精度與相容性的取捨,量化後必須用代表性資料和實際部署硬體重新驗證;這也是AI 模型選型要同時看資料、成本與部署的原因。

AI 模型量化是什麼

模型裡的權重與執行中的啟動值,本質上都是數值。量化把這些數值換成較少的位元來儲存或運算,例如把 32 位元浮點數轉成 8 位元整數;在只計算原始數值、不計入 scale 等額外資料時,單一數值的儲存空間理論上從 32 位元降到 8 位元,也就是四分之一。TensorFlow 的官方文件把降低模型大小、處理量、延遲與功耗列為訓練後量化的目標,並指出權重可轉成 16 位元浮點數或 8 位元整數。

這裡的 FP32、FP16、INT8 與 INT4,代表數值格式和位元寬度。位元越少,能表示的數值範圍與間隔越受限制,模型輸出就可能出現誤差;NVIDIA TensorRT 文件列出 INT8、FP8、INT4 與 FP4 的表示方式,以及每種格式可使用的 scale 粒度。

由多層數位方塊組成的晶片資料流,象徵 AI 模型從高精度轉為低精度格式

量化怎麼把浮點數換成整數

量化需要一個把原始數值範圍映射到低位元範圍的比例,也就是 scale;若原始數值不以零為中心,還會使用 zero point 把零對齊。以 ONNX Runtime 的線性量化為例,浮點值可用 scale × (quantized value - zero point) 還原,轉換時會先縮放、四捨五入,再限制在目標格式能表示的範圍內。ONNX Runtime 的公式與說明也提醒,zero point 無法正確表示零時,可能造成準確率誤差。

scale 可以套在整個張量、單一通道或一個區塊。範圍切得越細,通常越能貼近各段數值分布,但需要保存更多比例資料,也要求執行環境支援對應的格式;TensorRT 的量化表列出 INT8 可用每張量或每軸量化,INT4 則採每區塊量化,在該文件的 TensorRT 實作中屬於權重量化。

模型量化還要分清楚權重與啟動值。只量化權重可以減少模型檔案和載入記憶體,權重與啟動值都量化,才有機會使用整數型加速器;TensorFlow 文件指出,權重與啟動值的全整數量化需要一小組代表性資料集。

抽象數值刻度與指針畫面,象徵量化時以比例尺把浮點數映射到較低位元範圍

PTQ、QAT 有什麼差別

PTQ 是 Post-Training Quantization,模型訓練完成後才做量化。工程團隊準備一批能代表實際輸入的校準資料,估計各層數值範圍,再把模型轉成目標格式;ONNX Runtime 將動態量化、靜態量化與量化除錯都列在轉換工具中。PTQ 適合先快速測試,代價是某些模型在低位元後的誤差可能較大。

QAT 是 Quantization-Aware Training,訓練期間就模擬量化造成的舍入與截斷,讓模型參數在訓練時適應低精度運算。NVIDIA 的部署文件把 PTQ 與 QAT 都列為模型量化工作流程,並說明低精度格式能改善效能,但可能犧牲準確率。

實務上可以先用 PTQ 建立基準,再判斷是否需要 QAT。若任務對誤差很敏感,應把原模型與量化模型放在同一批測試資料上,拆開看整體指標、各類別表現、極端輸入和失敗案例,不能只看模型檔案縮小多少。

工程師在工作站檢查 AI 模型轉換與校準流程,象徵 PTQ 與 QAT

量化後會快多少,代價在哪裡

量化沒有固定的加速倍數。TensorFlow 將降低延遲、處理量、功耗與模型大小列為量化的可能效果;NVIDIA TensorRT-RTX 則明確標示低精度格式能改善效能,但可能犧牲準確率。實際結果還會受到模型運算子、批次大小、記憶體頻寬、硬體核心和驅動版本影響。

格式每個數值的位元寬度常見用途先確認的限制
FP3232 位元訓練基準、相容性優先的推論記憶體與頻寬需求較高
FP1616 位元GPU 推論與混合精度流程需確認硬體是否有對應核心
INT88 位元CPU、部分 GPU 與邊緣裝置推論需要 scale、校準資料與整數核心支援
INT44 位元大型模型的權重壓縮工具支援與運算方式差異較大

這張表是格式層級的判斷,不代表每台設備都會得到相同速度。TensorFlow 建議 GPU 加速優先評估 16 位元浮點數、CPU 執行評估 8 位元整數TensorRT 的支援表則指出 INT4 在其文件所述情境主要用於權重量化。因此,看到模型標成 INT4,不等於整個推論流程都以 4 位元整數執行。

真正的比較項目至少包括模型載入時間、常態與尖峰延遲、每秒請求數、顯示卡或處理器記憶體、功耗,以及量化後的任務品質。部署工具還可能在部分層保留較高精度,或因格式轉換增加額外處理;TensorRT-RTX 文件也要求明確選擇要量化的層,並指出 scale 校準會影響準確度。

台灣現在到哪裡

台灣的公共 AI 基礎建設已把模型訓練與模型推論分成不同申請類別。數發部數位產業署 2026 年公開的算力平台說明,提供企業申請模型訓練與推論環境,推論類可透過 API 串接平台預設模型;平台清單也列出 TAIDE、FFM、Gemma、Llama、YOLO 與語音模型等選項

數發部另在 2026 年 8 月公告擴大 115 年 AI 算力平台申請資格,對象涵蓋國內數位經濟產業,申請期限至 2026 年 10 月 30 日。公告內容顯示,這類公共服務目前先解決企業取得 GPU 算力和模型服務的門檻;量化格式是否能直接使用,仍要看平台的模型、執行引擎與硬體支援。

從政策平台的公開資訊來看,台灣目前已有算力、模型與應用服務的入口,尚未形成一套適用所有模型與硬體的 INT8 或 INT4 通用規格。數發部的 AI ONE 平台把 GPU 算力池、技術輔導、應用案例與供應商名錄放在同一個產業服務架構裡;這代表量化落地會和模型工具鏈、硬體採購及應用驗收一起處理,不能只看模型下載頁上的位元標籤。

資料中心伺服器與雲端 AI 算力環境,象徵台灣模型推論服務的部署現況

一般人與企業要注意什麼

對一般使用者,量化模型的優點通常是檔案較小、較容易放進本機或記憶體有限的設備。下載前要看清楚量化格式、模型版本、所需記憶體、支援的執行工具和授權條款;同一個模型名稱搭配不同量化版本,回答品質與速度可能不同。

企業評估時,可以沿用AI 訓練加速器工作負載清單的做法,先記錄真實請求量、輸入輸出長度、延遲目標與資料敏感度,再用原模型、PTQ 模型和必要時的 QAT 模型做同場測試。驗收表至少要留存模型雜湊、量化方法、校準資料版本、硬體與驅動版本、P50 與 P95 延遲、記憶體用量、功耗、品質指標及回復原模型的程序。

醫療 AI、金融風控或其他高風險服務還要把量化視為模型版本變更,重新檢查不同族群、邊界案例和人工覆核流程。台灣 AI 基本法頁面列出安全、透明與可解釋、公平與不歧視、問責等原則;AI 風險分類框架則要求先盤點應用情境、識別與評估風險,再規畫應對措施。醫療導入的驗證方法,也可參考醫療 AI 驗證與上線監測的存量整理。

工程師與醫療資訊人員共同檢查 AI 模型量化後的驗證報告與部署指標

量化適合處理明確的部署限制,例如模型太大、記憶體不足或推論延遲過高。它的成效要用實際模型、代表性資料和目標硬體量出來,完成品質與效能雙重驗收後,才適合進入正式服務。

常見問題

AI 模型量化會讓模型變笨嗎?

有可能,因為較低位元格式能表示的數值範圍與精度較小。誤差大小取決於模型架構、量化格式、校準資料、量化層位置與執行硬體,需以原模型和量化模型的同場測試確認。

INT8 和 INT4 哪個比較好?

INT4 每個數值使用的位元較少,理論上能進一步降低權重儲存量,但工具與硬體支援差異也較大。INT8 通常較容易取得成熟的執行支援,實際選擇仍要以任務品質、延遲和記憶體測試結果決定。

量化後就能直接部署到任何 GPU 或手機嗎?

不能直接假定相容。模型檔案格式、量化算子、硬體低精度核心、驅動和推論引擎都要互相配合,部署前應先確認支援矩陣並在目標設備試跑。