AI 模型量化是把模型的權重或啟動值,從 FP32 等高精度格式改用 FP16、INT8、INT4 等較低位元表示,目標是減少記憶體占用,並在支援的硬體上改善推論效能。它會帶來精度與相容性的取捨,量化後必須用代表性資料和實際部署硬體重新驗證;這也是AI 模型選型要同時看資料、成本與部署的原因。
AI 模型量化是什麼
模型裡的權重與執行中的啟動值,本質上都是數值。量化把這些數值換成較少的位元來儲存或運算,例如把 32 位元浮點數轉成 8 位元整數;在只計算原始數值、不計入 scale 等額外資料時,單一數值的儲存空間理論上從 32 位元降到 8 位元,也就是四分之一。TensorFlow 的官方文件把降低模型大小、處理量、延遲與功耗列為訓練後量化的目標,並指出權重可轉成 16 位元浮點數或 8 位元整數。
這裡的 FP32、FP16、INT8 與 INT4,代表數值格式和位元寬度。位元越少,能表示的數值範圍與間隔越受限制,模型輸出就可能出現誤差;NVIDIA TensorRT 文件列出 INT8、FP8、INT4 與 FP4 的表示方式,以及每種格式可使用的 scale 粒度。
量化怎麼把浮點數換成整數
量化需要一個把原始數值範圍映射到低位元範圍的比例,也就是 scale;若原始數值不以零為中心,還會使用 zero point 把零對齊。以 ONNX Runtime 的線性量化為例,浮點值可用 scale × (quantized value - zero point) 還原,轉換時會先縮放、四捨五入,再限制在目標格式能表示的範圍內。ONNX Runtime 的公式與說明也提醒,zero point 無法正確表示零時,可能造成準確率誤差。
scale 可以套在整個張量、單一通道或一個區塊。範圍切得越細,通常越能貼近各段數值分布,但需要保存更多比例資料,也要求執行環境支援對應的格式;TensorRT 的量化表列出 INT8 可用每張量或每軸量化,INT4 則採每區塊量化,在該文件的 TensorRT 實作中屬於權重量化。
模型量化還要分清楚權重與啟動值。只量化權重可以減少模型檔案和載入記憶體,權重與啟動值都量化,才有機會使用整數型加速器;TensorFlow 文件指出,權重與啟動值的全整數量化需要一小組代表性資料集。
PTQ、QAT 有什麼差別
PTQ 是 Post-Training Quantization,模型訓練完成後才做量化。工程團隊準備一批能代表實際輸入的校準資料,估計各層數值範圍,再把模型轉成目標格式;ONNX Runtime 將動態量化、靜態量化與量化除錯都列在轉換工具中。PTQ 適合先快速測試,代價是某些模型在低位元後的誤差可能較大。
QAT 是 Quantization-Aware Training,訓練期間就模擬量化造成的舍入與截斷,讓模型參數在訓練時適應低精度運算。NVIDIA 的部署文件把 PTQ 與 QAT 都列為模型量化工作流程,並說明低精度格式能改善效能,但可能犧牲準確率。
實務上可以先用 PTQ 建立基準,再判斷是否需要 QAT。若任務對誤差很敏感,應把原模型與量化模型放在同一批測試資料上,拆開看整體指標、各類別表現、極端輸入和失敗案例,不能只看模型檔案縮小多少。
量化後會快多少,代價在哪裡
量化沒有固定的加速倍數。TensorFlow 將降低延遲、處理量、功耗與模型大小列為量化的可能效果;NVIDIA TensorRT-RTX 則明確標示低精度格式能改善效能,但可能犧牲準確率。實際結果還會受到模型運算子、批次大小、記憶體頻寬、硬體核心和驅動版本影響。
| 格式 | 每個數值的位元寬度 | 常見用途 | 先確認的限制 |
|---|---|---|---|
| FP32 | 32 位元 | 訓練基準、相容性優先的推論 | 記憶體與頻寬需求較高 |
| FP16 | 16 位元 | GPU 推論與混合精度流程 | 需確認硬體是否有對應核心 |
| INT8 | 8 位元 | CPU、部分 GPU 與邊緣裝置推論 | 需要 scale、校準資料與整數核心支援 |
| INT4 | 4 位元 | 大型模型的權重壓縮 | 工具支援與運算方式差異較大 |
這張表是格式層級的判斷,不代表每台設備都會得到相同速度。TensorFlow 建議 GPU 加速優先評估 16 位元浮點數、CPU 執行評估 8 位元整數;TensorRT 的支援表則指出 INT4 在其文件所述情境主要用於權重量化。因此,看到模型標成 INT4,不等於整個推論流程都以 4 位元整數執行。
真正的比較項目至少包括模型載入時間、常態與尖峰延遲、每秒請求數、顯示卡或處理器記憶體、功耗,以及量化後的任務品質。部署工具還可能在部分層保留較高精度,或因格式轉換增加額外處理;TensorRT-RTX 文件也要求明確選擇要量化的層,並指出 scale 校準會影響準確度。
台灣現在到哪裡
台灣的公共 AI 基礎建設已把模型訓練與模型推論分成不同申請類別。數發部數位產業署 2026 年公開的算力平台說明,提供企業申請模型訓練與推論環境,推論類可透過 API 串接平台預設模型;平台清單也列出 TAIDE、FFM、Gemma、Llama、YOLO 與語音模型等選項。
數發部另在 2026 年 8 月公告擴大 115 年 AI 算力平台申請資格,對象涵蓋國內數位經濟產業,申請期限至 2026 年 10 月 30 日。公告內容顯示,這類公共服務目前先解決企業取得 GPU 算力和模型服務的門檻;量化格式是否能直接使用,仍要看平台的模型、執行引擎與硬體支援。
從政策平台的公開資訊來看,台灣目前已有算力、模型與應用服務的入口,尚未形成一套適用所有模型與硬體的 INT8 或 INT4 通用規格。數發部的 AI ONE 平台把 GPU 算力池、技術輔導、應用案例與供應商名錄放在同一個產業服務架構裡;這代表量化落地會和模型工具鏈、硬體採購及應用驗收一起處理,不能只看模型下載頁上的位元標籤。
一般人與企業要注意什麼
對一般使用者,量化模型的優點通常是檔案較小、較容易放進本機或記憶體有限的設備。下載前要看清楚量化格式、模型版本、所需記憶體、支援的執行工具和授權條款;同一個模型名稱搭配不同量化版本,回答品質與速度可能不同。
企業評估時,可以沿用AI 訓練加速器工作負載清單的做法,先記錄真實請求量、輸入輸出長度、延遲目標與資料敏感度,再用原模型、PTQ 模型和必要時的 QAT 模型做同場測試。驗收表至少要留存模型雜湊、量化方法、校準資料版本、硬體與驅動版本、P50 與 P95 延遲、記憶體用量、功耗、品質指標及回復原模型的程序。
醫療 AI、金融風控或其他高風險服務還要把量化視為模型版本變更,重新檢查不同族群、邊界案例和人工覆核流程。台灣 AI 基本法頁面列出安全、透明與可解釋、公平與不歧視、問責等原則;AI 風險分類框架則要求先盤點應用情境、識別與評估風險,再規畫應對措施。醫療導入的驗證方法,也可參考醫療 AI 驗證與上線監測的存量整理。
量化適合處理明確的部署限制,例如模型太大、記憶體不足或推論延遲過高。它的成效要用實際模型、代表性資料和目標硬體量出來,完成品質與效能雙重驗收後,才適合進入正式服務。
常見問題
AI 模型量化會讓模型變笨嗎?
有可能,因為較低位元格式能表示的數值範圍與精度較小。誤差大小取決於模型架構、量化格式、校準資料、量化層位置與執行硬體,需以原模型和量化模型的同場測試確認。
INT8 和 INT4 哪個比較好?
INT4 每個數值使用的位元較少,理論上能進一步降低權重儲存量,但工具與硬體支援差異也較大。INT8 通常較容易取得成熟的執行支援,實際選擇仍要以任務品質、延遲和記憶體測試結果決定。
量化後就能直接部署到任何 GPU 或手機嗎?
不能直接假定相容。模型檔案格式、量化算子、硬體低精度核心、驅動和推論引擎都要互相配合,部署前應先確認支援矩陣並在目標設備試跑。
參考來源
- Quantization Schemes (NVIDIA)
- Work With Quantized Types (NVIDIA)
- Quantize ONNX Models (ONNX Runtime)
- Post-training quantization (TensorFlow)
- 115年算力平台使用申請須知 (數位發展部數位產業署)
- 115年AI算力平台申請資格擴大 (數位發展部數位產業署)
- AI ONE 平台 (數位發展部)
- AI 基本法 (數位發展部)
- AI 風險分類框架 (數位發展部)