2026 年模型量化與剪枝技術:FP4 與 INT4 在終端設備的落地推論
INT4 是定點格式,四個位元全部用來表示整數,典型範圍是 -8 到 +7(有號)或 0 到 15(無號)。它的優點是解析度均勻、乘加運算簡單、硬體成本低;缺點是動態範圍極窄,只有 16 個離散值,而且分布是線性的。
FP4 則是浮點格式,目前業界最主流的是 E2M1:1 個符號位、2 個指數位、1 個尾數位。它能表示的值包括 ±0、±0.5、±1、±1.5、±2、±3、±4、±6。注意這個分布——它在 0 附近非常密集,往兩端則迅速稀疏。這正好符合神經網路權重的實際分布:大多數數值集中在零附近,少數離群值(outlier)落在遠處。
這個差異在權重上還不算致命,因為權重分布相對穩定,INT4 搭配良好的縮放策略就能應付。但在激活值(activation)上,FP4 的優勢就明顯了。Transformer 的激活值經常出現幅度極大的離群通道,某些維度的數值可能是其他維度的數十倍甚至上百倍。INT4 遇到這種情況只有兩條路:犧牲解析度去覆蓋離群值,或者把離群值切出來單獨處理,兩種做法都會增加複雜度。FP4 靠著兩個指數位,天然能覆蓋更寬的動態範圍。
2-2 分塊縮放(Block Scaling)與顯微縮放格式
單純的 4-bit 格式幾乎不可能直接拿來用,真正的關鍵在於縮放策略。業界早已從「整個張量共用一個 scale」進化到「分塊縮放」,也就是把權重切成固定大小的小塊,每塊各自帶一個縮放因子。
目前兩種主流規格值得特別記住:
INT4 這邊的常見做法則是 group-wise 量化,group size 通常取 64 或 128,每個 group 帶一個 FP16 的 scale 與 zero-point。GPTQ、AWQ 等經典方法都屬於這一類。相較之下,MXFP4 的 32 元素區塊與 INT4 的 128 元素 group 相比,前者縮放粒度更細,這正是 FP4 在低位元下仍能維持精度的重要原因之一。
2-3 MXFP4、NVFP4 與 INT4 的實務對照
項目
INT4(group-wise)
MXFP4
NVFP4
元素格式
定點整數
E2M1
E2M1
縮放粒度
64 / 128
32
16
縮放因子格式
FP16 + zero-point
E8M0
E4M3 + FP32 二級
動態範圍
硬體支援成熟度
極高
中高
中(新一代硬體)
適合場景
權重、工具鏈成熟的部署
權重與激活皆量化
高精度要求的 LLM 推論
從表格可以看出一條務實的路線:如果只是要壓縮權重、工具鏈又必須穩定,INT4 仍然是 2026 年最安全的選擇;但如果要把激活值也壓到 4-bit,或是在新一代支援 FP4 原生運算的 NPU 上榨出最大效能,FP4 系列格式的優勢就會浮現。
三、量化技術在 2026 年的演進路線
格式只是底層,真正決定精度的是量化演算法。2026 年的技術路線大致可以分成三條主線:訓練後量化的極限突破、旋轉變換對離群值的處理,以及混合精度分層策略。
3-1 訓練後量化(PTQ)的天花板與突破
PTQ 的優勢在於不需要重新訓練,成本低、迭代快。GPTQ 用二階資訊(Hessian 近似)逐層補償量化誤差,AWQ 則觀察到「並非所有權重同等重要」,透過激活值大小找出顯著通道並加以保護。這些方法在 4-bit 權重上已經能做到幾乎無損。
但 PTQ 的天花板出現在「權重與激活同時量化」的時候。當激活值也被壓到 4-bit,誤差會急遽累積,尤其是深層網路的後面幾層。2026 年的主流解法有兩類:一是提高縮放粒度(例如從 per-tensor 走向 per-token、per-channel),二是引入旋轉變換。
3-2 旋轉與離群值:QuaRot、SpinQuant 與 Hadamard 變換
離群值是低位元量化最大的敵人。研究發現,Transformer 中某些特徵維度的激活值會異常巨大,這通常與 RMSNorm 的縮放行為以及注意力機制的結構有關。
QuaRot 的核心想法非常優雅:在權重與激活之間插入正交旋轉矩陣(通常是 Hadamard 矩陣),把原本集中在少數維度的巨大數值「打散」到所有維度上。因為旋轉是正交變換,數學上不改變模型的輸出,卻能讓激活分布變得平滑、更容易量化。更妙的是,旋轉矩陣可以融合進相鄰的線性層權重中,推論時完全不增加額外計算。
SpinQuant 進一步把旋轉矩陣的選擇變成可學習的參數,透過梯度下降找出比固定 Hadamard 矩陣更好的旋轉方案,在 4-bit 權重加 4-bit 激活的設定下,把困惑度(perplexity)的退化壓到極低。到了 2026 年,這類方法已經從論文走進主流工具鏈,成為 W4A4 部署的標準前處理步驟。
3-3 混合精度與敏感度分層
並非所有層都對量化同樣敏感。經驗法則大致如下:
注意力機制中的 Value 投影與輸出投影,對量化的敏感度高於 Query 與 Key。
MLP 的中間層(尤其是 gate 與 up 投影)通常最耐受,可以激進地壓到 4-bit。
LayerNorm / RMSNorm 的參數應永遠保持高精度。
實務上,用一組小型校準資料集跑逐層敏感度分析,產出一份「精度配置表」,往往比盲目套用統一精度能多換到 1 到 2 個百分點的下游任務準確率,而模型大小只增加百分之幾。這在終端部署是很划算的交易。
四、剪枝技術:從非結構化稀疏到硬體友善結構
量化處理的是「每個數值用幾個位元表示」,剪枝處理的則是「有多少數值可以根本不算」。兩者結合,才是 2026 年終端推論的完整答案。
4-1 非結構化稀疏的硬體現實
非結構化剪枝(unstructured pruning)可以把模型稀疏度推到 50% 甚至 70% 而不太影響精度,聽起來非常誘人。問題在於,隨機分布的零值在通用硬體上幾乎無法加速。GPU 與 NPU 靠的是規則的記憶體存取與向量化運算,遇到不規則的稀疏索引反而要付出額外的索引開銷,結果常常是「理論 FLOPs 少了一半,實際速度沒變甚至更慢」。
唯一的例外是具備專用稀疏引擎的硬體,例如支援 2:4 結構化稀疏的架構。這也解釋了為什麼業界對純非結構化稀疏始終保持保留態度。
4-2 結構化剪枝與 2:4 稀疏
結構化剪枝直接移除整個通道、注意力頭或整層,產生的模型密度均勻,硬體能真正受益。常見做法包括:
寬度剪枝:移除部分神經元或通道,模型變窄但仍是稠密運算。
注意力頭剪枝:移除冗餘的注意力頭,對長文本任務的影響需要單獨評估。
2:4 稀疏則是折衷方案:每 4 個連續權重中固定保留 2 個非零值。這個規則性讓硬體可以用固定模式解碼,達到約 2 倍的理論吞吐提升,同時仍保有相當的精度。2026 年的資料中心 GPU 與部分高階終端 NPU 都已原生支援。
4-3 剪枝與量化的協同順序
一個常見的工程問題是:應該先剪枝再量化,還是先量化再剪枝?
實務經驗指向「先剪枝、後量化」,理由有三:第一,剪枝會改變權重分布,先量化會讓剪枝的補償失去意義;第二,剪枝後的模型更小,量化校準資料的統計更穩定;第三,兩者一起做聯合優化(joint optimization)雖然理論上更優,但工程複雜度與調參成本往往不划算,除非你有明確的精度缺口需要填補。
另外要特別注意:剪枝後的模型需要一段「修復訓練」(healing / recovery training),哪怕只是用少量資料做 LoRA 微調,都能把剪枝造成的精度損失補回一大半。這個步驟在終端專案裡常常被省略,結果就是模型「看起來很小,用起來很笨」。
五、終端落地實戰:硬體、工具鏈與評估
談完原理,接下來是最容易踩坑的部分:把這些技術真的放到裝置上跑起來。
5-1 主流終端硬體平台盤點
2026 年的終端推論硬體大致可以分成四個陣營:
選擇平台時,不要只看 TOPS 數字。對 LLM 解碼而言,記憶體頻寬的權重遠大於算力。一個 50 TOPS 但頻寬 120 GB/s 的晶片,跑 4-bit 7B 模型會明顯快過一個 80 TOPS 但頻寬只有 60 GB/s 的晶片。
5-2 推論引擎與工具鏈選擇
2026 年的工具鏈生態已經相對成熟,常見選項包括:
MLX:蘋果生態的後起之秀,對統一記憶體架構的利用相當出色。
實務建議是:先用 llama.cpp 或 ONNX Runtime 做演算法層面的驗證,確認量化配置不會傷精度;等到要量產時,再遷移到廠商工具鏈做深度優化。兩階段的思路能省下大量除錯時間。
5-3 精度評估:Perplexity 之外的指標
這是很多團隊最容易忽略的一環。困惑度(perplexity)是最常用的量化評估指標,但它對下游任務的實際表現預測力有限。一個困惑度只上升 0.1 的量化模型,可能在數學推理上退步 10 個百分點。
建議至少評估以下幾類:
困惑度:快速篩選,但不要作為唯一標準。
穩定性測試:同一個提示重複執行數十次,觀察輸出變異程度。
六、實測案例分析
以下整理 2026 年社群中較具代表性的實測結果,供讀者作為配置參考。實際數字會因硬體、批次大小與提示長度而異。
6-1 1B–8B 語言模型在行動 SoC 上的表現
模型規模
精度配置
權重佔用
解碼速度(約)
1B–2B
INT4 / FP4 權重 + FP16 激活
0.6–1.2 GB
35–60 tokens/s
3B–4B
INT4 權重 + INT8 激活
1.8–2.4 GB
20–30 tokens/s
7B–8B
INT4 權重 + FP16 激活
4.0–4.8 GB
10–16 tokens/s
7B–8B
FP4 權重 + FP4 激活(NVFP4)
4.0–4.8 GB
14–20 tokens/s
幾個值得注意的觀察:
1B 到 2B 級別的模型在手機上已經完全實用,語音助理與即時翻譯是殺手級場景。
6-2 視覺與多模態模型的量化難點
多模態模型(VLM)的量化比純語言模型棘手得多,原因有三:
第一,視覺編碼器(ViT)的激活值分布與語言模型差異極大,直接套用語言模型的量化配置常常出問題。視覺特徵圖中常見局部區域的極端值,需要獨立的縮放策略。
第二,模態對齊層(通常是線性投影或 Q-Former 結構)對量化非常敏感,這一層的精度損失會導致模型「看不見」或「胡說八道」,建議保持 8-bit 以上。
第三,影像 token 數量波動大,從幾十個到數千個不等,這讓記憶體規劃變得複雜。實務上會對視覺 token 做動態裁減,配合量化才能控制峰值記憶體。
2026 年的趨勢是對視覺編碼器使用 INT8,語言解碼器使用 INT4 或 FP4,中間的投影層保持 FP16。這種混合配置在主流工具鏈中已能自動化產生。
七、常見陷阱與除錯清單
以下是終端量化專案中最常見的翻車原因,建議在部署前逐項檢查:
八、2026–2027 展望與結語
站在 2026 年中回看,FP4 與 INT4 的競爭態勢已經逐漸清晰。INT4 憑藉成熟的工具鏈與廣泛的硬體支援,仍是大多數專案的預設選擇;FP4 則在新一代支援原生運算的硬體上展現出更好的精度與吞吐平衡,正逐步往主流移動。可以預期在 2027 年,FP4 系列格式(特別是 NVFP4)在旗艦裝置上的採用率會明顯提升,而 INT4 則會退守到中低階裝置與對相容性要求極高的場景。
剪枝方面,非結構化稀疏在通用硬體上仍然難有實質收益,結構化剪枝與 2:4 稀疏會是務實路線。真正值得關注的是「量化與剪枝的聯合優化」——目前多數團隊還是分兩步走,但隨著編譯器與訓練框架的整合度提高,聯合優化會逐漸降低門檻。
最後要提醒的是,技術選擇永遠要回到場景。一個 1B 模型的 INT4 版本,在延遲與成本上可能完勝 8B 模型的 FP4 版本。與其追逐最新的格式,不如先問清楚:這個裝置的記憶體頻寬是多少?使用者的延遲容忍度是多少?精度損失在哪個任務上會真正造成問題?回答完這三個問題,技術路線自然就清楚了。
終端推論的戰場才剛剛開始。當模型壓縮技術與硬體架構持續共振,我們有理由相信,未來兩年內「裝置端跑大模型」會從技術展示變成理所當然的日常。而在這條路上,FP4 與 INT4 不會是二選一的對立,而是互補的兩把工具——關鍵在於你知不知道什麼時候該拿哪一把。
本文由雅寶社區 · 頂客論壇整理發布,歡迎在討論區分享你的實測數據與踩坑經驗。技術迭代很快,社群共同的實戰記錄,往往比任何一篇論文都更有參考價值。