🎯 什麼情境該想到我
當你想把一個大模型塞進手上的硬體——降精度換記憶體,卻不知道該降到幾位元、選哪種格式、品質會掉多少的時候。
⚙️ 怎麼用(步驟 / 公式)
-
先算記憶體帳。以 70B 模型為例:
格式 每參數位元 需要記憶體 目標硬體 品質損失 FP32 32 ~280 GB 多卡叢集 基準 FP16 16 ~140 GB 高階 GPU 幾乎無 (~0%) INT8 8 ~70 GB 中階 GPU 低 (~1–2%) INT4 (GPTQ) 4 ~35 GB 消費級 GPU 中等 (~3–5%) Q4_K_M (GGUF) ~4.5 ~40 GB 消費級硬體 中等 (~3–5%) INT2 2 ~17 GB 受限裝置 高 (~10–15%) -
沒有獨顯、要在 CPU 上跑 → 選 GGUF + llama.cpp。GGUF 的特點:單一檔案就含模型/tokenizer/詞表/metadata、支援 mmap 快速載入、可對不同層用不同精度。
-
看懂 GGUF 代號(
Q<位元>_<變體>):型別 每權重位元 用途 Q2_K ~2.5 極限壓縮,品質最差 Q4_K_M ~4.5 品質/體積最佳平衡,預設首選 Q5_K_M ~5.5 品質優於 Q4 Q6_K 6.0 接近 FP16 品質 Q8_0 8.0 品質損失極小 -
有 GPU 要跑推論服務 → 走 GPTQ / AWQ / EXL2 這類 GPU 導向格式。
-
理解底層兩種基本做法:
absmax(對稱,scale = max(abs(tensor))/127,簡單快速但怕離群值)與zero-point(非對稱,把完整值域映射到整數範圍,偏斜分布時精度較好)。
🧪 我實際套用的紀錄
- 2026-08-01:從 LLM Course 收錄,尚未實際跑過。
⚠️ 注意 / 什麼時候不適用
- 表中的品質損失是量級參考而非保證值,實際掉多少要用自己的評估集量(見 工具-AI系統評估)。
- 別一路壓到 2-bit 省記憶體,10–15% 的品質損失通常讓模型變得不堪用。
- 量化縮的是模型體積,不會讓生成速度自動變快——那是推論最佳化的工作。
🔗 相關工具
- 工具-LLM推論最佳化 —— 互補面向,量化省記憶體,它省時間,兩者常一起上
- 工具-LLM微調實作路線 —— QLoRA 正是把 4-bit 量化用在訓練階段的產物
- 工具-AI系統評估 —— 量化後掉多少品質,只能靠自己的評估集回答