🎯 什麼情境該想到我

當你想把一個大模型塞進手上的硬體——降精度換記憶體,卻不知道該降到幾位元、選哪種格式、品質會掉多少的時候。

⚙️ 怎麼用(步驟 / 公式)

  1. 先算記憶體帳。以 70B 模型為例:

    格式每參數位元需要記憶體目標硬體品質損失
    FP3232~280 GB多卡叢集基準
    FP1616~140 GB高階 GPU幾乎無 (~0%)
    INT88~70 GB中階 GPU低 (~1–2%)
    INT4 (GPTQ)4~35 GB消費級 GPU中等 (~3–5%)
    Q4_K_M (GGUF)~4.5~40 GB消費級硬體中等 (~3–5%)
    INT22~17 GB受限裝置高 (~10–15%)
  2. 沒有獨顯、要在 CPU 上跑 → 選 GGUF + llama.cpp。GGUF 的特點:單一檔案就含模型/tokenizer/詞表/metadata、支援 mmap 快速載入、可對不同層用不同精度。

  3. 看懂 GGUF 代號Q<位元>_<變體>):

    型別每權重位元用途
    Q2_K~2.5極限壓縮,品質最差
    Q4_K_M~4.5品質/體積最佳平衡,預設首選
    Q5_K_M~5.5品質優於 Q4
    Q6_K6.0接近 FP16 品質
    Q8_08.0品質損失極小
  4. 有 GPU 要跑推論服務 → 走 GPTQ / AWQ / EXL2 這類 GPU 導向格式。

  5. 理解底層兩種基本做法absmax(對稱,scale = max(abs(tensor))/127,簡單快速但怕離群值)與 zero-point(非對稱,把完整值域映射到整數範圍,偏斜分布時精度較好)。

🧪 我實際套用的紀錄

  • 2026-08-01:從 LLM Course 收錄,尚未實際跑過。

⚠️ 注意 / 什麼時候不適用

  • 表中的品質損失是量級參考而非保證值,實際掉多少要用自己的評估集量(見 工具-AI系統評估)。
  • 別一路壓到 2-bit 省記憶體,10–15% 的品質損失通常讓模型變得不堪用。
  • 量化縮的是模型體積,不會讓生成速度自動變快——那是推論最佳化的工作。

🔗 相關工具