🎯 什麼情境該想到我
當你的模型已經做完 SFT、會照指令回答了,但回答的語氣、有用程度、安全性還不到位,想用人類偏好把它調到位的時候。
⚙️ 怎麼用(步驟 / 公式)
-
確認位置:偏好對齊是後訓練的第二階段,前面必須先有 SFT 模型(見 工具-LLM微調實作路線)。它原本用來調語氣、降毒性、減幻覺,現在也被用來大幅提升推理任務表現。
-
依算力與目標選演算法:
方法 算力成本 最適合 需要獎勵模型 DPO Direct Preference Optimization 低—中 聊天模型、一般對齊 否 ORPO Odds Ratio Preference Optimization 低 單階段對齊(SFT 與對齊合併) 否 GRPO Group Relative Policy Optimization 中—高 推理型模型 否(改用獎勵函式) PPO Proximal Policy Optimization 高 複雜推理任務 是 -
算力有限就走直接最佳化路線(DPO / ORPO):訓練循環快、不必額外訓一個獎勵模型。
-
要衝推理品質才考慮 RL 路線(GRPO / PPO):彈性更大、天花板更高,但成本與不穩定性也高。
-
用拒絕採樣(Rejection Sampling)產生 on-policy 偏好資料:讓「正在訓練的那個模型」對每個 prompt 生成多個候選,再挑出好壞配對。好處是 chosen 與 rejected 都來自模型當前的分布:
面向 On-policy(拒絕採樣) Off-policy(現成資料集) 分布吻合 反映模型當前行為 可能與現在的輸出對不上 訓練穩定性 較穩 容易分布偏移
🧪 我實際套用的紀錄
- 2026-08-01:從 LLM Course 收錄,尚未實際跑過。
⚠️ 注意 / 什麼時候不適用
- 順序不能顛倒:沒做過 SFT 就直接對齊,等於在還不會聽指令的模型上調語氣。
- PPO 需要另外訓練並維護獎勵模型,工程複雜度是 DPO 的數倍,沒有明確理由不要一開始就選它。
- 偏好資料的品質決定上限,配對標得含糊,演算法再高級也救不回來。
🔗 相關工具
- 工具-LLM微調實作路線 —— 前一階段,必須先有 SFT 模型才談得上對齊
- 工具-AI系統評估 —— 驗收關卡,對齊有沒有真的變好只能靠評估集說話
- 工具-LLM安全防護 —— 目標重疊,降低有害輸出既是對齊目標也是安全防線的一環