🎯 什麼情境該想到我
當你「改了 prompt/模型/RAG,卻不知道到底變好還變壞」——這是 AI 工程最核心也最被低估的能力。
⚙️ 怎麼用
- 先建一組評估集:代表性的輸入 + 你要的判準(正確性、相關性、格式、無害…)。
- 選評估方法:
- 有標準答案 → 用自動指標(精確比對、相似度)。
- 開放式輸出 → LLM-as-judge(用另一個模型當評審)+ 人工抽檢校準。
- 每次改動都跑同一評估集,比較分數再決定要不要採用(別憑一兩個例子的感覺)。
- 上線後持續監控:抽樣真實流量做線上評估,抓退化。
🧪 我實際套用的紀錄
- 2026-07-15:(待填)
⚠️ 注意
- LLM-as-judge 本身也有偏誤,要用人工樣本校準它;沒有評估的迭代=盲調。
🔗 相關工具
- 工具-提示工程 —— 評估發現品質不佳時,這是成本最低的第一個調整手段,先試它再考慮更貴的路
- 工具-RAG檢索增強生成 —— 評估若指出問題是「缺知識/講錯事實」,正解是接 RAG 而不是調 prompt
- 工具-微調與RAG的取捨 —— 微調的硬前提就是這張卡:沒有可靠評估集,微調完也無法證明真的變好
- 工具-LLM微調實作路線 —— 微調後有沒有變好,只能靠這裡的評估集回答,不能靠感覺
- 工具-偏好對齊方法選擇 —— 對齊調的是語氣與有用程度,最需要評估集把「主觀變好」變成可驗收的數字
- 工具-模型量化格式選擇 —— 量化號稱只掉 3–5%,實際掉多少要用自己的評估集量過才算數