🎯 什麼情境該想到我

當你「改了 prompt/模型/RAG,卻不知道到底變好還變壞」——這是 AI 工程最核心也最被低估的能力。

⚙️ 怎麼用

  1. 先建一組評估集:代表性的輸入 + 你要的判準(正確性、相關性、格式、無害…)。
  2. 選評估方法
    • 有標準答案 → 用自動指標(精確比對、相似度)。
    • 開放式輸出LLM-as-judge(用另一個模型當評審)+ 人工抽檢校準。
  3. 每次改動都跑同一評估集,比較分數再決定要不要採用(別憑一兩個例子的感覺)。
  4. 上線後持續監控:抽樣真實流量做線上評估,抓退化。

🧪 我實際套用的紀錄

  • 2026-07-15:(待填)

⚠️ 注意

  • LLM-as-judge 本身也有偏誤,要用人工樣本校準它;沒有評估的迭代=盲調。

🔗 相關工具