🎯 什麼情境該想到我

當你發現「這段指示我每次開新對話都要再打一遍」的時候——那就是該把它包成 skill 的訊號。

⚙️ 怎麼用(步驟 / 公式)

  1. 判斷值不值得包:判準只有一條——你是不是一直在重下同一種 prompt。是就包,skill 只是一個 SKILL.md,沒有特殊格式或 schema,成本很低。
  2. 寫起始 prompt 給 skill-creator(Claude Code 內建)。不要描述你要的輸出,要給這兩樣:
    • 變數有哪些維度——例如 eli5 給的是「聽眾」的四個維度:年齡/學程/職務/關係。
    • 幾句真實的觸發例句——例如「ELI5 什麼是 database index」「解釋這個給我主管聽」。
      維度與例句給足,草稿的品質就決定了大半。
  3. 審它提的測試案例:skill-creator 會提幾題,跑之前先改成真正涵蓋不同維度的題目(不同對象 × 不同素材類型)。這步別跳。
  4. 跑對照評測收尾:帶 skill vs 不帶 skill 各跑一輪比較——細節見 工具-AI改動的AB對照評測
  5. 把 eval 腳本留在本地:之後每改一次 SKILL.md 就重跑一次比較,不用每次都走完整 skill-creator 流程。沒有這步就迭代不動。

🧪 我實際套用的紀錄

  • 2026-08-23:(待填)

⚠️ 注意 / 什麼時候不適用

  • 只用一次的東西不要包。判準是「重複」,不是「複雜」——複雜但只做一次的事,直接下 prompt 就好。
  • skill-creator 的初次評測是人工評分,跟你之後本地跑的 auto-grader 結果會不一樣(原作者實測兩者對「超過字數」與「類比夠不夠白話」的鬆緊剛好相反)。別把兩份數字混著比。
  • 測到的是內容、不是觸發:評測是把 skill 內容直接餵進 prompt 跑的,description 的觸發詞寫得好不好沒被測到——而那是實際使用時最常失敗的一環,要自己另外試。

🔗 相關工具

  • 工具-AI改動的AB對照評測 —— 這張講「怎麼做出來」,那張講「怎麼證明做出來的真的有用」,是同一條流程的前後段
  • 工具-提示工程 —— skill 本質就是把調好的 prompt 固定下來;prompt 還沒調到穩就急著包成 skill,只是把不穩定固定住