🎯 什麼情境該想到我
當你發現「這段指示我每次開新對話都要再打一遍」的時候——那就是該把它包成 skill 的訊號。
⚙️ 怎麼用(步驟 / 公式)
- 判斷值不值得包:判準只有一條——你是不是一直在重下同一種 prompt。是就包,skill 只是一個
SKILL.md,沒有特殊格式或 schema,成本很低。 - 寫起始 prompt 給 skill-creator(Claude Code 內建)。不要描述你要的輸出,要給這兩樣:
- 變數有哪些維度——例如 eli5 給的是「聽眾」的四個維度:年齡/學程/職務/關係。
- 幾句真實的觸發例句——例如「ELI5 什麼是 database index」「解釋這個給我主管聽」。
維度與例句給足,草稿的品質就決定了大半。
- 審它提的測試案例:skill-creator 會提幾題,跑之前先改成真正涵蓋不同維度的題目(不同對象 × 不同素材類型)。這步別跳。
- 跑對照評測收尾:帶 skill vs 不帶 skill 各跑一輪比較——細節見 工具-AI改動的AB對照評測。
- 把 eval 腳本留在本地:之後每改一次
SKILL.md就重跑一次比較,不用每次都走完整 skill-creator 流程。沒有這步就迭代不動。
🧪 我實際套用的紀錄
- 2026-08-23:(待填)
⚠️ 注意 / 什麼時候不適用
- 只用一次的東西不要包。判準是「重複」,不是「複雜」——複雜但只做一次的事,直接下 prompt 就好。
- skill-creator 的初次評測是人工評分,跟你之後本地跑的 auto-grader 結果會不一樣(原作者實測兩者對「超過字數」與「類比夠不夠白話」的鬆緊剛好相反)。別把兩份數字混著比。
- 測到的是內容、不是觸發:評測是把 skill 內容直接餵進 prompt 跑的,
description的觸發詞寫得好不好沒被測到——而那是實際使用時最常失敗的一環,要自己另外試。
🔗 相關工具
- 工具-AI改動的AB對照評測 —— 這張講「怎麼做出來」,那張講「怎麼證明做出來的真的有用」,是同一條流程的前後段
- 工具-提示工程 —— skill 本質就是把調好的 prompt 固定下來;prompt 還沒調到穩就急著包成 skill,只是把不穩定固定住