← 回到 Blog
模型升級後,80% 的 skills 都可以刪掉?Boris 真正教的是怎麼測
疑難排解·N

模型升級後,80% 的 skills 都可以刪掉?Boris 真正教的是怎麼測

Claude Code 為 Opus 5 拿掉約八成 system prompt,但這不等於每個人都該照比例刪 skills。這篇用白話分類、同題 A/B、四個驗收指標與一段可直接貼給 AI 的 prompt,判斷哪些規則先留、哪些值得測。

Claude Code提示詞AI 工作流

模型升級後,80% 的 skills 都可以刪掉?Boris 真正教的是怎麼測

先講結論:不要打開 CLAUDE.md 就直接刪掉八成。

Boris Cherny 分享的 80%,是 Claude Code 團隊換上 Opus 5 後,從自家 system prompt 拿掉的比例。這是一個團隊在特定產品、特定模型上的結果,不是每個人都能照抄的答案。

真正值得學的是他們怎麼得到答案:先把舊提示拿掉,用真實任務測,再把確實有幫助的規則一條條加回。

如果你只想知道今天怎麼做,先看這四步:

  1. 把規則分成「先保留」與「優先測試」。
  2. 選一個低風險任務,同一題跑 A/B 兩次。
  3. 比正確、遺漏、返工、時間。
  4. 同一錯誤反覆出現,才加回最小規則。

後面再補 Boris 的原話、為什麼規則會過期,以及一段可以直接貼給 AI 的檢查 prompt。

為什麼規則會從幫忙變成限制

CLAUDE.md 或 skills 長胖的過程通常很合理:AI 做錯一次,你就補一條。

「先做 A,再做 B。」

「一定要照這個格式。」

「開始前先把全部舊資料讀完。」

當時模型不會,這些提醒有用。半年後模型換代,能力已經補上,舊規則仍然每次載入。結果可能出現三種成本:做法被鎖在舊路徑、不同年代的提醒互相衝突、每個任務都得先讀完無關背景。

規則不是寫錯了,只是有效期限到了。

Boris 真正說的是什麼

這個題目最早是從 Nate Herk 的影片看到的。他把標題下成「我刪掉所有 Claude skills,結果 Claude 變聰明」。這句很吸睛,也很容易讓人誤會成「skills 越少越好」,所以我回到 Y Combinator 對 Boris Cherny 的完整訪談。

Boris 說,Claude Code 為 Opus 5 拿掉約 80% system prompt。那些提示有不少是在修正舊模型做不到的行為。新模型已經會了,舊提醒繼續常駐,可能只剩下干擾。

主持人接著把方法概括成「刪掉整個 codebase 和 prompt,從零開始」。Boris 馬上修正:不是刪整個 codebase。團隊先拿掉 system prompt,再逐條加回,量測每一條的實際影響。

所以這個數字要讀成:Claude Code 團隊在這次測試裡,八成舊提示沒有重新證明必要。 不是「你的 skills 也一律刪八成」。

第一步:先分成兩類

第一次整理時,不需要逐條做艱深判斷。先分成「先保留」與「優先測試」就好。

先保留

  • 安全、權限、隱私與法遵
  • 刪除、付款、發布等不可逆操作
  • 模型自己不可能知道的公司或專案事實
  • 沒遵守就會造成真實事故的底線

這些規則的價值是防止損失,不適合拿正式環境來裸考。

優先測試

  • 把每一步做法寫死的教學
  • 同一件事重複提醒好幾次
  • 只為舊模型能力不足而加的補丁
  • 過度固定、其實不影響成果的格式範本

這些規則比較可能限制路徑,而且可以用低風險任務驗證。

第二步:同一個任務跑兩次

找一個低風險、答案可檢查的日常工作,例如整理公開文件、把既有資料填進固定欄位,或核對一段文字的來源。

A 組照原設定跑。B 組只關掉 1–3 條候選規則。兩組使用同一份輸入、同一個完成條件,不要同時改模型、資料與工具。

最後只比四件事:

  • 正確:關鍵答案有沒有做對?
  • 遺漏:必要欄位有沒有少?
  • 返工:你要補多少人工修正?
  • 時間:完成相同成果用了多久?

B 組同樣準、遺漏與返工沒有增加,而且更省事,才有理由刪掉或改成需要時載入。只失敗一次,先再測;相同錯誤反覆出現,再加回最小規則。

不知道先測哪條?把這段貼給 AI

請逐條檢查我目前的 CLAUDE.md/skills。

1. 先把每條規則分成:
   - 安全、權限、隱私或不可逆操作
   - 模型不可能自行知道的必要事實
   - 輸出格式或風格偏好
   - 逐步教學、重複提醒或舊模型補丁
2. 不要直接修改任何檔案。
3. 從後兩類挑出 3 條低風險刪除候選,說明理由與最壞風險。
4. 為每條候選設計同一個任務的 A/B 測試,列出固定輸入、完成條件與驗收方式。
5. 只有 B 組出現相同錯誤兩次,才建議加回最小規則。

輸出表格:規則|分類|候選理由|風險|測試任務|驗收標準

這段 prompt 有一個重要限制:它只產生候選與測法,不准 AI 直接替你大掃除。最後要不要刪,仍然看 A/B 結果。

我自己跑一次,才發現不能只看快不快

我用同一份輪播任務跑 A/B:A 組帶完整專案規則,B 組只帶任務、護欄與完成條件。

B 組比較快交稿,但也把一個合理推論寫得像 Boris 親口說的。這表示「更快」不等於「更好」;來源精度仍然要驗收。

所以我沒有把所有舊規則搬回來,只保留能防住這個錯誤的最小要求:一手來源沒明講的內容,要標成推論。

三種結果,三種處理

B 組同樣準,而且更省事

刪掉那條規則,或改成只在特定路徑、特定 skill 需要時載入。

B 組只失敗一次

先再測。一次偶發錯誤不足以證明每個 session 都需要多讀一條規則。

B 組反覆出現相同錯誤

先看測試或 verifier 能不能直接抓到;不行,再加回能防住這個失敗的最小規則。規則旁邊記下失敗案例與下次重測日期。

最後的心法

規則不是收藏品,也不是刪除競賽。

模型每次換代,舊規則都值得重新考一次。保留安全邊界和必要事實;把教模型怎麼走路的舊步驟拿去做低風險 A/B;看結果,而不是看檔案少了幾行。

我把完整記錄表整理成15 分鐘 AI 指令消融測試卡

最終不是刪得越多越好,是每一條常駐規則都說得出:它在防哪一個真的發生過的失敗。

來源與查核日期

資料最後查核:2026-08-13(Asia/Taipei)。模型能力與 Claude Code 文件會持續更新,執行前請以官方最新文件與自己的低風險實測為準。

15 分鐘 AI 指令消融測試卡

用低風險 A/B 找出哪些 CLAUDE.md、skills 與 hooks 真的必要。含最小任務合約、A/B 記錄表、規則加回證據欄與判讀方式。

  • 開始前安全檢查:備份設定、保留權限與不可逆操作閘門
  • A 組/B 組的正確、遺漏、返工、時間記錄表
  • 可直接貼給 AI 的繁中最小任務合約
  • 只有重複失敗才加回規則的證據模板
  • 四種結果的判讀與下一步
打開步驟與可複製內容
不必先下載,網站會直接排版。下載 .md
文章識別字:delete-ai-instructions-ablation

這類的整理,每個月一封

把當月真正值得動手的那幾件事挑出來、寫成可以照做的樣子。隨時可退訂。

送出即表示同意我們用這個信箱寄送電子報。我們只會用它寄信,不會給第三方。 你可以隨時退訂或要求刪除,詳見隱私權政策

圖文精簡版

這篇文章也有好讀的社群版本

追蹤 @be.ai.curator

每天分享用 AI 經營公司的實戰筆記