# 15 分鐘 AI 指令消融測試卡

這不是「刪光設定」清單。它是一個低風險、可回復的 A/B，用來找出哪些常駐指令真的必要。

## 開始前

- [ ] 選一個低風險、可重跑的日常任務。
- [ ] 寫下可檢查的正確答案、必要欄位或完成樣本。
- [ ] 備份現有 CLAUDE.md、skills、hooks。
- [ ] 保留安全、權限、法遵與不可逆操作閘門。
- [ ] 不用客戶資料、機密資料、付款、發布或正式環境做第一次測試。

## A 組｜現有設定

用原本的全部規則跑一次，記錄：

| 指標 | 結果 |
|---|---|
| 正確項目 | |
| 遺漏項目 | |
| 需要人工修正 | |
| 完成時間 | |
| 是否能自行驗證 | |

## B 組｜最小任務合約

把以下模板貼給 AI：

```text
任務：［要完成的成果］

必要脈絡：［只有這次任務需要知道的事實］

護欄：
- ［不能碰的資料、系統或行為］
- 不確定時標成假設，不自行補成事實

完成條件：
- ［可檢查的欄位、格式或品質標準］

驗證方式：
- ［測試、比對、截圖、來源或預期輸出］
- 交付前自行檢查並列出未通過項目
```

用相同指標記錄 B 組。

## 只加回有證據的規則

只有在同一錯誤至少重複兩次，而且 verifier 不能直接抓到時，才考慮把一條規則加回常駐設定。

每條規則旁邊寫：

```text
規則：
來源失敗：
重現日期：
為何不能改成測試／hook／path-scoped rule：
下次重測日期：
```

## 判讀

- B 更快且同樣準：舊規則可能可以移除或改成按需載入。
- B 更快但較不準：只加回對應失敗的最小規則或 verifier。
- A 明顯較好：保留規則，但把理由與重測日期寫清楚。
- 兩組都差：先改善任務、資料與驗證方法，不要繼續堆常駐指令。

建議每次主要模型換代、或每六個月重跑一次。
