AI 說「完成了」,但它真的做完了嗎?用三樣證據分辨
「完成!都處理好了。」
這句話你這週大概看過好幾次。問題是,你會點開檢查嗎?
我踩過太多次,多到後來乾脆開始記錄:
- 它說「檔案都幫你改好了」,打開一看,一個字都沒動。
- 它說「測試全部通過」,那個測試根本沒跑起來。
- 它說「查證完畢,附上來源」,點進去是 404。
截至 2026 年七月下旬,這種「說做完了、其實沒驗證」的情況累積被抓到 167 次。而且換上最新一代的模型之後,七月下旬那一週還是有 10 次。
這篇講三件事:為什麼模型越強、這件事反而越隱形;怎麼用三樣證據分辨真假完成;以及一句話就能加進你自訂指令的驗收規則。
它不是想騙你
先說一個容易誤會的地方:AI 回報「完成了」的時候,通常不是在說謊。
它是真心覺得「應該沒問題」——計畫寫得很完整、每個步驟看起來都對,於是就把「打算做的」當成「已經做的」。
麻煩的是後面這句:模型越聰明,這個「應該」講得越有條理,你越不會想去點開檢查。
弱模型講話結結巴巴,你自然會多看兩眼;強模型交出一份條理分明、語氣篤定的回報,你反而放心了。這就是為什麼模型越強,假完成越隱形——不是它變得更會騙人,是你變得更容易相信。
我自己的分界線後來變得很簡單:聽起來越完美,越要抽一個地方點開看。
完成分兩種

把這件事講清楚,其實只要一個分法:
講出來的完成,聽起來都一樣:「好了」「處理完畢」「已全部更新」。你分不出哪個是真的。
證明出來的完成,會附三樣東西:
- 它實際做了哪些動作 —— 動了哪個檔案、跑了什麼指令、查了哪個網頁。
- 結果原封不動貼出來 —— 把實際跑出來的東西貼給你看,而「執行成功」四個字不算。
- 你可以怎麼自己再確認一次 —— 一個你能點、能跑、能看的方法。
三樣缺一,就先當作還沒做完。
這麼做的意思,是把「相信」換成「可以查證」。你不用每次都真的去查,但你要隨時能查——這兩者差很多。
一句話,加進你的指令
方法很簡單:不要每次口頭提醒,直接寫進那份 AI 每次開工都會讀的指示裡。ChatGPT 叫自訂指令、Claude 叫專案指示,用 Claude Code 的話就是 CLAUDE.md。
貼這一句就好:
宣告任何工作完成之前,先附上:你實際執行了什麼、原始結果、以及我可以怎麼自己驗證。沒有驗證過的部分,直接說沒驗證。

它擋不掉所有問題,但會把「應該沒問題」,變成「這是證據,你自己看」。
有意思的是,這條規則和上一波的規則瘦身潮並不衝突。Anthropic 上週那篇改寫規則的官方文章也指到同一個方向:與其把規格寫得更細,不如給它一個可以對答案的標準。
我自己整理規則檔的時候,教它做事的規則刪掉一大堆都沒事——唯獨這條不敢動。因為紀錄顯示,它到今天都還在抓到新的假完成。
什麼時候可以放鬆一點
也不用每件事都這麼緊。判斷方法是問一句:做錯了,我多久會發現?
- 馬上會發現的(改一段文字、換個排版、回答一個你本來就懂的問題):不用查,錯了你當場就看到。
- 要過一陣子才會發現的(設定、排程、資料整理、外部查證):一定要證據。這類最容易被「都設好了」四個字帶過去,然後幾週後才爆。
我自己最慘的一次就屬於後者:它說幾個自動提醒「都設好了」,我兩個月後才發現接錯了地方,從頭到尾一次都沒有生效過。
我把這套判斷整理成一頁可以帶走的AI 交付驗收卡,包含三樣證據清單、五種常見假完成的識別方式,和上面那句可以直接複製的規則。
結尾
AI 越來越會做事,也越來越會描述自己做了事。這兩件事進步的速度不一樣,中間的落差就是你要顧的地方。
你上一次點開檢查,是什麼時候?
來源
- 官方文章:The new rules of context engineering for Claude 5 generation models(Anthropic、2026-07-24)
- 文中的 167 次與最近一週 10 次,為我自己工作紀錄在 2026 年 7 月的實際統計
