← 回到 Blog
上週 AI 三連發:哪個更新離你的工作最近?
AI 工具評測·N

上週 AI 三連發:哪個更新離你的工作最近?

7 月 21 日 Gemini 3.6 Flash、7 月 23 日 ChatGPT Voice 進入 Work 與 Codex、7 月 24 日 Claude Opus 5 接連發布。用大量重複、途中改方向、難又長三個工作場景,找出離你最近的工具。

Gemini 3.6 FlashChatGPT VoiceClaude Opus 5AI 工具

上週 AI 三連發:哪個更新離你的工作最近?

打開信箱,一整頁顧客回饋等著分類;另一個工作跑到一半,臨時想到主管版要先看結論;桌邊還有一疊合約和研究資料,讀完後得逐條查漏。

上週四天內,三家公司接連更新:7 月 21 日 Google 發布 Gemini 3.6 Flash;7 月 23 日 OpenAI 把 Voice 帶進 ChatGPT 桌面版的 Work 與 Codex;7 月 24 日 Anthropic 發布 Claude Opus 5。

三則消息看起來都在談「更強的 AI」,實際上靠近的是三種不同工作:大量重複、途中改方向,以及難又長。回到自己的桌面,差異會清楚很多。

7 月 21 日:Google 靠近大量、重複的工作

想像一個常見下午:五百則活動回饋剛匯出,需要先分成抱怨、建議與稱讚,再各寫三種長度的摘要。這類任務的難處通常不在單一問題多深,而在數量多、格式固定、每一輪都要花時間。

Google 對 Gemini 3.6 Flash 的定位,正好貼近這個場景。官方公告指出,依 Artificial Analysis 的測量,它相較 Gemini 3.5 Flash 平均少用 17% 輸出 token,也就是模型產生文字時使用的計量單位;開發者使用時的 API 定價為每百萬輸入 token 1.5 美元、輸出 token 7.5 美元。對大量分類、摘要與多版本改寫來說,速度與用量會直接影響等待時間和成本。

這裡要分清楚另一個數字:官方提到每秒約 350 個輸出 token,指的是同日預覽的 Gemini 3.5 Flash-Lite,不是 Gemini 3.6 Flash。Google 把兩個模型放在同一篇公告裡,但它們解的問題並不相同。

17% 是官方引用的整體測量結果,不能直接換算成每一份繁中工作都會省下相同比例。真正值得觀察的是:當任務可以批次處理時,完成時間、輸出長度和人工修正次數有沒有一起下降。

Google 官方公告:

blog.google
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/

7 月 23 日:OpenAI 靠近工作途中

第二個場景發生在工作已經開始之後。

假設 ChatGPT Work 正在整理一份長報告,跑到一半才想起兩件事:「先不要發出去」和「主管版先放結論」。過去得切回視窗、找到輸入框、打完新指令;現在 OpenAI 讓使用者在 ChatGPT 桌面版以語音啟動工作、詢問進度,也能在執行途中打斷並改方向。

Work 適合研究、文件、試算表、簡報、報告與 Sites 等長工作;Codex 則靠近軟體開發和本機專案。這次更新的意義,在於對話從「下完指令後等待」往工作中的即時協作移動。

這項能力目前針對 macOS 與 Windows 桌面版,Voice 在 Work 與 Codex 裡的用法也不同於一般語音聊天。公司文件、程式碼或內部資料仍要沿用原本的權限與審查流程;說話比較快,不代表可以跳過確認。

看一次官方 Voice 示範

x.com
https://x.com/OpenAI/status/2080378182469857576

OpenAI 更新記錄與 Work/Codex 說明:

help.openai.com
https://help.openai.com/en/articles/6825453-chatgpt-release-notes
help.openai.com
https://help.openai.com/en/articles/20001275-chatgpt-work-and-codex

7 月 24 日:Anthropic 靠近難又長的工作

第三個場景是一疊不能草草讀過的材料:合約、研究報告、訪談逐字稿和既有決策紀錄。問題之間彼此牽動,最後還得檢查引用、例外條款與前後矛盾。

Claude Opus 5 把重心放在這種長時間、高複雜度工作。官方資料列出 100 萬 token 的上下文視窗,也就是一次能帶進模型參考的材料範圍,以及最高 12.8 萬 token 輸出;官方也強調模型會在長工作中持續驗證自己的成果。API 定價維持每百萬輸入 token 5 美元、輸出 token 25 美元,與 Claude Opus 4.8 相同。

Anthropic 把 Opus 5 描述為接近 Claude Fable 5 的能力、價格約為一半。產品層級上,它是 Max 方案的預設模型,也是 Pro 方案中能力最強的選項;Fable 仍是另一個更高階模型。若每天的核心工作只是短摘要,這些能力可能離你很遠;若工作要跨大量材料推理、留下可檢查的長成果,它才會靠近。

Anthropic 官方公告與模型說明:

anthropic.com
https://www.anthropic.com/news/claude-opus-5
platform.claude.com
https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5

把三則新聞放回你的桌上

把手上的任務攤開,先看它屬於哪一種:

  • 大量、重複、對等待與成本敏感:例如批次分類顧客回饋、整理表單、產生多版摘要。Gemini 3.6 Flash 距離較近。
  • 工作已在進行,常臨時補條件或改方向:例如研究跑到一半要先看進度、報告生成途中要換受眾。ChatGPT Voice 搭配 Work 或 Codex 距離較近。
  • 材料很多、推理鏈長,最後還要查漏:例如合約審閱、跨文件研究、長篇規格與程式專案。Claude Opus 5 距離較近。

這是一張工作地圖。相同工具放進不同工作,距離會變;同一個人到了不同專案,也可能需要完全不同的選擇。

明天只做一個三行測試

不用一次搬走整套流程。明天挑一件真的要完成的工作,在開始前寫三行:

  1. 量有多大、重複有多高? 數十到數百筆、格式固定,優先觀察批次速度、用量和人工修正。
  2. 途中改方向的機率有多高? 常追問進度、補限制或切換受眾,優先觀察中途介入是否順手。
  3. 需要讀多深、撐多久、查幾次? 材料彼此牽動且錯誤代價高,優先觀察長上下文、推理一致性與自我檢查。

接著只選離這件工作最近的工具,記下三個結果:等了多久、改了幾次、交接給人之前還漏了什麼。這比同時打開三個模型、丟一道抽象題目更接近你的真實成本。

工具沒有好壞,只有遠近

上週的三連發提醒了我一件事:每次模型更新,最先問「誰贏了」,很容易把自己的工作留在畫面外。

更有用的問題是:它靠近我明天要完成的哪一件事?若答案說不出來,再高的分數也只是遠方的新聞;若剛好貼住一段反覆卡住的流程,一個看似小的更新就可能省下整個下午。

工具沒有好壞,只有遠近。

圖文精簡版

這篇文章也有好讀的社群版本

追蹤 @be.ai.curator

每天分享用 AI 經營公司的實戰筆記