← 返回文章列表

ChatGPT Work 上線,OpenAI 把 Codex 併進桌面 App 迎戰 Claude Cowork

Nils Liu
OpenAI ChatGPT Work Codex GPT-5.6 Anthropic Claude Cowork AI 代理人 新聞觀察

重點摘要

OpenAI 7 月 9 日推出自主辦公代理人 ChatGPT Work,同時把 Codex 併入新版桌面 App,切成 Chat、Work、Codex 三分頁。這款由 GPT-5.6 驅動的代理人上線時間,剛好卡在 Claude Cowork 擴大到手機和網頁版三天後。

ChatGPT Work 上線,OpenAI 把 Codex 併進桌面 App 迎戰 Claude Cowork

OpenAI 在 7 月 9 日推出 ChatGPT Work,一款把辦公任務直接做成完稿文件的自主代理人,同時把獨立的 Codex App 併進全新的桌面版 ChatGPT,介面切成 Chat、Work、Codex 三個分頁。這款代理人跑在剛發布的 GPT-5.6 模型家族上,主打的賣點是能連續工作數小時,自己拆解任務、串接 Slack、Gmail、Google Calendar 這些企業常用工具,最後直接吐出試算表、簡報、文件甚至一個可互動的網頁應用。它上線的時間點,剛好卡在 Anthropic 把 Claude Cowork 從桌面擴大到手機和網頁版的三天後。

我的判斷是,這波辦公室代理人軍備競賽在未來半年內不會分出勝負。真正的勝負關鍵在於哪家公司先把人在關鍵動作前要不要按核准這道摩擦力降到最低,模型跑分反而是次要因素,同時還得讓使用者信任結果不會出錯。如果你已經在公司內部同時測過 ChatGPT Work 和 Claude Cowork 處理同一批任務,你觀察到的核准頻率和出錯率,跟這個判斷對得上嗎?

事件摘要

ChatGPT Work 現在對 Pro、Enterprise、Edu 方案開放,官方說幾天內會擴大到 Plus 和 Business。免費用戶目前拿不到 Work 分頁,但新版桌面 App 的 Chat 和 Codex 分頁對所有方案開放,包括免費帳號。舊版 ChatGPT 桌面 App 被改名叫 ChatGPT Classic,原本獨立安裝的 Codex App 使用者要自己手動更新到新版整合 App 才能拿到三分頁介面。

驅動這款代理人的是三天前才發布的 GPT-5.6,分成 Sol、Terra、Luna 三層。Sam Altman 在發布時講了一句挺務實的話,每家企業現在都在想 AI 花費跟拿到的價值划不划算。他丟出的數字是 GPT-5.6 在代理人編碼任務上比 GPT-5.5 省下 54% 的代幣,換算下來成本直接砍半以上。

ChatGPT Work 的操作邏輯是先接受一個目標,接著自己去串連使用者授權過的工具,把大任務拆成小步驟逐一執行,遇到敏感動作會停下來要求人工核准。這套先規劃、再執行、關鍵步驟要人點頭的模式,跟 Anthropic 一週前擴大到手機和網頁版的 Claude Cowork 幾乎是同一個劇本,兩家公司的產品說明用詞都圍繞著交付完稿這個概念打轉。

數字背後的真相

先把 54% 這個數字放到秤上秤秤看。這是 OpenAI 拿新模型跟自家上一代 GPT-5.5 比出來的省代幣幅度,比較基準是自己打自己,不是跟 Claude Opus 4.8 或 Gemini 這些對手放在同一批任務上實測。目前沒有第三方跑分機構驗證過這個數字在真實企業工作流程裡站不站得住,這個空白還沒人補上。

從第一性原理往下拆,代幣效率提升這種東西,通常來自訓練或推論端的工程優化,比如減少模型重複思考的冗餘輸出、調整路由策略、壓縮中間推理步驟,不一定代表架構上出現什麼全新突破。省了多少代幣只是表面數字,更值得留意的是 OpenAI 和 Anthropic 在同一週內端出幾乎一樣的產品形態,一個能連續工作數小時、串接企業工具、直接產出成品文件的代理人。這種收斂稱不上巧合,兩家公司都判斷聊天視窗已經榨不出更多成長,下一階段的戰場擺明了是幫使用者把事情做完。

換算一下規模感。假設一家中型企業每月跑 3,000 個代理人任務,每個任務平均消耗 5 萬輸出代幣,用 GPT-5.5 舊代算,成本大約是 3,000 乘 50,000 乘 30 美元除以 100 萬,等於 4,500 美元。如果 54% 的省代幣宣稱成立,同樣任務量在 GPT-5.6 上大概只要 2,070 美元,一年下來省將近 3 萬美元。這個數字看起來很吸引人,但企業真正在意的往往是任務完成率,代幣單價只是次要考量。一個代理人省了代幣卻常常做錯事、需要重跑,實際成本反而更高,這部分目前沒有任何獨立數據可以佐證。

工程師視角還有一個值得注意的細節。ChatGPT Work 標榜能連續工作數小時、獨立完成專案,但官方文件同時寫明遇到敏感動作會先停下來要求人工核准,離真正的全自動還有一段距離。交付完稿這個行銷詞背後,藏著一套人在關鍵節點持續介入的半自動流程。把 Codex 併進 ChatGPT 桌面 App,某種程度上也是 OpenAI 在收斂自己散落各處的產品線。過去 Codex CLI、Codex App、ChatGPT 各自為政,現在統一成 Chat、Work、Codex 三個分頁,這對開發維護成本是好事,但也代表使用者要重新適應一套介面邏輯。

接下來值得觀察的指標

三個指標會在接下來三到六個月給出答案。第一,是否有獨立機構拿 ChatGPT Work 和 Claude Cowork 跑同一批企業任務,量出真實的任務完成率和平均省代幣幅度,而不是各自引用自家數字。第二,Google 和 Microsoft 是否會在這波辦公室代理人浪潮裡端出對應產品,如果三個月內沒有動靜,代表這兩家判斷企業客戶還沒準備好把工作流程交給自主代理人。第三,ChatGPT Work 從 Pro、Enterprise、Edu 擴大到 Plus、Business 之後,付費轉換率和實際使用頻率會不會撐得住,這個數字比任何跑分都更誠實地反映企業到底買不買單。

另外值得盯著的是敏感動作的核准頻率。如果 OpenAI 或 Anthropic 未來悄悄放寬需要人工核准的門檻,代表信任度累積得比預期快,這件事會比任何一次模型升級都更值得關注。

如果這篇對你有幫助,訂閱電子報 可以第一時間收到 AI PM 實戰洞察與 GenAI 落地案例。

參考來源:MacRumorsForbes


相關閱讀:

訂閱最新分享

加入電子報,第一時間獲取關於金融 AI Agent 實戰與架構設計的最新文章。不訂閱你會慢別人一個週期!

絕不發送垃圾信。隨時皆可取消訂閱。