Claude Opus 5.5 上線:長任務的進度不能只靠文字串流
重點摘要
Anthropic 推出 Opus 5.5,降低 token 單價並主打長時間代理工作。但模型預設不再於工具呼叫之間顯示中間文字,沿用舊介面的產品需要重新處理進度與取消操作。
Claude Opus 5.5 上線後,沿用舊串流介面的代理可能在工具呼叫之間不再顯示文字。Anthropic 文件已列出這項預設行為:模型仍可執行工作,使用者卻少了一種判斷進度的依據。若產品只靠模型的中間說明維持等待,升級後能否讓人分辨「正在執行」與「已經停住」,就需要重新檢驗。行為說明
官方事件日期為 2026-09-22,公告沒有提供發布時刻與時區。MacRumors 刊於當日 12:23 PDT,換算台北是 9 月 23 日 03:23。本篇採台北 23 日出刊,查核截止為 21:00;引用的是隔夜發布,沒有把報導時間當成模型啟用時間。發布公告 獨立報導
Opus 5.5 主打程式開發、電腦操作及長時間代理工作。Anthropic 列出一名測試者的案例,稱其在不到一天內完成 680,000 行程式碼的遷移。這提供了具體任務規模,但仍是廠商展示,不能據此推算一般團隊的交付速度,也沒有證明各種專案都能無人處理。案例
標準 API 每百萬輸入與輸出 token 分別為 4 與 20 美元,較 Opus 5 各低 20%。單價下降可降低相同用量的費用,實際任務若改變推理長度或工具呼叫次數,帳單仍會不同。AWS 也宣布模型已進入 Amazon Bedrock;這是可使用的服務,不能把供應商列出模型理解成每個區域都有相同容量。價格與升級差異 雲端供應
工具在執行,畫面不能只等文字
Opus 5.5 採自適應推理,讓模型決定推理投入。工具呼叫之間的更新改由 thinking 區塊傳回,預設文字為空。官方提供 display: "updates" 測試選項或 "summarized" 取回內容,介面也須讀取這些區塊。過去把一般文字串流當作進度條的產品,換模型名稱後可能仍能執行,卻無法沿用原本的等待體驗。模型行為 遷移說明
我較重視這個介面變更,因為長任務要求使用者容許更多暫時看不到結果的時間。假設代理正在修改多個模組,畫面持續空白,使用者可能重送指令或重新啟動工作。這是假設的操作風險,現有來源沒有提供實際發生率;但若產品不能分辨執行中與連線失敗,就會把判斷責任留給看不到工具狀態的人。
我會讓介面顯示目前的工具動作,以及最後一項已確認完成的檢查,並保留可理解的取消操作。這些資訊應取自實際執行紀錄,不能由模型補寫一段「正在努力」充當進度。若工具仍未回報,就顯示等待回覆;若連線中斷,就標出未知狀態。這是依模型行為提出的產品設計選擇,不是官方已經替所有應用提供的功能。
同時,產品不應把每一次工具動作都通知使用者。短任務可以直接交付結果;需要等待的工作,才顯示足以決定繼續、取消或稍後返回的狀態。暴露大量技術紀錄會增加閱讀負擔,讓使用者看懂目前能做什麼,比重現模型每一步文字更有用途。
這次發布讓開發者取得更便宜的模型與新的長任務能力主張,尚未提供介面改版後的使用者研究。若能觀察到因進度不明而重啟的次數減少,同時未增加把失敗誤顯示為執行中的情況,才有依據說明新版介面改善了等待體驗。模型能持續工作多久,與人能否放心讓它繼續工作,需要不同的證據。
封面沿用本站 Claude Opus 5 品牌圖,並非 Opus 5.5 的效能圖;本次外部圖片下載因名稱解析失敗而未完成。
來源: