Claude Code 將 Auto mode 設為預設:1,053 人測試攔下 89% 危險指令
重點摘要
Anthropic 將從 August 14, 2026 起,讓 Pro、Max 與 Team 方案的新 Claude Code 工作階段預設使用 Auto mode;測試數據優於人工核准,但研究環境與實際事故率仍有限制。
這項預設值能否降低代理程式造成的損害,可以用上線後的危險指令漏攔率、誤攔率與使用者關閉 Auto mode 的比例檢驗。若 Claude Code 在 August 14, 2026 之後出現更多未經要求的生產環境變更,或團隊因誤攔頻繁改回人工核准,Anthropic 所稱的安全優勢就無法延伸到真實工作。公司目前公布的是受控實驗、經篩選的生產紀錄與紅隊測試,尚未提供所有使用者的事故基準。
Anthropic 在 8 月 7 日宣布,Pro、Max 與 Team 方案的新工作階段將從 August 14, 2026 起預設採用 Auto mode。Claude Code 不再逐項要求人類按下允許,而是把每次工具呼叫交給分類器;分類器會阻擋不可逆、具破壞性或指向使用者環境外部的動作。連續阻擋三次或單一工作階段累計二十次後,系統會退回人工核准。已固定其他預設值的使用者不受影響,Enterprise、Claude API 與雲端平台目前仍須主動開啟。
人工核准的 97% 通過率
Anthropic 找來 1,053 名付費測試者,在特別建立、並非參與者真實專案的環境中執行程式任務。研究人員把一次權限提示替換成明顯危險的指令;人工只攔下 13.6%,Auto mode 則阻擋 89%。工作階段累積超過五十次提示後,人工攔截率由約 17% 降至約 5%,分類器的攔截率維持穩定。公司另稱,Claude Code 使用者會核准 97% 的權限提示,顯示反覆確認可能讓人形成直覺點擊。
這個比較證明分類器在同一組人工設計的危險文字上表現較好,不能直接換算成生產事故減少 75.4 個百分點。測試者知道自己正在參加研究,危險指令不會真的執行,來源也沒有公布參與者的開發經驗分布。Auto mode 仍依賴另一套分類系統;它若誤判新工具、混淆公開與私人目的地,可能放行錯誤動作或中斷正常工作。
生產紀錄只涵蓋被標記的工作階段
Anthropic 檢查 2026 年 5 月至 6 月間、由安全管線標記且帳戶同意資料分析的紀錄。在這個子集中,人工核准模式有 6.3% 的工作階段出現使用者未明確要求、嚴重度達生產環境等級的傷害;Auto mode 為 2.4%。這項結果沒有涵蓋未被管線標記的工作階段,因此只能比較高風險樣本內的比例,不能視為全體 Claude Code 使用者的事故率。
公司與 Apollo Research 的紅隊測試也把分類器在合成攻擊集的漏攔率從 12% 降到 7%,代價是漏掉約 2% 原先能攔下的攻擊。Anthropic 明確提醒,這批攻擊刻意比一般使用情境更惡意,7% 並非真實流量的預估值。硬性拒絕外洩、檢查 Git 狀態及提示注入掃描,則是分類器以外新增的防線。
Auto mode 每次工具呼叫會多用少量 token,Anthropic 表示不向 Pro、Max 與 Team 使用者收取這部分費用。公司也稱採用者提交的 PR 約增加 25%,但沒有公布基準期、樣本數或團隊組成,現有資料無法確認產出差異由 Auto mode 單獨造成。未來三至六個月應追蹤企業預設開啟後的阻擋次數、管理員停用率、誤攔申訴與未經要求的生產變更;缺少這四項分母,89% 仍是一項受控測試結果。
來源: