← 返回文章列表

OpenAI 暫緩 Astra 部分開發:初步測試無法排除 Critical 資安能力

Nils Liu
AI OpenAI Astra Cybersecurity AI Safety 新聞觀察

重點摘要

OpenAI 表示,Astra 的初步評估已強到無法排除 Critical 資安能力,因而暫停不符合加強防護規範的內部工作;公司尚未公布完整分數與發布日期。

OpenAI 暫緩 Astra 部分開發:初步測試無法排除 Critical 資安能力

Astra 是否已跨過可自主攻擊真實系統的能力門檻,不能只靠 OpenAI 給出的「Critical」標籤判定。可驗證的條件是公司公布隔離環境、任務成功率、人工介入程度與重跑結果;若第三方在相同限制下無法重現,這次風險分級就應下修。現有公告沒有完整 benchmark、失敗案例或信賴區間,外界目前只能確認 OpenAI 已提高內部防護,還不能量化模型成功入侵受保護系統的機率。

OpenAI 在 August 7, 2026 表示,仍在開發的 Astra 於代理式程式設計與資安測試中進步明顯。公司稱初步評估的表現足以讓它無法排除「Critical capability level」,因此暫停部分開發活動,並停止所有未符合加強版防護規範的 Astra 內部工作。TechCrunch 同日報導這項決定,並引述官方說法:此等級代表模型可能自行辨識並執行針對傳統上防護良好的真實系統之攻擊。

Critical 門檻啟動額外管制

OpenAI 在 2023 建立 Preparedness Framework,用能力門檻決定模型評估、保護與部署要求。Astra 的判定仍是「無法排除」,並非完成外部驗證後的定論。公司沒有公布受測漏洞類型、目標數量、成功率、測試所需時間或模型獲得的工具權限;缺少這些條件,讀者無法分辨模型是穩定完成多步驟攻擊,或只在少數設計好的任務中得到高分。

公司採取的措施包括更嚴格的存取與資安控制、暫停不符新規範的內部活動,以及讓相關政府機關與選定的 AI 安全組織參與測試。這些動作會降低模型權重、工具與測試紀錄遭濫用的機會,也會拉長評估與開發週期。OpenAI 未說明哪些工作已停止、多少員工仍可接觸 Astra、第三方能否獨立選題,或何時完成審查,因而無法估算延遲成本。

Hugging Face 事件與 Astra 分開計算

OpenAI 特別聲明,Astra 沒有參與先前對 Hugging Face 系統的利用。TechCrunch 指出,那起事件涉及另一個尚未發布的模型;把兩件事混在一起,會把已發生的系統入侵誤算成 Astra 的實績。Astra 目前的證據仍來自初步內部評估,而非公開環境中的已確認攻擊。這個區分也限制了因果判讀:近期多起代理越過測試邊界的事件增加了外部關注,但來源沒有證明它們導致 Astra 的能力提升。

未來三至六個月可檢查三項公開結果:OpenAI 是否提供可重現的任務與分數、外部測試者是否確認 Critical 等級,以及暫停的開發工作是否在新控制下恢復。若公司只公布模型名稱與風險標籤,市場仍無法比較 Astra 的攻擊成功率、防禦效益及延後發布的代價。

來源

訂閱最新分享

加入電子報,第一時間獲取關於金融 AI Agent 實戰與架構設計的最新文章。不訂閱你會慢別人一個週期!

絕不發送垃圾信。隨時皆可取消訂閱。