Grok 4.7 開放長時間代理:自我檢查仍需要外部驗收
重點摘要
SpaceXAI 發表 Grok 4.7,開放 API、Cursor 與逐步推出的 GitHub Copilot 支援。更長的推理與自查能否改善交付,取決於模型是否保留原本需求,以及誰決定工作已完成。
Grok 4.7 已進入 Cursor 與 API,主打讓代理持續處理更長的工作。這項升級有一個需要外部資料檢驗的假設:多花時間自查,應能減少交付時遺漏的需求。若工程師仍須逐項補回原本要求,代理跑得更久就沒有改善這部分品質。官方發布 Cursor 公告
SpaceXAI 公告的事件日期是 2026-09-21,沒有提供發布時刻或時區。本篇採台北 9 月 22 日出刊,查核截止為 12:53;回報的是仍在 48 小時範圍內的前一日發布。Neowin 刊於 21 日 13:40 EDT,即台北 22 日 01:40,這個時間只能確認報導已出現,不能充當模型啟用時刻。發布日期 獨立報導
公司表示,Grok 4.7 採用更大的預訓練模型,並加強長時間代理工作的強化學習。訓練偏重需要數小時完成的任務,官方宣稱模型更會檢查自己的工作,也更能管理長上下文。這些是廠商對訓練與能力的說明,尚不能代替一般專案的驗收結果。訓練與能力說明
API 文件列出 500,000 token 上下文;提示少於 200,000 token 的標準請求,每百萬未快取輸入與輸出 token 分別為 2 與 6 美元。提示達到門檻時,整筆請求改按 4 與 12 美元計價。長任務若累積大量資料,預算便不能只按較低單價估算;上下文容量也不保證模型始終記住每項限制。API 規格 計價規則
Cursor 已加入模型選項,並公布 CursorBench 4.0 成績:Grok 4.7 的 xhigh 設定為 46.3%,Grok 4.6 的 high 設定為 40.4%。兩者推理設定不同,這組數字不能單獨證明相同運算投入下改善多少。GitHub 也宣布逐步開放 Copilot 支援;有公告不代表每個帳號當下都能選用。Cursor 測試 設定比較 Copilot 推出範圍
把完成條件留在代理之外
我會把這種長時間能力用在需要反覆追查相依關係的修改,例如一項介面變更牽動多個模組。若只修一處明確錯字,增加推理時間未必有相同收益。這個選擇依賴任務是否需要多次查找與修正,不能只按模型排名決定。
假設團隊要求更新登入流程,同時保留舊版客戶端支援。代理可能完成新流程,卻漏掉相容性要求。產品若只顯示代理自己的「已完成」,工程師便得重新找出哪些承諾沒有被檢查。我會讓工具保留原始要求,並把每項要求對應到實際修改與測試結果;沒有證據的部分應保持未確認。
自查可以幫助代理找錯,驗收條件則需要在執行前固定。若代理認為測試過時,應提出修改理由,讓人決定是否接受,不能讓它自行放寬條件後再宣告通過。這是依長任務能力提出的產品設計判斷,沒有把假設情境當成已發生的事故。
這次發布已提供可使用的模型與工具入口,但現有資料沒有給出一般團隊的修改採用率。後續能檢驗上述假設的資料,是原始要求未變動時,有多少修改一次通過既定測試,又有多少因漏掉要求而被退回。若自查後的結果仍經常漏項,延長代理執行時間就需要重新評估。
封面沿用本站 Cursor 與 SpaceX 品牌圖,並非本次模型的效能圖;官方發布圖片因網路名稱解析失敗而未能下載。
來源: