← 返回文章列表

Grok 4.5 用四分之一價格對打 Opus 4.8,這場價格戰誰先扛不住

Nils Liu
xAI SpaceXAI Grok 4.5 Anthropic Cursor AI 定價 AI 模型 新聞觀察

重點摘要

SpaceXAI 的 Grok 4.5 以每百萬輸出代幣 6 美元上線,只有 Opus 4.8 的四分之一價,還宣稱省 4.2 倍代幣。跑分各有輸贏,但這場價格戰的算法比較有意思。

Grok 4.5 用四分之一價格對打 Opus 4.8,這場價格戰誰先扛不住

Grok 4.5 今天全面開放,每百萬輸出代幣只要 6 美元,是 Anthropic Opus 4.8 定價 25 美元的四分之一不到。Elon Musk 說這是「Opus 等級,但更快、更省代幣、更便宜」,還丟出一個 4.2 倍代幣效率的數字。跑分結果有輸有贏,這篇要拆的是定價策略背後的算盤,以及三個月後該去哪裡驗證它是不是真的划算。

先亮出我的判斷,歡迎打臉:這波降價不會讓 Anthropic 立刻跟進砍價,反而會把戰場推向「每完成一個任務要花多少錢」,取代「每百萬代幣多少錢」這種比法。如果你手上正在跑編碼代理人的實際帳單,把 Grok 4.5 跟 Opus 4.8 放進同一批任務實測一輪,你算出來的單位成本跟這篇的估算對得上嗎?

事件摘要

SpaceXAI 今天把 Grok 4.5 開放給所有人。這家公司前身叫 xAI,7 月 6 日才剛完成品牌重塑。這是 SpaceX 二月合併 xAI、六月以 600 億美元收購 AI 編程工具 Cursor 之後,第一款掛著新招牌發布的模型。定價很直白:每百萬輸入代幣 2 美元,輸出 6 美元,跑在 grok.com、X app、Cursor 全部方案,還有 SpaceXAI 自家 API,速度約每秒 80 個代幣,走的是快模型的路線。

跑分方面,xAI 自己公布四項對比 Opus 4.8 的成績,贏兩項輸兩項。Grok 4.5 在 Terminal-Bench 2.1 拿下 83.3% 對 78.9%,贏。SWE-Bench Pro 卻以 64.7% 對 69.2% 輸掉,DeepSWE 1.1 更是輸了 6 分。真正的賣點在別的地方。xAI 講 Grok 4.5 完成同樣的 SWE-Bench Pro 任務,平均只用 15,954 個輸出代幣,Opus 4.8 要燒掉 67,020 個,差了 4.2 倍。獨立社群跑分方面,LMSYS Chat Arena 給 Grok 4.5 打了 1462 分,落在 Opus 4.6 那個等級的區間,目前還沒有第三方跑出跟官方一致的效率數字。

Grok 4.5 拿 Cursor 的開發者實戰資料去訓練,包括除錯過程和真實的程式碼修改記錄,不是靜態的公開程式碼庫。這解釋了它為什麼在 Terminal-Bench 這種偏工程操作流程的測試裡表現突出,卻在需要更廣泛推理的 SWE-Bench Pro 上落後。

數字背後的真相

先把 4.2 倍代幣效率這個數字拆開看。如果它是真的,一個原本要花 Opus 4.8 4.2 倍輸出代幣的任務,用 Grok 4.5 跑,花的錢是一樣的,因為 Grok 4.5 的單位代幣單價本身就比 Opus 便宜四倍多。兩個倍數疊在一起,理論上單一任務的實際成本能壓到 Opus 的十七分之一左右。這個數字很誘人,問題是它完全來自 xAI 自己的內部測試,沒有任何獨立機構重新跑過同一批任務去驗證代幣消耗量。跑分機構通常只驗證正確率,不驗證代幣用量,這個空白目前沒人補。

用費米估算換算一下規模感。一家中型軟體公司如果每月跑 5,000 個 AI 編碼代理人任務,以 Opus 4.8 平均每個任務燒 6.7 萬輸出代幣計算,月成本大約是 5,000 乘 67,000 乘 25 美元除以 100 萬,等於 8,375 美元。換成 Grok 4.5 官方宣稱的效率,同樣任務量的月成本掉到 5,000 乘 15,954 乘 6 美元除以 100 萬,大約 479 美元,差距接近 17 倍。這個算式的前提是任務難度、代理人框架、重試次數都一樣,現實中幾乎不可能完全一致,但差距的量級足以讓任何 CFO 多看一眼。

跑分之外還有一個工程師層面的現實。Grok 4.5 是用 Cursor 內部的除錯 session 資料訓練的,Cursor 本身正是被 SpaceX 收購、即將成為子公司的產品。競爭對手 Anthropic 的 Claude Code 和 OpenAI 的 Codex 目前都拿不到這種私有開發流程紀錄,xAI 等於握有一條對手複製不了的資料護城河,這個優勢會隨著 Cursor 用戶量增加持續加深。誰握有更貼近真實開發現場的訓練資料,誰就在這場模型架構之外的較量裡多一張底牌。

至於部署現實感,每秒 80 代幣的速度落在快模型區間,對即時互動型的編碼助理有感。代理人在多輪迭代任務裡真正拖慢速度的,往往是規劃和工具呼叫的往返次數,不是單純的代幣吐出速度,這部分官方跑分完全沒有揭露。

接下來值得觀察的指標

三件事會在未來一到三個月內給出答案。第一,獨立跑分機構像是 SWE-Bench 官方團隊、Artificial Analysis,是否會重新測量 Grok 4.5 在相同任務上的實際代幣消耗量,驗證那個 4.2 倍是否站得住腳。第二,Anthropic 是否會在 Opus 系列上推出對應的降價或效率優化版本,如果三個月內沒有動作,代表 Anthropic 判斷自己的護城河不在價格,落在準確率這條線上。第三,Cursor 的付費用戶在 Grok 4.5 上線後,選用預設模型的比例會不會出現明顯位移,這個數字會比任何跑分都更誠實地反映開發者的真實判斷。

Grok 4.5 目前還沒有在歐盟開放,監管審查的時間差,會不會讓歐洲開發者在這場價格戰裡缺席一整季,也值得留意。

如果這篇對你有幫助,訂閱電子報 可以第一時間收到 AI PM 實戰洞察與 GenAI 落地案例。

參考來源:TechCrunchAxios


相關閱讀:

訂閱最新分享

加入電子報,第一時間獲取關於金融 AI Agent 實戰與架構設計的最新文章。不訂閱你會慢別人一個週期!

絕不發送垃圾信。隨時皆可取消訂閱。