← 返回文章列表

AI 自動化基準測試:Fable 5 真實接案工作只拿下 16.1%

Nils Liu
Remote Labor Index Fable 5 AI Benchmark Scale AI Center for AI Safety 新聞觀察

重點摘要

最新一版 Remote Labor Index 基準測試顯示,Claude Fable 5 在 240 個真實接案專案裡拿下 16.1% 的自動化率,是目前最高分。這代表的是驚人進步,還是離取代人類還很遠?我們把費米估算攤開來看。

AI 自動化基準測試:Fable 5 真實接案工作只拿下 16.1%

你可以自己去 Scale Labs 的 RLI 榜單核對這組數字。Fable 5 目前自動化率 16.1%,是這個榜單開賽以來最高分。我拿官方公布的單次任務預算 150 美元,除以 16.1% 的過關率,算出一個粗估:真正拿到一份專業水準成品,平均要花掉 930 美元運算成本。人類接案者做同一件案子的中位收費只要 200 美元。這筆帳你重新查最新定價和過關率算一次,如果跟我差超過兩成,代表可能是我漏算了某個假設,歡迎回來告訴我漏在哪裡。

Center for AI Safety 和 Scale AI 在 7 月 1 日公布了 Remote Labor Index 最新一輪結果。這個榜單找來 240 個來自真實接案市場的專案,橫跨 3D 建模、建築製圖、平面設計、影音剪輯、音訊處理、資料分析、網頁開發等 23 個專業領域,每一份成品都交給人類評審對照專業客戶原本付費買到的成品打分。Anthropic 的 Fable 5 拿下 16.1%,排名第二的 Opus 4.8 是 8.3%,OpenAI 的 GPT-5.5 排第三,6.3%。這輪測試只做完 240 個專案裡的 218 個,剩下的沒跑完,因為美國政府中途限制了 Fable 5 的存取權限,同一批限制也讓 Anthropic 在六月停用過 Fable 5 十九天,這段插曲我在另一篇文章拆過細節。

這個榜單去年十月才上線,當時領先的是 GPT-5.2,自動化率只有 2.5%。九個月內爬到 Opus 4.6 的 4.17%,接著 Opus 4.8 衝上 8.3%,現在 Fable 5 拿下 16.1%,等於每一代新模型都比前一代翻倍。CAIS 的官方公告把這個成長速度形容成數位勞動自動化的顯著提升。

240 個真實接案案子,AI 只端出 16.1% 能過關的成品

RLI 的評分標準跟一般 benchmark 不一樣,直接讓人類評審扮演真實客戶的角色,判斷這份成品收不收得下手,模型答不答得出標準答案並不是重點。測試環境給每個模型最長 24 小時的作業時間,可以呼叫 A100 GPU,也能操作 Blender、FreeCAD、GIMP、Kdenlive、Audacity 等三十幾套專業軟體。模型跑在 Claude Code 或 Codex CLI 這類 agent 框架裡,交件前還要經過一個獨立的裁判 agent 先審一輪,這叫 worker-critic loop。預算方面,一般模型給 50 美元,Fable 5 因為單次任務成本比 Opus 4.8 貴上六倍,破例給到 150 美元。

失敗案例的樣態值得記一筆。研究團隊分析過去的失敗紀錄,四成五卡在成品品質沒到專業水準,三成六是檔案不完整或格式跑掉,剩下的分布在技術性錯誤和專案內部前後不一致。模型比較擅長從零生成的工作,音訊、圖像類任務尤其明顯,遇到需要對照既有規格、逐步修改既有檔案的案子,過關率明顯掉下去。

數字背後的真相

16.1% 這個數字本身沒問題,官方數據,方法論也公開在 arXiv 論文裡,第三方可以重跑。真正該打折扣的是拿這個數字去推論 AI 自動化即將取代白領接案工作的說法。

先看成本。Fable 5 一次任務燒到 150 美元預算,過關率 16.1%,換算下來一份真正能交件的成品要價 930 美元上下。同樣的案子,人類接案者收 200 美元。就算不計入審核 AI 產出還得另外找人把關的人力成本,這筆帳目前完全不划算。研究團隊自己也提到一句實話,判斷一份 RLI 成品夠不夠專業,本身就是一個要花力氣的 agentic task,隨手丟給另一個 AI 掃一眼,掃不出真正的答案。

這點延伸出第二個問題,自動化評分的可信度。同一批測試如果換成用 AI 當裁判,GPT-5.5 的分數會被高估將近三倍,Opus 4.8 高估超過兩倍。排名順序沒有錯,但絕對分數差了一大截。這代表市面上任何一篇宣稱模型在某個 benchmark 拿下多少準確率的新聞,只要評分機制換成 AI 判官,數字先打對折再看比較保險。

最後看成長曲線。從 2.5% 到 16.1%,看起來像指數成長,拆開來看,這個數字疊加了四個不同世代的模型,加上一套越蓋越完整的 agent 工具鏈。預算從 50 美元加碼到 150 美元,能操作的軟體從幾套擴充到三十幾套,這些工程投入本身就會墊高分數,不能全部算在模型變聰明的帳上。

接下來值得觀察的指標

第一,下一輪 RLI 更新如果還維持翻倍速度,年底前自動化率有機會摸到 30% 上下,這是一個可以先寫下來、之後回頭驗證的具體數字。

第二,其他仰賴 AI 當裁判的 benchmark,會不會被人翻出跟 RLI 一樣的高估落差,這件事一旦擴散開,整個產業引用 benchmark 分數的方式都得重新校正。

第三,Fable 5 的單次任務成本會不會隨著推理成本下降而收斂到接近 Opus 4.8 的水準,這決定了自動化接案這門生意什麼時候才有機會轉正。

第四,美國政府對 Fable 5 的存取限制會不會再次中斷評測,這已經是這輪測試第二次被政策性因素打斷,下一次限制出現的時間點本身就是一個值得追蹤的訊號。

如果這篇對你有幫助,訂閱電子報 可以第一時間收到 AI PM 實戰洞察與 GenAI 落地案例。


相關閱讀:

訂閱最新分享

加入電子報,第一時間獲取關於金融 AI Agent 實戰與架構設計的最新文章。不訂閱你會慢別人一個週期!

絕不發送垃圾信。隨時皆可取消訂閱。