Step 5 Preview 發表:低價長工時推理,需要能淘汰錯誤的回饋
重點摘要
StepFun 發表 600B 參數的 Step 5 Preview,開放 API,並預告釋出權重。官方程式優化案例說明了長時間工作的可能性,但低 token 單價尚不能證明每次合格修改的總成本更低。
StepFun 在 2026-09-20 發表 Step 5 Preview,讓開發者多了一個長時間推理的模型選項。目前公開資料缺少一般團隊每次取得合格程式修改的總費用;單價降低後,重試與檢查是否也變少,會影響這款模型能替使用者省下多少成本。每日經濟新聞
每日經濟新聞於當日 10:27 刊出正式發布消息,Artificial Analysis 則將模型釋出日列為 2026-09-18。本文報導的是 20 日官方宣布,採台北同日出刊,查核截止為 20:36;官方頁面未列發布時刻,API 首次啟用時間尚無法確認。官方表示目前可透過 API 使用,模型權重預定 2026-10-15 釋出,不能把現有服務寫成已能下載完整模型自行部署。官方公告 每日經濟新聞 獨立評測
模型採混合專家架構,總參數為 600B,每次啟用 27B,支援 1M tokens 上下文。這讓較長的任務紀錄有空間留在輸入中,但容量本身無法證明模型會正確運用每段資訊。釋出權重後的硬體配置與授權,也要依實際文件判斷,不能從啟用參數量直接推算部署費用。每日經濟新聞
Artificial Analysis 列出的 Intelligence Index 分數為 44,輸入與輸出每百萬 tokens 分別為 USD 1 與 USD 2.70。其測試消耗約 160M 輸出 tokens,高於受測模型約 92M 的中位數。這是該評測條件下的用量,不能套用到每個應用;它至少提醒開發者,單價與總用量必須一起看。獨立評測
官方提供一個 H100 程式核心優化案例:在 24 小時預算內,約 22 小時達到 508 TFLOPS,採用的是 4 次執行中最佳的一次。模型根據吞吐量回饋淘汰較慢的修改。這是廠商展示,並非一般專案的平均成果,也沒有證明各種長時間工作都有相同成功率。官方公告
程式可以量測速度,文件仍需定義可接受的結果
這個案例讓我偏向把低價長工時推理用在能反覆驗證結果的任務。程式優化有可量測的吞吐量;在確認正確性後,較快的版本才有保留理由。多給模型時間,可以增加嘗試不同做法的機會,前提是系統能辨認哪些修改讓結果退步,並保留已驗證的版本。
假設模型改為整理一份產品需求文件,篇幅增加或文字更流暢,就未必代表需求更完整。團隊若沒有定義哪些使用情境不能漏掉,模型可能持續潤飾同一份缺漏文件。這種工作需要先建立可回查的需求依據,再決定哪些修改可以自動接受;增加推理時間無法代替這項產品判斷。
低單價仍有實際用途。對已有明確驗證方法的工作,同一筆預算可以容納更多候選做法,不必把第一次可用的答案直接當成最終版本。但比較方案時,我會把被淘汰的執行、測試運算與人工確認一起計入,而不只比較成功那次用了多少 tokens。這是從展示條件推導的成本口徑,現有來源沒有提供足以計算一般團隊回報的資料。
這次發布已增加 API 選擇;預告中的權重則可能讓部署方式增加彈性,仍須等待實際交付。我會用每次通過相同驗收條件的修改所需總費用,判斷便宜的長時間推理是否帶來收益。只要被接受的結果沒有增加,模型多工作幾小時就還不能算作效率提升。
封面沿用本站代理系統插畫,並非 Step 5 的架構圖或發布圖片;來源圖片因網路解析失敗未能下載。
來源: