LongCat-2.0:美團五萬顆國產晶片練出的兆級模型
重點摘要
美團開源LongCat-2.0,1.6兆參數模型號稱完全用五萬顆國產晶片練成,定價只有GPT-5.5的十分之一。這個打敗GPT-5.5的說法禁得起檢驗嗎?
美團在6月30日把LongCat-2.0放上GitHub和Hugging Face,1.6兆參數的MoE模型,官方說法是完全在五萬顆國產晶片上跑完訓練和推論,SWE-bench Pro拿到59.5分,比GPT-5.5的58.6高一點點。我的判斷是,這個「打敗GPT-5.5」的說法禁不起放大看,0.9分的差距在測試誤差範圍內,換一個叫FORTE的agentic benchmark,GPT-5.5反而是77.8分打73.2分把LongCat-2.0壓著打。如果你手上有其他agentic benchmark的實測數據,歡迎回來對一下,看這個模型到底是真的追平了西方前沿模型,還是只在一張精心挑過的成績單上贏。
事件摘要:外送平台養出來的兆級模型
美團在中國以外送和本地生活服務起家,這次跳出來的LongCat-2.0走的是MoE架構,1.6兆參數總量,實際每個token只會啟動33億到56億參數,平均落在480億上下。上下文視窗拉到一百萬token,訓練資料超過35兆token,官方說整個過程沒有出現訓練中斷或不可恢復的loss飆升。
比較特別的是它上線前的身分。過去兩個月,這顆模型化名Owl Alpha掛在OpenRouter上跑,沒人知道背後是美團。這段匿名期間它一天平均跑掉5590億token,月成長242%,開發者是在完全不知道血統的狀況下自己選了它,這個訊號比任何官方公布的跑分都更有參考價值,因為它躲開了廠商自己選擇比較對象的偏誤。
訓練用的晶片,多方報導都指向華為昇騰910B系列,美團自己沒有正面證實。如果屬實,這是第一次有華為晶片訓出來的模型在公開跑分上摸到前沿水準,對照2022年後中國拿不到大量Nvidia晶片的處境,這件事的份量比模型本身的分數更重。定價部分,標準價格輸入0.75美元、輸出2.95美元,換算下來輸出比GPT-5.5的30美元便宜十倍,比Claude Sonnet 5的10美元也便宜超過三倍。
數字背後的真相:便宜十倍,靠的是什麼
先說晶片規模。五萬顆昇騰910B單卡算力估計只有Nvidia H100的三到四成,換算下來這個叢集的有效算力大概相當於一萬六千到兩萬張H100,這個量級已經逼近外傳GPT-4當年訓練叢集的規模。換句話說,這不是小打小鬧的demo,是中國拿自家晶片湊出一次貨真價實的前沿等級訓練。
再看價格。輸出token只要GPT-5.5十分之一,這個差距不太可能單純來自晶片效率,更合理的解釋是中國電價低、晶片不用付Nvidia的毛利和關稅,再加上美團現在急著在OpenRouter這類平台搶市占,用價格換用量。這個猜測跟我們先前追蹤的中國模型在OpenRouter美國市場份額崩跌那篇報導對得上,價格戰是中國陣營目前唯一打得動的牌。
真正該打折扣看待的,是「開源」這兩個字。GitHub和Hugging Face的頁面到現在還寫著模型權重即將釋出,敬請期待,也就是說外部除了透過美團自家API打電話進去,沒有任何管道能真的下載這個模型自己跑,MIT授權目前只授權在紙上。
接下來值得觀察的指標
三件事可以在接下來幾週到幾個月內驗證。第一,美團會不會真的把權重放上GitHub,如果拖過一個月還沒動靜,這次發布就該歸類成行銷,不是真正的開源貢獻。第二,會不會有獨立機構證實訓練晶片真的是昇騰910B,這決定了這個故事是中國晶片自主的里程碑,還是一次沒有查證的猜測。第三,阿里、字節、騰訊這些對手會不會在三到六個月內跟進宣布自己也做到全流程國產晶片訓練,如果一家都沒跟上,代表美團這次是特例,不是趨勢。
如果這篇對你有幫助,訂閱電子報 可以第一時間收到 AI PM 實戰洞察與 GenAI 落地案例。
相關文章
Kimi K3上線:2.8兆參數開源模型直逼Claude Opus
Moonshot AI 7月16日推出Kimi K3,2.8兆參數的開源模型,GDPval-AA排名第三,輸給Claude Fable 5和GPT-5.6 Sol,定價卻跟Claude中階模型同一個量級,開源權重要等7月27日才會釋出。中國模型靠低價取勝的老劇本,這次沒有照抄。
LineShine 2.198 Exaflops 奪下 TOP500:換算成 AI 訓練,差距還很遠
中國 LineShine 以 2.198 Exaflops 登上 TOP500 全球第一,全程不含 Nvidia、Intel、AMD 晶片。但 Linpack 算的是 FP64 線性代數,不是 AI 訓練。費米估算顯示同等 GPU 叢集訓練同規模大模型快 5 倍,電費省 9 倍。