阿里巴巴發布 Qwen3.8-Max:2.4 兆參數,下週才開放權重
重點摘要
阿里巴巴 Qwen 團隊發布 Qwen3.8-Max,總參數 2.4 兆、啟用參數 950 億,並承諾下週首次開放 Max 級模型權重;獨立部署成本與基準重現仍待驗證。
Qwen3.8-Max 的可驗證門檻要等到權重真的下載得到才開始:若獨立團隊在未來三至六個月無法用公開設定重現官方的程式開發與長任務成績,或部署成本高到只有少數雲端業者負擔得起,這次發布就只能證明阿里巴巴能擴大模型,不能證明企業能把它搬進自己的基礎設施。
Qwen 團隊在 August 3, 2026 發布 Qwen3.8-Max,官方規格為 2.4 trillion parameters,其中每次推論啟用 950 億參數。模型目前已透過 QwenCloud API 提供,團隊表示將在下週釋出權重。這是 Qwen 首次承諾開放 Max 級模型權重,讓外部開發者有機會檢查模型本身,而不只比較雲端介面的輸出。
2.4 兆參數如何進入一次推論
2.4 兆是模型的總參數量,95B active 才較接近單次請求實際動用的模型規模。這種混合專家架構讓模型保留較大的知識與能力容量,同時避免每個 token 都計算全部參數。官方發布的設定也列出 100 萬 token context window,以及 low、medium、xhigh 三種 reasoning effort;這些規格會影響記憶體、延遲與費用,但公告沒有提供硬體需求、每 token 價格或自架吞吐量。
官方把 Qwen3.8-Max 定位在 coding、cowork、研究與長時間代理任務。Terminal Bench 2.1 的成績為 86.6,低於 GPT-5.6 Sol 的 88.8,高於官方表中 Claude Opus 4.8 的 84.6;PaperBench 則得到 93.0。比較仍有條件差異:Qwen 使用 Claude Code、十次平均、五小時上限與 131,072 max tokens,其他模型採各自最佳已發布 harness 成績。這張表能說明模型在特定流程下的表現,不能當成同一運算預算的盲測。
開放權重會揭露部署代價
Qwen 展示的長任務包括讓模型反覆提出方法、寫程式、執行實驗,再依結果修改下一輪。官方案例中,一個研究迴圈運行約 88 小時,最後在 AIME24 比原論文方法提高 2.7 個百分點。這類閉環代理的限制不只在模型準確率;工具權限、錯誤累積、GPU 時數與中途人工介入,都會改變最後成本。公告沒有公布所有失敗任務或完整推論帳單。
Reuters 也報導阿里巴巴發布目前規模最大的 Qwen 模型,並把事件放在中國模型商同步壓低價格、擴大能力的競爭中。外部報導確認發布事件,效能數字仍主要來自 Qwen 自行測試。下週應先核對權重是否按期提供、授權是否允許商業部署,以及 2.4 trillion parameters 需要多少 GPU 與記憶體;之後再看第三方在相同 harness、token 上限與時間限制下,能否重現 86.6 的 Terminal Bench 2.1 成績。
來源:
相關文章
阿里巴巴今起禁用 Claude Code:Anthropic 藏了三個月的中國偵測代碼曝光
阿里巴巴今日起在集團內部全面禁用 Claude Sonnet、Opus、Fable 與 Claude Code,起因是一名 Reddit 用戶挖出一段藏了三個月的中國時區偵測代碼。這是阿里巴巴對 Anthropic 蒸餾攻擊指控的反擊,也是一場信任危機的開端。
豆包、通義千問同步關閉AI擬人陪伴功能,中國這次玩真的
字節跳動與阿里巴巴本週同步宣布,7月10日到15日之間全面關閉豆包與通義千問的類人陪伴agent功能,兩家合計覆蓋數億月活用戶。這不是單一產品下架,是中國第一部針對「情感陪伴AI」的全國性禁令,美國各州還在為同一件事各自立法。