Meta 推出 Muse Code:終端機程式代理以 1,000+ 次工具呼叫測試長時任務
重點摘要
Meta 發布由 Muse Spark 1.2 驅動的 Muse Code beta,可在 macOS 與 Linux 執行跨儲存庫任務;官方案例延續最長 24 小時,但仍缺少獨立重現與實際成本資料。
Muse Code 能否縮短大型程式庫的交付時間,可以用三至六個月內的合併請求週期、人工退回率與每次完成任務的總推論成本檢驗。Meta 目前只公布自家評測與案例;若企業試用後的修正工時沒有下降,或長時任務的費用高於節省的人力,這次產品發布就還不能證明代理能穩定承接完整工程工作。
Meta Superintelligence Labs 在 August 5, 2026 發布 Muse Code beta。這是一套安裝在終端機的程式代理,由 Muse Spark 1.2 驅動,目前支援 macOS 與 Linux。Meta 表示,它能讀取大型儲存庫、規劃修改、撰寫程式、執行驗證,並讓背景子代理在同一工作階段持續處理任務。9to5Mac 核對了平台、beta 狀態與安裝方式;Reuters 也在同日報導產品與模型上線。
事件紀錄讓中斷後的任務可以恢復
Muse Code 把模型呼叫、工具使用、核准與檔案修改寫進本機事件紀錄,程式意外中止後可以接續先前狀態。內建指令可先產生計畫、壓力測試計畫,或依指定目標繼續執行。這套設計處理的是代理長時間工作時常見的兩個問題:上下文壓縮可能遺失決策,而程序中斷可能迫使工程師重跑昂貴步驟。事件紀錄提高可追查性,但官方資料沒有說明不同規模儲存庫的恢復成功率,也沒有公布背景代理同時運行時的 token、延遲與費用上限。
Meta 表示 Muse Spark 1.2 與 Muse Code 共同訓練,資料包含代理執行軌跡、目標維持、上下文壓縮與子代理協作。公司也用前一版 Muse Spark 1.1 產生具挑戰性的程式環境與指令模板,再由模型評分候選解答。這種自我改進流程能擴大訓練資料,評分者與受評模型來自同一家公司,因此仍需要外部團隊用自己的程式庫、測試套件與審查標準重做比較。
24 小時案例測的是 GPU 核心最佳化
官方案例讓模型進行 1,000+ tool calls,最長執行 24 小時,反覆撰寫、編譯、分析並改善 GPU kernel。測試涵蓋 NVIDIA Hopper GPU 上的 KDA 與 MLA kernel;KDA 禁止直接匯入第三方 kernel 函式庫,MLA 則以 batch size 1、64 個 heads、sequence length 8192 與 latent dimension 512 比較 PyTorch 參考實作。這些條件讓結果可以被具體檢查,卻只代表兩類受控最佳化工作,不能直接推論一般企業程式庫的除錯、權限管理或跨服務部署表現。
Muse Spark 1.2 已可透過 Muse Code 與 Meta Model API 使用,Meta 稱 API 擴大了全球存取範圍。公司尚未在發布文中提供 Muse Code 的正式版日期、按任務成本、企業管理功能或第三方評測結果。接下來最有辨識力的數字,是外部團隊完成相同 issue 所需的總時間、人工介入次數、測試通過率與帳單;只有這些數據同時改善,長時代理的技術展示才會轉成可採購的工程工具。
來源: