Meta 成為最新一家推出編碼代理的科技巨頭,急起直追領先的 AI 巨擘 Anthropic 和 OpenAI。
「我們很高興發布 Muse Code (beta),這是一款由我們最新模型 Muse Spark 1.2 驅動的終端編碼代理,」該公司在官方公告中寫道。「這標誌著我們邁向技術前沿的下一步,未來將有更大型、能力更強的模型問世。」
作為一款代理式編碼工具,Muse Code 專為大型程式碼庫的軟體工程而打造。根據 Meta 的說法,它「能處理大型程式碼庫中的複雜軟體工程任務:規劃變更、編寫程式碼並驗證結果。它可以為每項任務協調多個持續運行的子代理,從而更快、更準確、更少干預地解決難題。」
最引人注目的細節是其運行時設計。Muse Code 會將每次模型呼叫、工具運行、核准和編輯記錄到本地事件日誌中,該日誌作為單一事實來源。「這個單一事實來源使運行時具備精確重播和重啟安全性:崩潰後,代理可以從中斷處精確恢復,」Meta 表示。對於長時間運行的任務,這個特性比原始速度更重要——而這正是競爭對手尚未作為賣點的部分。
它還附帶預設技能。「/plan」指令將任務轉換為需要核准的計劃,「/grill」則對該計劃進行壓力測試直至其穩固,而「/goal」則朝著成功完成目標努力,類似於 Hermes 的功能。Meta 表示,他們將 Muse Spark 1.2 與 Muse Code 共同訓練,使核心 LLM 和代理能夠協同工作。
Muse Spark 1.2 是 Muse Spark 1.1 的編碼專注更新版。Meta 表示,它「顯著擴大了編碼任務的訓練計算規模,同時增加了訓練環境的多樣性,從而在程式碼生成、複雜除錯和端到端開發者工作流程方面帶來了改進。」圖表清楚地說明了這一點。
在 Terminal-Bench 2.1 上,搭載 Muse Code 的 Muse Spark 1.2 得分為 82.9%,落後於 Opus 5 上的 Claude Code (86.7%),但領先於 Codex 上的 GPT-5.6 Terra (81.8%) 和 Grok Build (81.6%)。
衡量代理式編碼能力的 DeepSWE 1.1 測試中,差距較小:Muse 為 59.3%,而 Opus 5 為 65.0%,Codex 為 64.8%。在 Meta 的內部編碼基準測試中,Muse 得分為 70.6%,Opus 5 為 79.4%。
加速圖表則呈現了不同的順序。在超過 1,000 次工具呼叫中,Opus 5 相對於基線的增益最大(約 74–75%),而 Muse Spark 1.2 處於中段,根據運行情況約為 61–69%。Meta 強調的重點是,隨著工具呼叫的累積,代理會持續改進,這正是長期編碼任務所需的行為。
最有趣的演示是長期任務和多模態應用。在壓力測試中,Meta 表示 Muse Code「在 Nvidia Hopper GPU 上經過 1,000 多次工具呼叫(長達 24 小時)對 GPU 核心進行了迭代優化。」這意味著它能夠隨著時間推移不斷改進。
它還具備視覺編碼功能。在一個演示中,使用者將一段房屋的飛覽影片以 mp4 格式拖入終端機,Muse Code「解讀影片並生成一個具有預訂功能的視覺豐富網站。」將原始影片讀取並轉化為可運行的網頁應用,正是 Meta 在整個 Muse 產品線中一直強調的多模態賣點。
以下是一個展示 Muse Code 多模態視覺編碼能力的例子。在這個演示中,使用者將一段房屋的飛覽影片以 mp4 檔案輸入終端機。Muse Code 解讀影片並生成一個具有預訂功能的視覺豐富網站。 pic.twitter.com/3CAfIMYmAB
話雖如此,Meta 在這場競爭中已經遲到。OpenAI 的 Codex 早已運行並行的雲端代理;DeepSeek 已打造出與 Claude Code 抗衡的產品;而像 Hermes 或 OpenClaw 這樣的代理工具已經是功能更強大的替代品。Muse Code 的優勢在於其崩潰安全的運行時和子代理設計,而非基準測試的領先地位。
風險在於代理式編碼的常見問題:一個在崩潰後恢復並持續呼叫工具長達 24 小時的代理,雖然強大但也難以預測。Meta 押注開發者需要這種自主性,並且現在就將其推出。
Muse Code 可透過安裝並輸入以下指令進行測試:curl -fsSL https://dev.meta.ai/install.sh | bash