Meta 推出 Muse Code:常駐背景 Agent 可跑 24 小時,Muse Spark 1.2 實力與限制一次看

Muse Code 把常駐背景 Agent、可恢復事件紀錄與長時間任務整合成終端機開發工具;跑分已有競爭力,但尚不能只憑 Meta 官方測試判定勝負。

Share
Meta Muse Code 與 Muse Spark 1.2 官方藍色抽象主視覺
Meta 於 2026 年 8 月 5 日推出 Muse Code Beta,並以 Muse Spark 1.2 驅動。 圖片來源:https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2

Meta 在 2026 年 8 月 5 日推出 Muse Code Beta。它是一款在終端機中運作的 AI 程式開發 Agent,由新模型 Muse Spark 1.2 驅動,可讀取大型程式庫、規劃修改、撰寫程式,最後自行執行測試與驗證。

真正值得注意的不是「Meta 也做了一個 Claude Code」,而是 Muse Code 把多個常駐背景 Agent、可在中斷後恢復的事件紀錄,以及最長 24 小時的長任務放進同一套工具。這代表 AI coding agent 的競爭,正從「誰能回答程式問題」轉向「誰能把一項工程工作可靠地做完」。

Muse Code 已經呈現出有辨識度的產品架構,測試成績也進入第一梯隊;但它目前仍是 Beta,多數比較由 Meta 自己執行,定價與正式團隊會在意的管理資訊也還不完整。已經熟悉終端機 AI 工具的開發者值得測試,正式專案則不必急著全面遷移。

Muse Code 是什麼?

Muse Code 是 Meta 推出的終端機 AI coding agent。Agent 可以理解成「不只回答問題,還能自己使用工具完成任務的 AI」。你交代要修正的功能後,它會讀取 repository,也就是存放整個專案程式碼與歷史的程式庫,再規劃修改、編輯檔案、執行指令及檢查結果。

這類工具與一般聊天機器人最大的差別,在於工作範圍。聊天機器人通常提供一段程式碼讓你自行貼回專案;coding agent 則直接在開發環境裡工作,處理跨檔案修改、測試失敗與後續修正。

Muse Code 目前支援 macOS 與 Linux。Meta 提供的安裝指令是:

curl -fsSL https://dev.meta.ai/install.sh | bash

這種指令會從網路下載腳本並立刻執行。即使來源是官方,團隊環境仍建議先檢視腳本內容,再決定是否安裝,避免把開發機權限直接交給未檢查的程式。

Muse Code 的三個核心設計

1. 背景 Agent 不是用完即丟,而是整個工作階段都在

Muse Code 的主 Agent 旁邊會有多個非同步背景 Agent。Subagent 是被主 Agent 分派特定工作的較小執行單位,例如一個負責搜尋程式碼,另一個負責檢查測試或研究下一步。

Meta 的設計差異在於,這些背景 Agent 會在整個 session,也就是一次工作階段中持續存在,而不是每碰到一個小任務就重新建立。它們能保留已經找過的資訊,自行決定下一步,必要時再回報主 Agent。

這項設計若能在真實專案中穩定運作,最大的價值是減少重複探索。大型 repository 最花時間的往往不是寫出那幾行程式,而是理解模組關係、找出測試入口,以及確認某項修改會影響哪些地方。常駐 Agent 可以把這些背景工作延續下去,不必每次從頭讀起。

2. 所有操作都寫入事件紀錄,中斷後可以續跑

Muse Code 會把模型呼叫、工具執行、使用者核准與檔案編輯,依序追加到本機 event log。Event log 可以理解成一份只往後增加、不隨意覆寫的操作紀錄。

Meta 表示,這份紀錄讓 Muse Code 可以精準重播執行過程,也能在程式崩潰後從原本的位置恢復。對長時間 Agent 任務來說,這比單次回答更重要。跑了幾個小時的工作若因連線或程序錯誤全部重來,模型再強也很難進入正式流程。

不過,可恢復不等於結果一定正確。事件紀錄解決的是「過程不會輕易消失」,不能取代測試、程式碼審查與權限控管。團隊真正要驗證的,是恢復後是否維持相同工作狀態,以及錯誤決策會不會也被一路延續。

3. 內建 /plan/grill/goal 三種工作技能

Muse Code 內建三個值得注意的指令:

  • /plan:先把任務拆成計畫,經使用者核准後再執行。
  • /grill:對計畫做壓力測試,主動找出漏洞與遺漏。
  • /goal:持續朝指定成果工作,直到達到成功條件。

這三個指令對應到 AI coding agent 最常失敗的三個地方:太快動手、沒有檢查假設,以及做了很多事卻沒有真正完成目標。它們不是新模型的炫技功能,而是把工程流程變成可重複使用的操作方式。

Muse Code 讀取房屋導覽影片後建立網站,並在瀏覽器中驗證結果。影片來源:Meta 官方研究公告。 查看官方來源

Muse Spark 1.2 改了什麼?

Muse Spark 1.2 是針對 coding 強化的 Muse Spark 1.1 更新。Meta 表示,新版增加了程式任務的訓練算力,也擴大訓練環境種類,重點改善程式碼生成、複雜除錯、理解整個 codebase,以及從接到需求到完成驗證的端到端工作。

模型與 Muse Code 還採取共同訓練。換句話說,Meta 不只訓練一個會寫程式的模型,再把它塞進終端機,而是把 Muse Code 的工具、目標管理、內容壓縮與 subagent 流程一起納入訓練。這會讓模型更熟悉自己實際要操作的環境。

長任務是另一個訓練重點。Meta 讓模型練習建立完整 repository、大型端到端專案與自動研究,並利用 planning 維持步驟順序、goal conditioning 維持方向,再用 context compaction 壓縮舊資訊。Context compaction 是把冗長工作紀錄濃縮成仍可繼續執行的重點,避免任務跑久後忘記前面的決策。

Meta 展示的 GPU kernel optimization 案例超過 1,000 次工具呼叫,最長執行 24 小時。GPU kernel 是直接在 GPU 上執行的底層運算程式。這個案例證明 Muse Code 的架構能支撐很長的反覆編寫、編譯與測速流程,但它是高度專門的測試,不能推論所有一般軟體專案都能無人監督跑滿 24 小時。

Muse Spark 1.2 跑分有多強?

Meta 公布的測試顯示,Muse Spark 1.2 已經具備第一梯隊競爭力,但沒有全面領先。

測試 Muse Spark 1.2 成績 這項測試在看什麼 解讀
Terminal-Bench 2.1 82.9% 在終端機完成 89 項任務 僅次於 Opus 5+Claude Code 的 86.7%
DeepSWE 1.1 59.3% 修正 91 個 repository 中的 113 項真實軟體任務 低於 Opus 5 的 65.0% 與 GPT-5.6 Terra 的 64.8%
Meta Internal Coding Bench 70.6% Meta 內部 440 項修錯、開發與重構任務 低於 Opus 5 的 79.4%,高於其他列入模型
MCP Atlas 90.3% 操作 36 個 MCP server 與 220 種工具 在 Meta 公布的比較中排名第一
GDPVal-AA V2 Elo 1,631 完成文件、試算表、簡報等 220 項專業工作 低於 Opus 5 的 1,852,高於其他列入模型
Muse Spark 1.2 搭配 Muse Code 在 Terminal-Bench 2.1 取得 82.9%
Muse Code 的 82.9% 低於 Opus 5 搭配 Claude Code 的 86.7%。各模型使用不同 Agent,不能視為模型單獨能力排名。 圖片來源:Meta 官方研究公告

MCP 是讓 AI 連接外部工具與資料來源的一套標準。MCP Atlas 的 90.3% 說明 Muse Spark 1.2 不只會生成程式碼,工具選擇與多步驟操作也是強項。這與 Muse Code 強調多 Agent 和長流程的產品方向一致。

Muse Spark 1.2 在 MCP Atlas 工具操作測試取得 90.3%
MCP Atlas 涵蓋 36 個 MCP server 與 220 種工具,Muse Spark 1.2 在 Meta 公布的比較中取得 90.3%。 圖片來源:Meta 官方研究公告

Terminal-Bench 2.1 與 DeepSWE 1.1 都以 pass@1 呈現,也就是模型一次嘗試成功的平均比例。Meta 在每一題執行 5 次後計算平均,因此它比只挑最好一次更接近日常使用,但仍是受控環境中的測試,不等於你的專案成功率。

為什麼不能直接說 Muse Code 打敗 Codex 或 Claude Code?

第一個原因是比較對象其實是「模型+Agent 產品」。Terminal-Bench 2.1 中,Muse Spark 1.2 搭配 Muse Code,Opus 5 搭配 Claude Code,GPT-5.6 Terra 搭配 Codex。分數同時受到模型、工具、system prompt、權限與執行流程影響,不是單純的模型能力排名。

第二個原因是測試由 Meta 執行。Meta 在方法文件中主動說明,第三方模型所使用的工具與 system prompt 未必針對其特性最佳化,所以分數可能沒有反映這些模型在原生環境中的最佳表現。

DeepSWE 的口徑也要特別小心。官方 leaderboard 對每個模型都使用相同的 mini-swe-agent,Meta 的測試則改成每個模型搭配各自的 Agent 產品。這樣較接近使用者真正買到的完整工具,卻不適合拿來做完全控制變因的模型比較。

Muse Spark 1.2 搭配 Muse Code 在 DeepSWE 1.1 取得 59.3%
DeepSWE 1.1 中 Muse Code 為 59.3%,低於 Opus 5 與 GPT-5.6 Terra。Meta 此次比較不是官方 leaderboard 的同一 harness 口徑。 圖片來源:Meta 官方研究公告

因此,這組數字可以支持「Muse Code 已有競爭力」,還不足以支持「Muse Code 是目前最強 coding agent」。若之後有更多獨立機構在相同權限、成本與 harness 下重測,排名才更有比較價值。Harness 是包住模型的執行框架,負責提供工具、指令與任務環境。

Muse Code 適合誰?

Muse Code 現階段最適合三類人:

  1. 已經使用 Claude Code、Codex 或其他終端機 Agent,想比較長任務穩定性的開發者。
  2. 經常處理大型 repository,希望把搜尋、測試與背景研究拆給多個 Agent 的團隊。
  3. 想透過 Meta Model API 測試 Muse Spark 1.2,並願意自行建立驗證流程的產品與工程人員。API 是讓開發者能從自己的程式呼叫模型的介面。

如果只是偶爾請 AI 解釋錯誤訊息,Muse Code 的多 Agent 與長任務架構可能太重。若公司程式碼涉及客戶資料、商業機密或嚴格法規,也應先確認資料保留、模型訓練、區域與管理權限,再把 repository 交給雲端模型。

截至 2026 年 8 月 6 日,Meta 公告確認 Muse Spark 1.2 已可透過 Muse Code 與 Meta Model API 使用,並擴大全球開放範圍,但公告沒有提供公開定價。成本尚未清楚以前,比較工具不能只看成功率,也要計算每次任務使用的模型量、執行時間與失敗重跑成本。

Muse Code 常見問題

Muse Code 是免費的嗎?

Meta 在 2026 年 8 月 5 日的公告沒有列出 Muse Code 或 Muse Spark 1.2 的公開價格。現在可以確定的是產品以 Beta 形式推出,Muse Spark 1.2 也進入 Meta Model API;實際帳號資格、額度與費用應以登入後顯示的方案為準。

Windows 可以安裝 Muse Code 嗎?

官方公告只列出 macOS 與 Linux,沒有把 Windows 列為目前支援平台。Windows 使用者不應直接假設原生支援,若要透過 WSL 等 Linux 相容環境測試,也要自行承擔 Beta 階段的相容性問題。

Muse Code 可以完全自動寫完一個大型專案嗎?

它具備長任務、多 Agent、規劃與驗證能力,Meta 也展示超過 1,000 次工具呼叫、最長 24 小時的案例。不過,那是受控的 GPU 優化任務,並不代表任何需求都能無人監督完成。比較安全的做法是先限制可修改範圍,保留核准節點,再用測試與人工 review 驗收。

Muse Spark 1.2 是開源模型嗎?

這次公告提供的是 Muse Code 與 Meta Model API 的使用方式,沒有宣布釋出 Muse Spark 1.2 的模型權重。API 可使用與開源下載是兩件不同的事,不能因為 Meta 過去推出過開源模型,就推論這次也能在本機自行部署。

Muse Code 比 Claude Code 或 Codex 強嗎?

目前只能說它已進入同一競爭級別。Meta 公布的 Terminal-Bench 2.1 與 DeepSWE 1.1 中,Muse Code 並未排名第一;MCP Atlas 則取得最高分。由於模型搭配的 Agent 與執行環境不同,還需要獨立、同口徑測試才能下更強的結論。

結論:Muse Code 的重點不是多一個模型,而是新的 Agent runtime

Muse Code 最有價值的地方,是把 AI coding agent 從單次對話拉到可持續運作的工程流程。常駐背景 Agent 減少重複探索,本機事件紀錄提高長任務的恢復能力,/plan/grill/goal 則把規劃、質疑與完成條件做成明確操作。

目前的證據足以讓我對產品方向中性偏多,卻不足以建議團隊立刻替換既有工具。個人開發者可以用一個有完整測試的小型 repository 比較完成率、修改品質與成本;正式團隊則應等定價、資料政策與管理能力更清楚,再評估是否導入核心程式庫。

真正會改變判斷的,不是下一張官方排行榜,而是 Muse Code 在獨立測試與真實長任務中,能否以合理成本穩定完成工作,並讓人清楚追蹤、審核與收回它的每一步。

資料來源

Read more

Gemini Notebook 迎來大更新,每個筆記本搭一台雲端電腦?

Gemini Notebook 迎來大更新,每個筆記本搭一台雲端電腦?

上週我們開始今年的讀者調查,雖然離結束還有兩週的時間,但我們真的很好奇大家的答案,所以就偷看了一下 XD 有位在製造業擔任工程師的讀者分享,我覺得他的比喻很妙: 主管們都認為用 AI 可以減少開發時間,其實不然,反而增加了開發時間,因為很多事一直冒出來,而時間沒有被增加,原因是你被認定有 AI 助手,這跟人月神話有異曲同工之妙。聽過一句最寫實的話,再怎麼會生小孩,也是需要 10 個月才能誕生阿。 我非常認同,對於需要精密打磨的任務,十個 AI 助手也沒辦法改變「磨」這件事,就跟十個女人沒辦法一個月生出小孩一樣。而這也呼應目前的調查上,目前有 44.3% 的讀者用了 AI 之後工作量不減反增,真正省下的時間,很少變成「輕鬆」,而是被重新排進更多任務裡。管理者把 AI 當成人力乘數,但乘出來的常常不是產出,而是期待。 目前已經有 300+ 位讀者留下了自己的答案,

lock-1