「Gemini Who?」Meta 突襲全面釋出 Muse Spark 1.3 Max!Alexandr Wang 親證程式與 Agent 能力大爆發,力壓 GPT-5.6 與 Claude

在歷經嚴密安全評測後,Meta 旗艦推理模型 Muse Spark 1.3 Max 於 9 月 5 日正式對外公開。Meta 首席 AI 官 Alexandr Wang 直言其 Coding 與 Agent 表現大幅躍進,全面叫陣 OpenAI 與 Anthropic。

Share
Meta Muse Spark 1.3 Max 旗艦 AI Agent 模型官方發布視覺
Meta 於 2026 年 9 月 2 日發布 Muse Spark 1.3,並於 9 月 5 日由首席 AI 官 Alexandr Wang 宣布全網解禁頂規極限推理版 Max。 圖片來源:Meta AI Research(https://research.meta.ai/blog/introducing-muse-spark-1-3)
「我們剛剛正式向公眾釋出了 Muse Spark 1.3 Max!
我們在 Muse Spark 1.3 Max 上看見了顯著更強的程式編寫(Coding)與自主代理(Agentic)性能。因此,即使你先前已經嘗試過 Muse Spark 1.3 High 或 xHigh,我依然強烈建議你一定要親自體驗看看 Max。」
—— Meta 首席 AI 官 Alexandr Wang 於社群平台 X(Twitter)發表之重大聲明

2026 年 9 月 5 日,全球 AI 戰場再次迎來巨震。

繼三天前(9 月 2 日)Meta 剛發布新一代專門針對長時間軟體工程與自主工作流打造的旗艦模型 Muse Spark 1.3 後,Meta 首席 AI 官、Scale AI 創辦人 Alexandr Wang 今日在社群平台 X 上正式宣布:具備最強極限推理模式的頂規旗艦版「Muse Spark 1.3 Max」正式解除合作夥伴限定預覽,向所有開發者全面公開!

這項消息之所以震撼業界,原因在於 9 月 2 日 Meta 首波釋出時,僅開放了較為輕量、速度導向的 xHighHigh 推理模式,而官方評測中各項「屠榜」的驚人成績——包括在長程軟體工程基準 DeepSWE v1.1 寫下 75.4% 歷史新高、百萬 Token 長上下文資訊檢索取得 98.1% 的關鍵核心——全部都來自這個被 Meta 內部視為「秘密武器」的 Max 推理模式。

更令人矚目的是 Alexandr Wang 本人的強硬表態。在幾天前 Google 甫發表新模型時,這位年僅 29 歲、掌管 Meta 萬億 AI 帝國的掌舵者,就曾在 X 上毫不留情地嘲諷寫下:「我真的很不想這麼說,但……Gemini 是誰啊?(Gemini who? 🏎️)」

如今,隨著 Max 版本的全網解禁,Meta 不再只是隔空喊話,而是端出了足以直接撼動 OpenAI GPT-5.6 Sol 與 Anthropic Claude Opus 5 王座的硬實力。


快速重點摘要(TL;DR)

  1. 全面公開釋出:原先因安全測試而僅對少數戰略夥伴開放的 Muse Spark 1.3 Max 推理模式,於 2026 年 9 月 5 日正式對外全面上線,開發者可直接透過 Meta 官方終端機代理 Muse Code 以及 Meta Model API 啟用。
  2. 軟體工程基準奪冠:在權威長程軟體工程基準 DeepSWE v1.1 中,Muse Spark 1.3 Max 繳出了高達 75.4% 的解決率,一舉超越 Anthropic 的 Claude Opus 5(74.0%)與 OpenAI 的 GPT-5.6 Sol(73.0%),登頂當前 Coding Agent 榜首。
  3. 百萬 Token 記憶之王:具備 100 萬 Token(1M)超大上下文視窗,在 512K~1M 區間的跨文檔檢索測試(MRCR v2)中斬獲 98.1% 的恐怖精準度,大幅甩開 GPT-5.6 Sol 的 73.8%,幾乎徹底根治「大海撈針」遺忘症。
  4. 資源與步驟消耗大幅優化:相較於前代 Muse Spark 1.2,1.3 版本在完成相同難度的專案時,平均減少了約 20% 的外部工具呼叫次數,以及省下 25% 的 Token 消耗,兼顧效能與長期運作成本。
  5. 工作紀律重大演進:不同於過去 LLM 常見的「瞎猜盲幹」、「卡關不敢說」或「偽造完成」,Muse Spark 1.3 內建了主動回報卡關、遇到歧義主動詢問使用者,以及在執行刪檔、部署等高危險終端指令前「主動請求授權」的 Agent 協作機制。
  6. Meta 的百億豪賭迎來收穫期:這是 Alexandr Wang 於 2025 年中獲 Mark Zuckerberg 斥資 143 億美元延攬、主導創立「Meta 超智慧實驗室(MSL)」以來最重大的一役,象徵著 Meta 從過去 Llama 時代的純開源策略,全面切入閉源商業級個人超智慧(Personal Superintelligence)的主戰場。

緣起:一場價值 143 億美元的路線重組

要理解 Muse Spark 1.3 Max 為何能讓 Meta 在矽谷揚眉吐氣,必須把時間撥回 2025 年年中。

當時的 Meta 正面臨嚴重的戰略焦慮。儘管開源的 Llama 家族為 Meta 贏得了全球開發者的掌聲,但在邁向通用推理與頂尖 Agent 能力的過程中,據傳內部的 Llama 4 表現未達預期,且開源架構難以支撐百億美元級別的長期專案推演與高強度運算閉環。

馬克·祖克柏(Mark Zuckerberg)做出了一個震驚科技圈的激進決策:斥資 143 億美元收購全球頂尖 AI 標註與數據巨頭 Scale AI 49% 的股權,並將 Scale AI 年僅 28 歲的傳奇創辦人 Alexandr Wang「連人帶架構」請進 Meta,擔任公司史上首位首席 AI 官(Chief AI Officer)

在 Alexandr Wang 麾下,Meta 整合資源成立了超智慧實驗室(Meta Superintelligence Labs, MSL),對底層數據管線、合成數據(Synthetic Data)生成、多 Agent 強化學習環境進行了徹底的「地基重構」。

2026 年春季,MSL 拿掉了過去 Llama 的標籤,端出了全新的原生多模態閉源推理模型系列——Muse Spark

Muse Spark 不再把重心放在「單次文字對話有多優雅」,而是專注於一個極端務實的目標:打造能夠在真實世界的檔案系統、終端機環境中,連續工作數小時甚至數天不偏航的「自主工程師(Agentic Engineer)」。

而今天全面解禁的 Muse Spark 1.3 Max,正是這場百億豪賭至今交出的最高規格成績單。


實測數據說話:Muse Spark 1.3 Max 到底強在哪?

在 Alexandr Wang 的推文中,他特別提到:「即使你已經試過 1.3 High 或 xHigh,也一定要試試 Max。」

究竟 High、xHigh 與 Max 的差別在哪?根據 Meta 官方釋出的評測報告以及獨立 AI 評測機構 Artificial Analysis 的最新綜合測試,答案就在於**「思考深度(Reasoning Effort)」「長程問題拆解能力」**。

1. 關鍵基準測試綜合比較

以下為 Muse Spark 1.3 與業界現役兩大天花板——OpenAI 的 GPT-5.6 Sol 以及 Anthropic 的 Claude Opus 5 的直面對決:

評測維度 / 測試項目 測試說明 Muse Spark 1.3 (Max) GPT-5.6 Sol (Max) Claude Opus 5 (Max) 勝出者與意義
DeepSWE v1.1 真實開源軟體長程修復(零污染) 75.4% 73.0% 74.0% Meta 領先:首度在純軟體工程任務超車 Anthropic
Terminal-Bench 2.1 終端機指令與環境操作 88.8% 88.8% 86.7% Meta / OpenAI 並列:頂級命令列操作能力
SWE-Atlas Codebase QnA 百萬行超大型程式庫脈絡理解 59.4% 53.5% 52.7% Meta 大幅領先:跨檔案依賴與架構理解最佳
MRCR (512K~1M) 超長上下文多跳檢索精準度 98.1% 73.8% 未提供 Meta 斷崖式領先:百萬 Token 內幾無遺忘
Artificial Analysis Index 獨立第三方綜合智力指數 62 61 63 第一梯隊:僅次於 Claude Opus 5 與 Claude Fable 5.1
GDPVal-AA v2 真實跨領域專業工作產出評估 1,754 1,710 1,824 Anthropic 領先:一般商業文書 Opus 5 仍最成熟
DeepSearchQA 複雜多步網路深度研究 89.4% 93.0% 90.4% OpenAI 領先:網路檢索整合仍是 GPT 強項
OSWorld 2.0 跨作業系統 GUI 視覺自動化操作 66.9% 62.7% 68.3% Anthropic 領先:電腦螢幕操作 Opus 5 略高一籌
Muse Spark 1.3、Muse Spark 1.2、GPT-5.6 Sol 與 Claude Opus 5 官方評測對比圖
官方基準評測成績單:Muse Spark 1.3 在 DeepSWE v1.1、SWE-Atlas 程式庫問答與 1M 長上下文檢索領先,但在專業文件產出與一般搜尋上與競品互有勝負。 圖片來源:Meta AI Research

2. 解讀關鍵戰場:為什麼 DeepSWE v1.1 如此重要?

過去許多模型在 SWE-bench 刷分時,往往存在「訓練集資料污染(Contamination)」的疑慮——模型可能只是記住了 GitHub 上某個著名 Issue 的 Pull Request,而不是真正靠邏輯解決問題。

DeepSWE v1.1 則是為了防範作弊而設計的新一代基準測試:

  • 所有題目均由專業工程師在閉門環境中從最新、持續維護的開源專案中提取。
  • 具備完整的行為驗證器(Behavioral Verifier),模型必須自己讀懂 Repo、找出 Bug、修改跨模組程式碼、自行撰寫並通過單元測試。
  • 任務往往需要 30~80 步以上的連續操作,極度考驗模型是否會在中途迷失方向。

Muse Spark 1.3 Max 跑出的 75.4%,代表在真實世界的軟體修復中,它已經能全自動解決四分之三的真實問題,正式跨過了「玩具」與「可用生產力工具」的黃金分水嶺。


Muse Spark 1.3 根據工程檔案建立 X-Wing 流體力學模擬報告的官方示例
Meta 官方長程工程任務展示:Muse Spark 1.3 自主讀取複雜數據、執行多步驟計算並產出格式完整的專業 PDF 報告。 圖片來源:Meta AI Research

技術內幕:Max 版本如何解決 AI Agent 的四大絕症?

許多工程師在日常使用 Claude Code 或 Cursor 時,最常遇到的挫折往往不是「模型寫不出這段迴圈」,而是 Agent 在長時間運作時展現的惡劣習慣。

Meta Superintelligence Labs 在 1.3 版本,尤其是 Max 推理模式中,重點修復了以下四個痛點:

痛點一:任務做久了就「忘記初衷」(Goal Drift)

在過去,當一個任務跨越 20 次工具呼叫、修改了 10 個檔案後,模型往往會忘記最初 Prompt 裡規定的「不要改動既有 API 介面」或「所有註解必須符合特定格式」。

Muse Spark 1.3 Max 的解法: 結合了 1M 超大上下文視窗與新型態的動態目標錨定機制(Dynamic Goal Anchoring)。模型會在內部維持一個獨立的「進度狀態機」,即便在深度的除錯分支中穿梭,也能隨時將目前的檔案狀態與根目錄需求進行自我對齊。

痛點二:遇到卡關「硬猜硬做」,製造更多 Bug

舊款 LLM 最致命的弱點就是過度自信。當它在終端機遇到一個沒看過的環境變數錯誤或相依套件版本衝突時,它會胡亂安裝新的套件、甚至偷偷刪改使用者寫好的邏輯,最後把整個環境搞崩。

Muse Spark 1.3 Max 的解法: 導入了主動求助協定(Clarification & Escalation Protocol)。在 Max 推理模式下,模型被賦予了強大的「自我懷疑(Self-Doubt)」邏輯。一旦偵測到兩次工具呼叫皆因不可抗力失敗,或者發現使用者的原始 Prompt 存在前後矛盾的歧義,它會主動暫停運作,在終端機列出三種可能的方案,主動請求使用者決策。

痛點三:黑天鵝指令的「誤刪與越權」

讓 AI Agent 在終端機具備 Bash 執行權限是一件極度危險的事。許多工程師都曾遇過 Agent 擅自執行 git reset --hard 或清空資料庫的災難。

Muse Spark 1.3 Max 的解法: 內建了語義級的後果影響評估(Consequence Auditing)。在執行包含刪除(rm)、資料表變更、遠端推播(git push)或環境部署等不可逆操作前,Max 模型會主動中斷並產出一份變更影響報告,強制等待人類點擊確認。

痛點四:Token 浪費與工具呼叫冗餘

過去很多 Agent 動輒呼叫 lsgrep 數十次,甚至把整個數十萬行的編譯記錄重複讀進 Context,導致單次任務成本暴增幾十美元。

Muse Spark 1.3 的優化: MSL 透過高品質的 Agent 軌跡訓練,使模型學會了精確定位。相較於 1.2 版本,工具呼叫次數直接砍掉 20%,Token 消耗下降 25%。這意味著相同的任務,等待時間更短、API 帳單更便宜。


0:00
/0:00

Meta 首席 AI 官 Alexandr Wang 於 X 平台發布實機演示影片,宣布 Muse Spark 1.3 Max 正式全面上線,強烈推薦開發者體驗極限推理帶來的巨大躍進。 影片來源:Alexandr Wang 官方 X 貼文

震撼展示:從文字 Prompt 到可玩的 3D 遊戲與樂器調音器

在推特與 YouTube 等社群平台上,跟隨 Alexandr Wang 的宣布,Meta 官方與首批測試開發者釋出了一系列令人瞠目結舌的 Muse Spark 1.3 Max 端到端實測案例

這些展示不是單純由前端生出幾行 HTML/JS,而是由 Muse Code 代理在本地端全自動規劃、編譯、串接音訊與物理引擎的完整專案:

案例一:《Psychic Storm》即時戰略遊戲(RTS)

開發者只給予了一段核心玩法需求,Muse Spark 1.3 Max 花費了約 18 分鐘,在終端機內自主完成了:

  • 基地建造系統與採礦資源(Ore)循環。
  • 單位生產佇列(士兵與坦克物理碰撞)。
  • 迷霧系統(Fog of War)與簡易的敵方尋路 AI。
  • 完整的多檔案架構拆解與打包編譯。

案例二:《Stimm》專業級麥克風吉他調音器

這個專案展示了其多模態與底層系統呼叫的結合能力:

  • 透過 Web Audio API 串接實體麥克風輸入。
  • 自行實作快速傅立葉轉換(FFT)音訊演算法,精準偵測當前撥弦的音高頻率(Hz)。
  • 繪製出流暢的頻閃指針(Strobe Tuner)UI,誤差控制在 ±1 音分以內。

案例三:《Startup City 3D》創業大富翁模擬器

一個以矽谷新創為背景的 3D 地產養成遊戲:

  • 結合了 Three.js 建立 3D 棋盤與街區。
  • 設計了融資、獵人頭、產品發布與隨機事件(如「伺服器當機修復區」等趣味懲罰)。
  • 整個遊戲的狀態管理與資料持久化完全由模型獨立架構完成。

開發者該如何上手?Muse Code vs. Meta Model API

目前想要體驗 Muse Spark 1.3 Max 的威力,主要有兩種管道。你可以根據自身的使用情境進行選擇:

快速決策矩陣:哪種管道適合你?

使用情境與需求 推薦工具管道 核心啟動參數 適用工作特色
本機專案開發與終端機除錯 Muse Code CLI
(Meta 官方終端機 Agent)
--reasoning max • 直接存取本機專案資料夾與檔案庫
• 自動跑編譯測試與 Git 狀態管理
• 高危險操作(刪檔、部署)強制主動確認
產品功能整合與自動化 Agent 流水線 Meta Model API
(雲端 API 端點串接)
reasoning_effort: "max" • 適合自建後端系統、批次程式碼審查
• 支援標準 Python/Node SDK 結構化調用
• 整合至 CI/CD 自動產生修正 PR

兩條實務啟用路徑:

  1. 路徑 A(個人工程師本機開發)
    本機終端機 ➔ 啟動 muse --model muse-spark-1.3 --reasoning max ➔ 模型自主讀取 Repo 與測試 ➔ 提出修改方案並主動請求確認。
  2. 路徑 B(企業架構與產品整合)
    企業應用後端 ➔ 發送請求至 Meta Model API (reasoning_effort="max") ➔ 雲端深度推導 ➔ 結構化回傳修復補丁與分析報告。

1. 終端機開發者:使用 Muse Code

如果你是習慣在命令列作業的工程師(類似使用 Claude Code 或 Aider),你可以直接在終端機啟動 Muse Code:

# 確保 Muse Code 更新至最新版本
npm install -g @meta/muse-code@latest

# 切換到你的專案目錄,並指定使用 max 推理模式啟動
cd my-large-project
muse --model muse-spark-1.3 --reasoning max

在互動介面中,你可以直接輸入複雜的架構重構任務,例如:

「請檢視 /src/services 下的所有資料庫呼叫,將原本的 ORM 替換為新版的異步驅動,並為每個修改後的模組補齊整合測試,確保 npm test 通過。」

2. 架構師與產品團隊:串接 Meta Model API

如果你正要打造自家的客服 Agent、金融分析機器人或自動審查流水線,可以透過標準的 SDK 呼叫:

import meta_ai_sdk

client = meta_ai_sdk.Client(api_key="YOUR_META_API_KEY")

response = client.chat.completions.create(
    model="muse-spark-1.3",
    reasoning_effort="max",  # 指定開啟 Max 極限推理
    messages=[
        {"role": "system", "content": "你是一位嚴謹的高階軟體架構師,在執行不可逆操作前必須提示確認。"},
        {"role": "user", "content": "這是包含 10 個微服務的架構描述與報錯紀錄,請找出潛在的死結問題並提出修正 PR。"}
    ]
)

print(response.choices[0].message.content)

策略剖析:開源巨人轉向閉源,社群怎麼看?

Muse Spark 1.3 Max 的強勢問世,在矽谷引發了兩極化的討論。

一方面,工程界普遍驚艷於 Meta 的追趕速度。在 2024 年底至 2025 年初,業界普遍認為 OpenAI(GPT-5 系列)與 Anthropic(Claude 3.5/3.7/5 系列)在程式推理與 Agentic 架構上築起了極高的技術護城河;如今,Alexandr Wang 僅用了一年時間,就帶領 MSL 把差距徹底弭平,甚至在長上下文與 DeepSWE 等硬核指標上取得超前。

但另一方面,開源社群(Open Source Community)卻充滿了失落與疑慮

過去,Meta 被視為對抗閉源巨頭的「普羅米修斯」,Llama 系列開放權重的做法,推動了整個開源生態圈的繁榮。然而:

  1. Muse Spark 系列目前均為純閉源商業 API,參數不對外公開,這打破了 Meta 過去幾年建立的開源人設。
  2. 雖然 Meta 曾釋出 30B 規模的小型常駐模型 Muse Glimmer(採用 Apache 2.0 授權),但其能力與旗艦級的 Spark 1.3 Max 有著明顯代差。
  3. 官方雖然暗示未來「規劃中」會有開放權重的版本,但何時推出、會不會閹割關鍵推理架構,目前均未給出承諾。

Alexandr Wang 對此的邏輯非常直白:「超級智慧(Superintelligence)的研發與對齊,需要難以想像的算力回報閉環。」 當對手已經將模型推理成本拉升到每次任務耗費數百美元時,想要維持在最前線,Meta 就必須建立自己的企業級商業引擎。


開發團隊該立刻更換嗎?實務評估與建議

面對 Alexandr Wang 的大力推薦,一般企業與開發團隊該如何抉擇?雷司紀給出以下客觀建議:

適合立即切入的三大場景:

  1. 超過 50 萬 Token 的巨型專案分析:若你需要 AI 閱讀整套龐大的歷史 Legacy Code,或者一次餵入幾十篇法規與財務財報,Muse Spark 1.3 在 1M 上下文上的檢索穩定度(98.1%)顯著優於競品。
  2. 端到端無人值守的長程自動修復:如果你的 CI/CD 流程正打算導入自動修復 Bug 的 Agent,DeepSWE 75.4% 的成績代表它能顯著降低人工作業時間。
  3. 終端機環境重度使用者:Muse Code 結合 1.3 Max 的工作紀律(遇到問題主動求助、危險操作主動確認),比很多只會一味輸出的外掛更加安全。

建議暫緩或維持現狀的情境:

  1. 純日常寫作、行銷文案與社群對話:如果只是拿來改信件、寫摘要,GPT-5.6 或 Claude Opus 5 在語意自然度與多樣性上依然非常成熟,沒必要為了過剩的程式推理能力支付高昂成本。
  2. 對延遲極度敏感的即時互動Max 推理模式本質上是在背後執行多輪「思考與蒙地卡羅樹搜尋」,單次回答可能需要數十秒的思索時間。如果是即時客服,應選擇 xHigh 或其他低延遲模型。
  3. 有本機離線與資料不出境合規需求:因為 Muse Spark 1.3 只能透過雲端 API 調用,受限於嚴格資料合規的金融、國防企業,現階段仍應維持地端私有化模型(如 Mistral 或 Llama 舊版微調)。

常見問題(FAQ)

Q1:Muse Spark 1.3 Max 是免費的嗎?收費標準如何?

A:不是免費的。在 Muse Code 內需綁定 Meta 開發者帳號計費,或透過 Meta Model API 按 Token 收費。Max 模式由於思考過程會產生額外的 Reasoning Token(隱藏推導標記),整體單次任務的計費會高於 xHigh。建議初期先以固定小專案驗證投資回報率。

Q2:我該用 xHigh 還是 Max

A

  • 日常任務(開新功能小組件、修改單一檔案、排查一般報錯):使用 xHigh 即可,速度快且成本更低。
  • 架構級任務(大型重構、複雜環境設定、跨模組未知 Bug、非典型演算法設計):切換至 Max,讓模型啟動最深度的思考鏈。

Q3:Alexandr Wang 說的「Gemini Who」是認真的嗎?

A:這帶有矽谷典型的行銷與公關叫陣意味。客觀來說,Google 的 Gemini 系列在超長影音多模態分析與 Google 生態系(Docs/Drive)整合上依然擁有無可取代的優勢;但若單純聚焦於「軟體工程(Coding Agent)」這條賽道,Meta 的 Muse Spark 1.3 Max 確實展現了足以讓任何對手流冷汗的強大競爭力。


總結:AI Agent 競爭進入「工作紀律」新維度

Alexandr Wang 這次高調釋出 Muse Spark 1.3 Max,給整個 AI 產業帶來了一個關鍵啟示:

「AI 寫程式」的軍備競賽,已經正式告別了單純比拼「誰能寫出更短的 LeetCode 解法」的初級階段,正式跨入了「誰能勝任全天候軟體工程師工作紀律」的深水區。

當一個模型能夠自我克制過度自信、能在面對混亂環境時維持清醒、能在採取破壞性動作前停下來詢問人類——這種「工程素養」,遠比跑分榜上小數點後一兩位的差距更具備商業價值。

矽谷的這場超級智慧爭奪戰,才剛剛進入最精采的下半場。


資料來源與延伸閱讀

Read more