Qwen3.8-Max 發布:2.4 兆參數、Max 級開放權重,真正重點是長時間 AI Agent

Qwen3.8-Max 不只追求回答更難的問題,而是要讓 AI Agent 持續工作數小時甚至數天。一次看懂 2.4 兆參數、官方評測、API 與開放權重時程。

Share
Qwen3.8-Max 官方發布封面圖
Qwen3.8-Max 於 2026 年 8 月 3 日推出,主打 Coding、Cowork、長時間任務與多模態 Agent。圖片來源:Qwen 官方。

Qwen 團隊在 2026 年 8 月 3 日正式推出 Qwen3.8-Max。它是目前 Qwen 系列能力最高的模型,總規模達 2.4 兆參數,每次推論啟用其中 950 億參數,主打程式開發、知識工作、長時間任務與多模態 Agent。

這次最容易被忽略的訊息,是 Qwen 首度承諾開放 Max 級模型權重。不過時間點要說清楚:目前已上線的是 QwenCloud 雲端版本,官方預告權重將在下週釋出。至少在 2026 年 8 月 3 日,還不能把它寫成「已經可以下載到本機的開源模型」。

我的判斷是,Qwen3.8-Max 真正值得注意的不是 2.4 兆這個大數字,而是模型競爭開始從「一次回答有多聰明」,移向「能不能持續工作、使用工具、看見錯誤,再把成果修到能交付」。如果官方案例能在第三方環境重現,它會是開放權重 Agent 模型的重要節點;在那之前,最合理的做法仍是拿自己的真實工作測試,不要只看排行榜換模型。

Qwen3.8-Max 與其他前沿模型的官方效能比較圖
官方比較涵蓋 Coding、工作與一般能力;各 benchmark 的執行框架與來源不完全相同,不能視為單一公平總排名。圖片來源:Qwen 官方。

Qwen3.8-Max 是什麼?先看懂 2.4 兆與 950 億參數

Qwen3.8-Max 延續 Qwen3.5 的架構,採用混合專家模型(Mixture of Experts,MoE)。MoE 可以想成公司裡有很多不同專長的小組,收到任務時只叫最適合的幾組上場,而不是讓所有人同時工作。

因此,2.4 兆是模型擁有的總參數,950 億則是處理一次輸入時實際啟用的參數。這種設計希望同時擴大模型容量,又避免每次推論都動用全部計算資源。

項目 Qwen3.8-Max 官方資訊 對使用者的意義
模型規模 2.4 兆總參數、950 億活躍參數 規模很大,但每次推論不會使用全部參數
核心能力 Coding、Work、長時間任務、多模態 Agent 重點從聊天回答轉向完成整段工作流程
輸入 文字與圖片 可同時處理程式、文件、畫面與視覺操作
上下文視窗 官方設定範例列出 100 萬 Token 能在同一任務中保留更多程式、文件與操作紀錄
使用方式 QwenCloud API 目前可先用雲端版本測試
模型權重 預告 2026 年 8 月的下一週釋出 授權、本機需求與部署成本仍要等權重正式公布

上下文視窗(context window)是模型一次能讀取與保留的資訊量。100 萬 Token 不代表模型能完美記住每個細節,但對大型程式庫、數百頁文件與長時間 Agent 紀錄很重要,因為任務不必太早切斷或壓縮背景資料。

我對規格的看法偏正面,但不會把參數量當成能力排名。對實際工作來說,完成率、錯誤恢復、工具相容性、延遲與成本,通常比總參數更直接。

最大升級不是寫程式,而是能持續把專案做下去

現在的 Coding Agent 不只要補一個函式,還要讀懂需求、修改多個檔案、執行測試、處理失敗,再交出可以驗收的成果。Qwen 官方用三個長時間案例說明 Qwen3.8-Max 的方向。

第一個案例是從零建立 oh-my-cli。模型把 GitHub Issue、工作派送、程式修改、測試、預覽與 Log 串成迴圈。官方表示,截至 2026 年 7 月 30 日,專案經過約 16 天自主運作後,已累積 265 次 commit、127 個 PR 與 151 個 issue。這個公開 GitHub 儲存庫確實能看到程式碼、自主工作規則與 Issue 流程,讓案例不只停留在展示影片。

Qwen3.8-Max 在長時間任務中串接需求、Issue、程式修改、測試與自我修正。影片來源:Qwen 官方。

第二個案例更接近 AI 研究員。Qwen3.8-Max 只拿到一篇資料選擇研究論文與 GPU,便自行建立資料處理、訓練與評估流程。官方稱它連續工作約 125 小時、寫下約 7,600 行程式並執行 33 次 GPU 訓練,先重現論文,再提出 18 個改進方向,把 AIME24 數學評測從 49.58% 提高到 52.29%。

第三個案例是 24 小時的多模態競賽。模型完成 45 次提交,把文字模型與視覺模型組成投票系統,最終準確率達 0.853,超過 526 支參賽隊伍中的 458 隊。

三個案例共同說明一件事:Qwen3.8-Max 不只是先列計畫再照表執行,而是根據測試、訓練結果與競賽分數反覆改變下一步。這種「行動—回饋—修正」迴圈,才是長時間 Agent 與一般聊天模型的主要差別。

但公開儲存庫存在,不等於所有長任務數字都已被獨立驗證。研究重現與競賽過程仍主要來自 Qwen 官方敘述,因此它們適合用來理解模型方向,不適合直接當成自家專案也能得到相同效率的保證。

Cowork 能力:Qwen 想處理的是整個工作流程

Qwen3.8-Max 的另一條主線是 Cowork,也就是讓 AI 不只產生文字,而是操作檔案、工具與介面,完成一組相互依賴的工作。

官方訓練時同時擴大任務、工作區與 Agent 執行環境,並讓模型在 QwenWork、Claude Code、Codex、OpenClaw 與 Hermes 等不同工具框架中練習。Agent 執行環境可以理解成模型工作的「操作台」,決定它能讀哪些檔案、呼叫哪些工具,以及怎麼取得測試回饋。

Qwen 展示的工作橫跨法務文件檢查、UI/UX 原型、餐廳菜單、結構工程、復健解說與運動數據分析。這些案例的價值不在職業數量,而是輸入與輸出都很複雜:模型要讀大量異質檔案,接著產生報告、網頁、3D 視覺或可互動成果。

Qwen3.8-Max 隨強化學習環境擴大而提升工作評測分數的官方圖表
Qwen 官方表示,擴大任務、工作區與工具環境後,多項工作評測同步提升。圖片來源:Qwen 官方。

這個方向對企業很實際。單次回答再好,如果員工仍要手動下載資料、轉換格式、貼進另一套軟體,再逐項確認結果,節省的時間有限。能把工具串起來,才有機會壓縮完整流程。

官方展示 Qwen3.8-Max 在法務、設計、餐飲、工程與數據分析等工作流程中的應用。影片來源:Qwen 官方。

風險也在同一個地方。Agent 能操作的工具越多,權限錯誤、資料外洩與錯誤執行的影響就越大。正式導入時不能只測答案品質,還要限制可寫入的範圍、保留操作 Log,並把付款、發布、刪除與正式部署放在人工核准之後。

多模態 Agent:視覺不只用來看,也用來自我檢查

Qwen3.8-Max 可以處理圖片、文件與長影片,但官方這次想強調的不是「看圖回答」,而是讓視覺能力貫穿任務。

Qwen3.8-Max 使用視覺理解、操作與回饋完成文件、影片、介面與 3D 工作。影片來源:Qwen 官方。

例如模型從一張介面截圖重建前端時,會先寫程式,再觀察實際渲染結果。如果版面錯位、物件方向不對或互動結果不符合需求,它能把看到的差異變成下一輪修改。換句話說,視覺成為 Agent 的測試工具,而不只是輸入格式。

官方也公布 Qwen-MM-Plugins,讓既有 Agent 框架加入圖片與影片處理、多模態記憶、視覺工具操作,以及影片剪輯、Blender 和 CAD 等能力。這代表 Qwen 不只推出一個模型,也在補齊模型進入實際工作所需的工具層。

這條路線值得看好,因為很多工作無法只靠文字驗收。網頁是否跑版、3D 物件是否轉錯方向、影片剪接是否卡頓,都需要模型看見中間成果。不過視覺自我檢查仍可能漏掉人類也不容易察覺的錯誤,醫療、工程與金融文件尤其不能只靠模型自行驗收。

Qwen3.8-Max 評測有多強?看項目,也要看測試條件

Qwen 公布了大量 benchmark。Benchmark 是用固定題目或任務比較模型能力的評測。以下挑出幾個與實際工作較接近的項目:

評測 Qwen3.7 對照成績 Qwen3.8-Max 主要測量能力
Terminal Bench 2.1 74.5 86.6 在終端機完成真實工作
PaperBench 64.8 93.0 重現 AI 研究論文
CoWorkBench 64.6 74.8 跨領域長流程工作
JobBench 31.3 53.4 職業任務完成能力
WideSearch 75.2 81.9 大範圍搜尋與整理
IFBench 79.1 82.8 指令遵循

多模態部分,Qwen3.8-Max 在 OSWorld-Verified 得到 86.1、OmniDocBench 1.5 得到 92.1,OCR-Bench-V2 的英文與中文成績分別為 74.2 與 68.3。這些結果支持模型在電腦操作、文件理解與 OCR 上確實有進步。

不過,不能把這張表濃縮成「全面打敗所有模型」。官方完整表格中,Qwen3.8-Max 在 PaperBench、WideSearch、OSWorld-Verified 等項目領先,但在 SWE-bench Pro、DeepSWE、HLE 與部分網頁操作評測仍落後其他前沿模型。

更重要的是,評測條件並不完全相同。有些成績來自公開排行榜,有些由 Qwen 自行測試;不同模型也可能使用 Claude Code、Codex、OpenCode 或 Qwen-Agent 等不同執行框架。表格中還包含 Qwen 自建的內部 benchmark。這些數字能指出強項,卻不能取代同一環境、同一預算與同一任務下的比較。

我的結論是中性偏多:Qwen3.8-Max 的進步不只出現在單一榜單,長任務、文件、電腦操作與指令遵循都有訊號;但要證明它能穩定替代既有模型,還需要第三方重現與企業自己的失敗案例。

Qwen3.8-Max 怎麼用?目前先走 QwenCloud API

Qwen3.8-Max 已可透過 QwenCloud 使用,API 型號為 qwen3.8-max。官方支援 OpenAI 相容的 Chat Completions、Responses API,以及 Anthropic 相容介面,因此既有應用不一定要重寫整套串接。

模型提供三種推理強度:

  • low:優先速度與成本,適合分類、整理與規格清楚的任務。
  • medium:在品質與速度之間取得平衡,適合日常開發與文件工作。
  • xhigh:預設值,適合需要深入分析的複雜任務。

推理強度越高,通常需要更多時間與計算。最實際的做法不是所有工作都開 xhigh,而是先把任務分級。固定格式轉換用 low,一般 Agent 工作從 medium 開始,只有高風險決策或多步驟研究才使用 xhigh

官方也提供 Claude Code、Codex、Qoder、Qwen Code 與 OpenClaw 的設定方式。這對團隊的意義是,Qwen3.8-Max 可以成為既有 Agent 工具中的另一個模型供應商,而不是要求所有人改用新的工作介面。

Qwen3.8-Max 在 QwenWork、Claude Code、Codex、OpenClaw 與 Hermes 的官方比較圖
Qwen3.8-Max 被訓練在多種 Agent 執行框架中工作;實際成果仍會受到工具版本、權限與任務設定影響。圖片來源:Qwen 官方。

Qwen3.8-Max 已經開源了嗎?現在還差最後一步

Qwen 官方把這次發布稱為首個 Max 級開放權重模型,但公告同時明確寫出:權重將於下週在 Hugging Face 與 ModelScope 釋出。

因此目前的正確狀態是「雲端模型已可用,開放權重已預告,但尚未完成」。權重正式出現後,還要再確認授權條款、可下載版本、量化格式、推論框架與硬體需求。開放權重也不必然等於任何用途都可無限制商用,最終仍以模型卡與授權文件為準。

這一步很重要。對大型企業與研究團隊來說,能不能在自己的環境部署,關係到資料治理、客製化與供應商依賴;對一般個人開發者來說,2.4 兆總參數也意味著完整版不會是普通電腦輕鬆執行的模型。後續是否提供較小版本、量化權重與實際硬體門檻,會直接影響它的開放價值。

Qwen3.8-Max 值得用嗎?先用四個指標做小規模測試

Qwen3.8-Max 值得程式開發、研究、文件處理與多模態工作團隊測試。它最有吸引力的情境,不是問答,而是原本需要人類在多個工具之間反覆操作、耗時數小時以上的工作。

但我不建議直接把正式流程切換過去。先挑 10~20 個代表性任務,固定輸入、工具權限與驗收標準,再比較四個指標:

  1. 任務完成率,而不是文字看起來多完整。
  2. 人工接手次數,包括補資料、改方向與重跑測試。
  3. 從開始到可交付的總時間,而不是第一段回應速度。
  4. 完整成本,包括模型用量、工具與人工審查時間。

如果 Qwen3.8-Max 能在這四項穩定降低總成本,再擴大導入才有意義。若只是榜單分數高,卻常在最後一步需要人類收尾,那它仍是一個能力很強的助手,不是可靠的無人工作系統。

FAQ

Qwen3.8-Max 是誰開發的?

Qwen3.8-Max 由阿里巴巴 Qwen 團隊開發,於 2026 年 8 月 3 日正式公布。它是目前 Qwen 系列的 Max 級旗艦模型。

Qwen3.8-Max 有多少參數?

官方公布模型共有 2.4 兆參數,每次推論啟用 950 億參數。兩個數字不同,是因為它採用 MoE 架構,只會針對任務啟用部分專家網路。

Qwen3.8-Max 已經開源嗎?

2026 年 8 月 3 日雲端版本已經推出,但權重尚未正式釋出。Qwen 預告將於下一週在 Hugging Face 與 ModelScope 開放,授權與部署細節要以正式模型卡為準。

Qwen3.8-Max 可以在 Codex 或 Claude Code 使用嗎?

可以。QwenCloud 提供 OpenAI Responses 與 Anthropic 相容介面,官方文章也列出 Codex 與 Claude Code 的設定方法。實際使用前仍要建立 QwenCloud API Key,並依所在區域選擇正確端點。

Qwen3.8-Max 的上下文視窗多長?

Qwen 官方提供的工具設定範例列出 100 萬 Token context window。長上下文適合大型程式庫與大量文件,但不代表放入越多內容就一定越準,仍需控制資料品質與任務結構。

Qwen3.8-Max 比 Claude 或 GPT 更強嗎?

不能用單一句話回答。Qwen3.8-Max 在 PaperBench、WideSearch、OSWorld-Verified 等項目表現突出,但其他模型在 SWE-bench Pro、DeepSWE、HLE 與部分 Agent 評測仍領先。模型選擇應回到自己的任務、成本、速度與穩定度。

哪些人最適合先測 Qwen3.8-Max?

需要處理大型程式庫、研究流程、數百頁文件、視覺操作或長時間工具任務的團隊最適合。若只是短問答或固定格式內容,較小、較快的模型可能更省成本。

資料來源