Qwen3.8-Max 發布:2.4 兆參數、Max 級開放權重,真正重點是長時間 AI Agent
Qwen3.8-Max 不只追求回答更難的問題,而是要讓 AI Agent 持續工作數小時甚至數天。一次看懂 2.4 兆參數、官方評測、API 與開放權重時程。
Qwen 團隊在 2026 年 8 月 3 日正式推出 Qwen3.8-Max。它是目前 Qwen 系列能力最高的模型,總規模達 2.4 兆參數,每次推論啟用其中 950 億參數,主打程式開發、知識工作、長時間任務與多模態 Agent。
這次最容易被忽略的訊息,是 Qwen 首度承諾開放 Max 級模型權重。不過時間點要說清楚:目前已上線的是 QwenCloud 雲端版本,官方預告權重將在下週釋出。至少在 2026 年 8 月 3 日,還不能把它寫成「已經可以下載到本機的開源模型」。
我的判斷是,Qwen3.8-Max 真正值得注意的不是 2.4 兆這個大數字,而是模型競爭開始從「一次回答有多聰明」,移向「能不能持續工作、使用工具、看見錯誤,再把成果修到能交付」。如果官方案例能在第三方環境重現,它會是開放權重 Agent 模型的重要節點;在那之前,最合理的做法仍是拿自己的真實工作測試,不要只看排行榜換模型。

Qwen3.8-Max 是什麼?先看懂 2.4 兆與 950 億參數
Qwen3.8-Max 延續 Qwen3.5 的架構,採用混合專家模型(Mixture of Experts,MoE)。MoE 可以想成公司裡有很多不同專長的小組,收到任務時只叫最適合的幾組上場,而不是讓所有人同時工作。
因此,2.4 兆是模型擁有的總參數,950 億則是處理一次輸入時實際啟用的參數。這種設計希望同時擴大模型容量,又避免每次推論都動用全部計算資源。
| 項目 | Qwen3.8-Max 官方資訊 | 對使用者的意義 |
|---|---|---|
| 模型規模 | 2.4 兆總參數、950 億活躍參數 | 規模很大,但每次推論不會使用全部參數 |
| 核心能力 | Coding、Work、長時間任務、多模態 Agent | 重點從聊天回答轉向完成整段工作流程 |
| 輸入 | 文字與圖片 | 可同時處理程式、文件、畫面與視覺操作 |
| 上下文視窗 | 官方設定範例列出 100 萬 Token | 能在同一任務中保留更多程式、文件與操作紀錄 |
| 使用方式 | QwenCloud API | 目前可先用雲端版本測試 |
| 模型權重 | 預告 2026 年 8 月的下一週釋出 | 授權、本機需求與部署成本仍要等權重正式公布 |
上下文視窗(context window)是模型一次能讀取與保留的資訊量。100 萬 Token 不代表模型能完美記住每個細節,但對大型程式庫、數百頁文件與長時間 Agent 紀錄很重要,因為任務不必太早切斷或壓縮背景資料。
我對規格的看法偏正面,但不會把參數量當成能力排名。對實際工作來說,完成率、錯誤恢復、工具相容性、延遲與成本,通常比總參數更直接。
最大升級不是寫程式,而是能持續把專案做下去
現在的 Coding Agent 不只要補一個函式,還要讀懂需求、修改多個檔案、執行測試、處理失敗,再交出可以驗收的成果。Qwen 官方用三個長時間案例說明 Qwen3.8-Max 的方向。
第一個案例是從零建立 oh-my-cli。模型把 GitHub Issue、工作派送、程式修改、測試、預覽與 Log 串成迴圈。官方表示,截至 2026 年 7 月 30 日,專案經過約 16 天自主運作後,已累積 265 次 commit、127 個 PR 與 151 個 issue。這個公開 GitHub 儲存庫確實能看到程式碼、自主工作規則與 Issue 流程,讓案例不只停留在展示影片。
Qwen3.8-Max 在長時間任務中串接需求、Issue、程式修改、測試與自我修正。影片來源:Qwen 官方。
第二個案例更接近 AI 研究員。Qwen3.8-Max 只拿到一篇資料選擇研究論文與 GPU,便自行建立資料處理、訓練與評估流程。官方稱它連續工作約 125 小時、寫下約 7,600 行程式並執行 33 次 GPU 訓練,先重現論文,再提出 18 個改進方向,把 AIME24 數學評測從 49.58% 提高到 52.29%。
第三個案例是 24 小時的多模態競賽。模型完成 45 次提交,把文字模型與視覺模型組成投票系統,最終準確率達 0.853,超過 526 支參賽隊伍中的 458 隊。
三個案例共同說明一件事:Qwen3.8-Max 不只是先列計畫再照表執行,而是根據測試、訓練結果與競賽分數反覆改變下一步。這種「行動—回饋—修正」迴圈,才是長時間 Agent 與一般聊天模型的主要差別。
但公開儲存庫存在,不等於所有長任務數字都已被獨立驗證。研究重現與競賽過程仍主要來自 Qwen 官方敘述,因此它們適合用來理解模型方向,不適合直接當成自家專案也能得到相同效率的保證。
Cowork 能力:Qwen 想處理的是整個工作流程
Qwen3.8-Max 的另一條主線是 Cowork,也就是讓 AI 不只產生文字,而是操作檔案、工具與介面,完成一組相互依賴的工作。
官方訓練時同時擴大任務、工作區與 Agent 執行環境,並讓模型在 QwenWork、Claude Code、Codex、OpenClaw 與 Hermes 等不同工具框架中練習。Agent 執行環境可以理解成模型工作的「操作台」,決定它能讀哪些檔案、呼叫哪些工具,以及怎麼取得測試回饋。
Qwen 展示的工作橫跨法務文件檢查、UI/UX 原型、餐廳菜單、結構工程、復健解說與運動數據分析。這些案例的價值不在職業數量,而是輸入與輸出都很複雜:模型要讀大量異質檔案,接著產生報告、網頁、3D 視覺或可互動成果。

這個方向對企業很實際。單次回答再好,如果員工仍要手動下載資料、轉換格式、貼進另一套軟體,再逐項確認結果,節省的時間有限。能把工具串起來,才有機會壓縮完整流程。
官方展示 Qwen3.8-Max 在法務、設計、餐飲、工程與數據分析等工作流程中的應用。影片來源:Qwen 官方。
風險也在同一個地方。Agent 能操作的工具越多,權限錯誤、資料外洩與錯誤執行的影響就越大。正式導入時不能只測答案品質,還要限制可寫入的範圍、保留操作 Log,並把付款、發布、刪除與正式部署放在人工核准之後。
多模態 Agent:視覺不只用來看,也用來自我檢查
Qwen3.8-Max 可以處理圖片、文件與長影片,但官方這次想強調的不是「看圖回答」,而是讓視覺能力貫穿任務。
Qwen3.8-Max 使用視覺理解、操作與回饋完成文件、影片、介面與 3D 工作。影片來源:Qwen 官方。
例如模型從一張介面截圖重建前端時,會先寫程式,再觀察實際渲染結果。如果版面錯位、物件方向不對或互動結果不符合需求,它能把看到的差異變成下一輪修改。換句話說,視覺成為 Agent 的測試工具,而不只是輸入格式。
官方也公布 Qwen-MM-Plugins,讓既有 Agent 框架加入圖片與影片處理、多模態記憶、視覺工具操作,以及影片剪輯、Blender 和 CAD 等能力。這代表 Qwen 不只推出一個模型,也在補齊模型進入實際工作所需的工具層。
這條路線值得看好,因為很多工作無法只靠文字驗收。網頁是否跑版、3D 物件是否轉錯方向、影片剪接是否卡頓,都需要模型看見中間成果。不過視覺自我檢查仍可能漏掉人類也不容易察覺的錯誤,醫療、工程與金融文件尤其不能只靠模型自行驗收。
Qwen3.8-Max 評測有多強?看項目,也要看測試條件
Qwen 公布了大量 benchmark。Benchmark 是用固定題目或任務比較模型能力的評測。以下挑出幾個與實際工作較接近的項目:
| 評測 | Qwen3.7 對照成績 | Qwen3.8-Max | 主要測量能力 |
|---|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 | 在終端機完成真實工作 |
| PaperBench | 64.8 | 93.0 | 重現 AI 研究論文 |
| CoWorkBench | 64.6 | 74.8 | 跨領域長流程工作 |
| JobBench | 31.3 | 53.4 | 職業任務完成能力 |
| WideSearch | 75.2 | 81.9 | 大範圍搜尋與整理 |
| IFBench | 79.1 | 82.8 | 指令遵循 |
多模態部分,Qwen3.8-Max 在 OSWorld-Verified 得到 86.1、OmniDocBench 1.5 得到 92.1,OCR-Bench-V2 的英文與中文成績分別為 74.2 與 68.3。這些結果支持模型在電腦操作、文件理解與 OCR 上確實有進步。
不過,不能把這張表濃縮成「全面打敗所有模型」。官方完整表格中,Qwen3.8-Max 在 PaperBench、WideSearch、OSWorld-Verified 等項目領先,但在 SWE-bench Pro、DeepSWE、HLE 與部分網頁操作評測仍落後其他前沿模型。
更重要的是,評測條件並不完全相同。有些成績來自公開排行榜,有些由 Qwen 自行測試;不同模型也可能使用 Claude Code、Codex、OpenCode 或 Qwen-Agent 等不同執行框架。表格中還包含 Qwen 自建的內部 benchmark。這些數字能指出強項,卻不能取代同一環境、同一預算與同一任務下的比較。
我的結論是中性偏多:Qwen3.8-Max 的進步不只出現在單一榜單,長任務、文件、電腦操作與指令遵循都有訊號;但要證明它能穩定替代既有模型,還需要第三方重現與企業自己的失敗案例。
Qwen3.8-Max 怎麼用?目前先走 QwenCloud API
Qwen3.8-Max 已可透過 QwenCloud 使用,API 型號為 qwen3.8-max。官方支援 OpenAI 相容的 Chat Completions、Responses API,以及 Anthropic 相容介面,因此既有應用不一定要重寫整套串接。
模型提供三種推理強度:
low:優先速度與成本,適合分類、整理與規格清楚的任務。medium:在品質與速度之間取得平衡,適合日常開發與文件工作。xhigh:預設值,適合需要深入分析的複雜任務。
推理強度越高,通常需要更多時間與計算。最實際的做法不是所有工作都開 xhigh,而是先把任務分級。固定格式轉換用 low,一般 Agent 工作從 medium 開始,只有高風險決策或多步驟研究才使用 xhigh。
官方也提供 Claude Code、Codex、Qoder、Qwen Code 與 OpenClaw 的設定方式。這對團隊的意義是,Qwen3.8-Max 可以成為既有 Agent 工具中的另一個模型供應商,而不是要求所有人改用新的工作介面。

Qwen3.8-Max 已經開源了嗎?現在還差最後一步
Qwen 官方把這次發布稱為首個 Max 級開放權重模型,但公告同時明確寫出:權重將於下週在 Hugging Face 與 ModelScope 釋出。
因此目前的正確狀態是「雲端模型已可用,開放權重已預告,但尚未完成」。權重正式出現後,還要再確認授權條款、可下載版本、量化格式、推論框架與硬體需求。開放權重也不必然等於任何用途都可無限制商用,最終仍以模型卡與授權文件為準。
這一步很重要。對大型企業與研究團隊來說,能不能在自己的環境部署,關係到資料治理、客製化與供應商依賴;對一般個人開發者來說,2.4 兆總參數也意味著完整版不會是普通電腦輕鬆執行的模型。後續是否提供較小版本、量化權重與實際硬體門檻,會直接影響它的開放價值。
Qwen3.8-Max 值得用嗎?先用四個指標做小規模測試
Qwen3.8-Max 值得程式開發、研究、文件處理與多模態工作團隊測試。它最有吸引力的情境,不是問答,而是原本需要人類在多個工具之間反覆操作、耗時數小時以上的工作。
但我不建議直接把正式流程切換過去。先挑 10~20 個代表性任務,固定輸入、工具權限與驗收標準,再比較四個指標:
- 任務完成率,而不是文字看起來多完整。
- 人工接手次數,包括補資料、改方向與重跑測試。
- 從開始到可交付的總時間,而不是第一段回應速度。
- 完整成本,包括模型用量、工具與人工審查時間。
如果 Qwen3.8-Max 能在這四項穩定降低總成本,再擴大導入才有意義。若只是榜單分數高,卻常在最後一步需要人類收尾,那它仍是一個能力很強的助手,不是可靠的無人工作系統。
FAQ
Qwen3.8-Max 是誰開發的?
Qwen3.8-Max 由阿里巴巴 Qwen 團隊開發,於 2026 年 8 月 3 日正式公布。它是目前 Qwen 系列的 Max 級旗艦模型。
Qwen3.8-Max 有多少參數?
官方公布模型共有 2.4 兆參數,每次推論啟用 950 億參數。兩個數字不同,是因為它採用 MoE 架構,只會針對任務啟用部分專家網路。
Qwen3.8-Max 已經開源嗎?
2026 年 8 月 3 日雲端版本已經推出,但權重尚未正式釋出。Qwen 預告將於下一週在 Hugging Face 與 ModelScope 開放,授權與部署細節要以正式模型卡為準。
Qwen3.8-Max 可以在 Codex 或 Claude Code 使用嗎?
可以。QwenCloud 提供 OpenAI Responses 與 Anthropic 相容介面,官方文章也列出 Codex 與 Claude Code 的設定方法。實際使用前仍要建立 QwenCloud API Key,並依所在區域選擇正確端點。
Qwen3.8-Max 的上下文視窗多長?
Qwen 官方提供的工具設定範例列出 100 萬 Token context window。長上下文適合大型程式庫與大量文件,但不代表放入越多內容就一定越準,仍需控制資料品質與任務結構。
Qwen3.8-Max 比 Claude 或 GPT 更強嗎?
不能用單一句話回答。Qwen3.8-Max 在 PaperBench、WideSearch、OSWorld-Verified 等項目表現突出,但其他模型在 SWE-bench Pro、DeepSWE、HLE 與部分 Agent 評測仍領先。模型選擇應回到自己的任務、成本、速度與穩定度。
哪些人最適合先測 Qwen3.8-Max?
需要處理大型程式庫、研究流程、數百頁文件、視覺操作或長時間工具任務的團隊最適合。若只是短問答或固定格式內容,較小、較快的模型可能更省成本。