Qwen3.8-27B 開放權重:27B 多模態模型、百萬 Token 與兩種版本差異一次看

Qwen3.8-27B 把 Coding、Office、多模態與長流程 Agent 能力放進 27B 模型,並採 Apache 2.0 授權。本文比較 27B 與 2.4T-A95B 的差異。

Share
Qwen3.8 Open Weights 官方發布封面圖
Qwen 團隊宣布 Qwen3.8-27B 與 Max 級模型已開放權重。圖片來源:Qwen 官方 X 貼文

Qwen3.8 的開放權重終於補齊。Qwen 團隊先釋出 Max 級的 Qwen3.8-2.4T-A95B,現在再推出規模小得多的 Qwen3.8-27B,兩款模型都能從 Hugging Face 與 ModelScope 下載。

對多數開發者來說,真正值得關注的是 27B 版本。它是一款原生多模態 dense 模型,也就是每次推論都會使用整個 270 億參數,而不是只啟用部分專家的 MoE 架構。模型能理解文字、圖片與影片,原生支援 262K context,並採用 Apache 2.0 授權。

我的判斷是中性偏多。Qwen3.8-27B 把 Coding、Office 與長流程 Agent 能力放進相對容易部署的規模,適合需要資料留在自己環境、又不想維護 Max 級基礎設施的團隊測試。不過,「27B」只代表它比 2.4T 模型實際,並不等於一般筆電可以毫無成本地跑滿 262K context。

延伸閱讀:Qwen3.8-Max 發布:2.4 兆參數、Max 級開放權重,真正重點是長時間 AI Agent

Qwen3.8-27B 是什麼?重點不只是參數變少

Qwen3.8-27B 是一款 270 億參數的 dense 模型。Dense 的意思是,每次處理輸入時都會使用整個模型;相較之下,MoE(Mixture of Experts,混合專家模型)會依任務只啟用部分參數。

它原生加入 Vision Encoder,也就是專門讀取視覺資訊的模組,因此不必另外串接一款視覺模型,就能處理圖片、文件、圖表與影片。這對 Coding Agent 很實際,因為模型除了閱讀程式碼,也可以檢查網頁截圖、辨識介面錯位,或從設計稿產生前端頁面。

模型也支援可調整的 Thinking。Thinking 是模型在回答前進行較長推理的模式,預設開啟,但可以關閉;開發者還能透過 reasoning_effort 調整推理深度。固定格式整理可以降低推理量,複雜除錯或多步驟研究再提高,較容易在品質、速度與成本之間取捨。

項目 Qwen3.8-27B 對使用者的意義
模型架構 27B dense 規格單純,部署門檻遠低於 2.4T-A95B
輸入能力 文字、圖片、影片 可處理文件、畫面與多模態 Agent 任務
原生上下文 262,144 tokens 能容納大型程式庫、長文件與較長的操作紀錄
延伸上下文 最多 1,000,000 tokens 需透過 YaRN 設定,並承擔更多記憶體與延遲成本
推理模式 Thinking 預設開啟,可關閉 可依任務調整速度與推理深度
授權 Apache 2.0 對商用、修改與再散布相對友善

這些規格讓 Qwen3.8-27B 更像一個可自架的工作模型,而不只是聊天模型。它最有價值的場景,是需要反覆讀檔、操作工具、檢查結果,再修正輸出的完整流程。

真的比 Qwen3.7-Plus 強嗎?工作型評測進步最明顯

Qwen 官方稱 Qwen3.8-27B 整體超越 Qwen3.7-Plus。從模型卡來看,最明顯的進步集中在 Coding、Agent 與視覺開發,而不是每一項知識測驗都領先。

評測 Qwen3.8-27B Qwen3.7-Plus 測量重點
Terminal Bench 2.1 73.0 64.0 在終端機完成實際任務
SWE-bench Pro 61.7 57.6 修正真實軟體問題
CoWorkBench 70.7 65.1 長流程辦公與專業工作
JobBench 33.4 27.6 專業職務任務
Vision2Web 62.9 42.1 從視覺資訊建立網頁
SWE-MM 38.6 30.0 結合視覺與程式開發

這組數字真正有意思的地方,是 27B 模型在需要工具、環境回饋與多個步驟的任務上都有提升。對開發團隊來說,這比單次問答多拿幾分更有價值,因為 Agent 最常失敗的地方不是不會回答,而是做到一半偏離目標,或遇到錯誤後無法繼續。

但「整體超越」不能理解成每項都贏。Qwen3.8-27B 在 GPQA Diamond 得到 89.2,略低於 Qwen3.7-Plus 的 90.3;OmniDocBench 1.5 也以 91.1 略低於 91.4。部分評測還是 Qwen 自建的內部 benchmark,測試框架與提示詞也會影響成績。

因此,我會把官方數字視為值得測試的訊號,而不是可以直接換模型的證明。最可靠的比較方式,仍是拿自己的程式庫、文件與工具權限,在相同時間和成本預算下測任務完成率。

262K 原生 context 可延伸至 100 萬 Token,但不要預設全開

Context window 是模型一次能讀取與保留的資訊量。Qwen3.8-27B 原生支援 262,144 tokens,適合放入較大的程式庫、長篇文件,以及 Agent 執行過程中的工具回傳紀錄。

如果任務超過原生長度,官方提供 YaRN 延伸到 100 萬 tokens。YaRN 是調整模型位置編碼的方法,讓模型可以處理超過原始訓練長度的內容。vLLM、SGLang 與 TokenSpeed 都有對應設定。

100 萬 tokens 並不是免費升級。上下文越長,通常需要更多記憶體,處理輸入也會更慢。Qwen 模型卡還特別提醒,目前常見框架使用 static YaRN,固定縮放設定可能影響短文本表現。因此,更實際的做法是平時維持原生 262K,只在大型程式庫、跨文件研究或超長 Agent 任務中開啟延伸。

這讓我對長上下文保持正面,但不把它當成預設賣點。真正好用的系統仍要先篩選資料、建立檢索與壓縮歷史紀錄,而不是把所有檔案一次塞進模型。

Qwen3.8-27B 與 2.4T-A95B 怎麼選?不是只有大小差異

Qwen3.8-27B 與 Qwen3.8-2.4T-A95B 都已開放權重,但兩者不是單純的小杯與大杯。功能、推論方式和授權都不同。

項目 Qwen3.8-27B Qwen3.8-2.4T-A95B
架構 27B dense 2.4T 總參數、95B active 的 MoE
開放權重版輸入 文字、圖片、影片 純文字
Thinking 預設開啟,可關閉 強制開啟,不能關閉
原生上下文 262K 262K
授權 Apache 2.0 Qwen3.8-Max License
適合對象 自架應用、文件與多模態 Agent 有大型推論基礎設施的研究或服務團隊

最容易誤會的是多模態。Qwen Cloud 上的 Qwen3.8-Max 服務支援視覺輸入與 non-thinking,但目前下載的 2.4T-A95B 權重是純文字模型,而且每次回應都會先進行 Thinking。雲端產品與開放權重版不能直接畫上等號。

授權也不同。27B 採 Apache 2.0;2.4T-A95B 則使用 Qwen3.8-Max 自訂授權。後者仍允許使用、修改、散布、銷售、部署、託管與微調,但超大規模產品需要顯示模型名稱,達到特定營收門檻的 Model as a Service 或 AI Work Assistant 業者,還必須另外取得授權。

如果目標是快速做出可維護的產品,我會先選 27B。只有當 27B 在真實任務的完成率明顯不足,而且團隊確定能負擔 2.4T 模型的推論與授權成本,才值得往 A95B 前進。

Qwen3.8-27B 適合本機部署嗎?先算完整資源,不只看參數

27B 確實比 2.4T-A95B 容易部署,但「可本機執行」不代表任何電腦都能順暢使用。實際需求會受到權重精度、量化格式、context 長度、影片輸入與同時使用人數影響。

模型權重只是第一筆資源。長 context 還需要 KV cache,也就是模型為了記住前文而保留的暫存資料;圖片與影片又會增加視覺 token。若直接把 context 拉到 262K 甚至 100 萬,記憶體需求與回應時間都會明顯上升。

因此,個人開發者可以等待社群量化版本與 llama.cpp、Ollama、LM Studio 等工具的完整支援,再依設備測試。正式服務則可優先考慮 Qwen 模型卡已列出的 vLLM、SGLang 或 TokenSpeed,並從短 context、單一使用者與低併發開始壓測。

我的建議不是先問「能不能跑」,而是先定義「要跑多快、一次處理多少資料、同時服務多少人」。只要這三個條件不同,同一台硬體得到的答案就會完全不同。

Apache 2.0 帶來什麼?開放權重不等於零成本

Qwen3.8-27B 採 Apache 2.0,代表開發者可以在遵守授權條件下使用、修改與散布模型,也能放進商業產品。相較於限制特定營收、使用人數或商業情境的模型授權,Apache 2.0 對產品團隊更容易理解與管理。

但開放權重只解決「能不能取得與控制模型」,不會自動消除部署成本。GPU、儲存空間、推論框架、監控、資安與版本更新都需要人力。模型能讀取圖片、影片與長文件,也代表資料權限與個資治理要做得更完整。

對企業來說,開放權重最大的價值通常不是免費,而是選擇權。敏感資料可以留在自己的環境,模型版本不必跟著 API 供應商改動,也能針對內部任務做微調與最佳化。這些優勢只有在團隊願意維護基礎設施時才會成立。

Qwen3.8-27B 值得用嗎?先做一輪真實任務測試

Qwen3.8-27B 值得 Coding Agent、文件自動化、多模態工作流與內部部署團隊測試。它的規格與官方評測都指向同一件事:較小的開放權重模型,正在從「回答問題」走向「完成工作」。

我不建議因為它在幾個榜單超越 Qwen3.7-Plus,就直接替換正式環境。先挑 10~20 個真實任務,固定工具、權限、context 與時間限制,再比較四項指標:一次完成率、人工接手次數、總處理時間與完整運算成本。

如果 27B 已能穩定完成工作,就沒有必要為了 Max 級名稱承擔 2.4T-A95B 的部署複雜度。反過來說,如果瓶頸確實來自模型能力,而不是 Prompt、工具或驗收流程,再升級大型模型才有商業意義。

FAQ

Qwen3.8-27B 是開源模型嗎?

更準確的說法是「開放權重模型」,因為官方已公開可下載的權重與設定檔。Qwen3.8-27B 採 Apache 2.0 授權,可在符合條款的前提下使用、修改、散布與商用。

Qwen3.8-27B 可以看圖片和影片嗎?

可以。它原生整合 Vision Encoder,支援圖片與影片理解,可用於文件解析、視覺問答、介面檢查與多模態 Agent。

Qwen3.8-27B 支援多少 context?

原生支援 262,144 tokens,並可透過 YaRN 延伸到 1,000,000 tokens。長 context 會增加記憶體與延遲,不建議在所有任務中預設開到最大。

Qwen3.8-27B 比 Qwen3.7-Plus 強嗎?

Qwen 官方評測顯示,27B 在多項 Coding、Agent 與視覺開發任務領先 Qwen3.7-Plus,但不是每個項目都較高。正式選型仍應使用自己的任務與相同測試條件比較。

Qwen3.8-2.4T-A95B 也是 Apache 2.0 嗎?

不是。2.4T-A95B 使用 Qwen3.8-Max License,其中包含大型產品標示模型名稱,以及特定 Model as a Service/AI Work Assistant 業者的額外授權要求。商業部署前應逐條檢查正式授權文件。

Qwen3.8-27B 要去哪裡下載?

官方已在 Hugging Face Qwen3.8 CollectionModelScope Qwen3.8 Collection 提供模型。27B 與 2.4T-A95B 的功能和授權不同,下載前要先確認模型卡。

結論:27B 才是這次最值得多數開發者關注的版本

Qwen3.8-2.4T-A95B 展示了 Qwen 把 Max 級模型開放權重的企圖,但真正可能被大量採用的,反而是 Qwen3.8-27B。它保留多模態、長 context、可調 Thinking 與 Agent 能力,同時採用更清楚的 Apache 2.0 授權。

這不代表 27B 已經輕到可以忽略硬體。只要加入超長文件、影片或多人同時使用,部署成本仍會快速上升。最實際的策略是從 27B 與真實任務開始,先證明它能降低人工接手與總處理時間,再決定是否投入更大的推論基礎設施。

資料來源