Qwen-Image-2.1 只有 7B 卻超越 Nano Banana 2?開放權重、實測分數與授權限制完整解析

Qwen-Image-2.1 在官方評測略勝 Nano Banana 2,但差距只有 0.46 分。本文解析 7B 架構、RGBA、多圖編輯、硬體與商用授權限制。

Share
Qwen-Image-2.1 只有 7B 卻超越 Nano Banana 2?開放權重、實測分數與授權限制完整解析

2026 年 9 月 20 日,Qwen 團隊發布 Qwen-Image-2.1。社群最醒目的說法,是一個只有 7B 參數、可下載權重的圖片模型,評測分數竟然高過 Google 的 Nano Banana 2。

這項成績值得注意,但不能直接解讀成「Qwen 已全面擊敗 Google」。Qwen-Image-2.1 在 Qwen 自家的文字生成圖片評測中拿到 60.28 分,Nano Banana 2 是 59.82 分,兩者只差 0.46 分。評測資料、裁判模型與實際使用情境,都會影響名次。

Qwen-Image-2.1 真正重要的地方,是把高品質生圖、局部編輯、多圖參考與透明圖層整合進一套可自行部署的模型。對研究者與本地 AI 玩家來說,它很值得測試。若要拿來製作廣告、客戶素材或收費產品,現行授權只允許非商業研究與評估,不能因為權重可以下載就直接商用。

Qwen-Image-2.1 是什麼?

Qwen-Image-2.1 是一套把「文字生成圖片」與「圖片編輯」放進同一條工作流程的圖片模型。使用者可以輸入一句描述生成新圖,也可以提供現有照片,要求模型換背景、改衣服、調整指定區域,或把多張參考圖組合成同一個畫面。

官方所說的 7B,意思是負責產生影像的核心元件約有 70 億個參數。參數可以先理解成模型在訓練後保留下來的可調數值,通常會影響模型容量與運算需求。

不過,「7B 模型」不代表下載 14 GB 就能完整運作。官方架構還包含一個用來理解文字與參考圖的 Qwen3-VL 8B 編碼器,以及處理影像壓縮與還原的 VAE。Hugging Face 上的 BF16 權重檔合計超過 33 GB,因此實際儲存空間、顯示記憶體與載入時間,都不能只看 7B 這個數字。

Qwen-Image-2.1 混合粒度注意力與 KV Cache 重複使用架構示意圖
Qwen-Image-2.1 會重複使用文字與參考圖的 KV Cache,減少多步圖片生成時的重複運算。 圖片來源:Qwen 官方 GitHub

根據 Qwen-Image-2.1 官方 GitHub,這次更新的主要能力包括:

  • 原生輸出 2K 圖片,預設正方形尺寸為 2048 × 2048。
  • 同一套模型處理生圖與圖片編輯。
  • 最多接收 10 張參考圖,用於多人合成、商品搭配或角色分鏡。
  • 支援圈選、塗抹標記與遮罩,讓使用者指定要修改的區域。
  • 原生生成 RGBA 透明圖片,也能抽出照片中的主體。
  • 支援 Diffusers、ComfyUI、vLLM-Omni、SGLang 與 LightX2V 等工具。
Qwen-Image-2.1 使用彩色圈選指定髮色、衣服與手錶修改區域
局部編輯輸入圖:使用不同顏色圈選髮型、袖子與手錶位置。 圖片來源:Qwen 官方 GitHub
Qwen-Image-2.1 完成髮色、衣服與手錶局部修改後的輸出
局部編輯輸出圖:模型依圈選區域改變髮色與衣服,並移除手錶。 圖片來源:Qwen 官方 GitHub

RGBA 是帶有透明度資訊的圖片格式。過去不少生圖工具只能生成帶白底或棋盤格背景的普通圖片,使用者還要另外去背。Qwen-Image-2.1 可以直接產生透明背景素材,對貼圖、商品圖、簡報元件與後續合成特別實用。

7B 模型真的超越 Nano Banana 2 嗎?

答案是:在 Qwen-Image-Bench 的總分上略高,但現有證據不足以證明全面超越。

Qwen 官方公布的比較圖顯示,Qwen-Image-2.1 總分為 60.28,Nano Banana 2 為 59.82。Qwen-Image-2.1 確實高出 0.46 分,但它仍低於 GPT Image 2、Grok Imagine 2.0、Qwen Image 3 Pro、Muse Image 與 MAI Image 2.5 Pro 等模型。

表格中的 API 是「應用程式介面」,讓其他軟體透過網路呼叫模型,不必把模型下載到自己的電腦。

模型 Qwen-Image-Bench 總分 權重取得方式
GPT Image 2 64.69 封閉服務
Qwen-Image-2.1 60.28 可下載,研究授權
Nano Banana 2 59.82 Google 服務與 API
GPT Image 1.5 59.65 封閉服務
Nano Banana Pro 59.45 Google 服務與 API

這份評測不是隨意挑幾張圖比較。依照 Qwen-Image-Bench 資料集說明,它包含 1,000 組由專家設計的中英文提示詞,從畫面品質、美感、指令對齊、現實世界忠實度與創意生成五個面向評分。細項再拆成文字渲染、世界知識、故事分鏡、設計應用等 56 種能力。

但解讀排行榜時有三個限制。

第一,60.28 分來自 Qwen 自己建立的評測。建立評測不等於結果無效,但模型開發團隊可能更熟悉這套題目與評分偏好,因此仍需要第三方重測。

第二,公開排行榜註明,現有結果使用中文提示詞生成圖片,再由 Q-Judger 評分。Q-Judger 是以 Qwen3.6-27B 為基礎訓練的裁判模型。官方表示它與專業人工評分的排序一致性達 0.92,但同一家族模型擔任裁判,仍可能帶來尚未被充分量化的偏差。

第三,0.46 分的差距很小。它能證明 Qwen-Image-2.1 已進入高階模型的競爭區間,卻不能保證每一種提示詞、語言與編輯工作都比較好。截至 2026 年 9 月 21 日,Artificial Analysis 的公開圖像模型頁面還沒有 Qwen-Image-2.1 的獨立成績,因此最穩妥的結論仍是「官方評測領先,第三方驗證尚未補齊」。

Qwen-Image-2.1 與 Nano Banana 2 差在哪裡?

兩者最根本的差別不在 0.46 分,而在使用方式。

比較項目 Qwen-Image-2.1 Nano Banana 2
使用方式 下載權重自行部署,或使用社群介面 Gemini、Google AI Studio、Gemini API、Vertex AI
模型資訊 影像生成元件 7B,架構與權重可查看 Google 未公開完整參數與權重
生圖與編輯 同一模型支援 支援
多張參考圖 官方支援最多 10 張 支援多圖工作流程,數量依產品介面與 API 規格
透明背景 原生 RGBA 生成與編輯 官方主打世界知識、文字與快速編輯,未把原生 RGBA 列為核心功能
即時世界知識 沒有內建網路搜尋 可結合 Google 搜尋的文字與圖片資訊
原生輸出 2K,官方列出 7 種常用比例 支援 512px、1K、2K、4K 與更多長寬比
資料控制 可在自己的設備或伺服器上執行 透過 Google 產品或雲端服務執行
商業使用 現行研究授權禁止未取得許可的商業用途 依 Google 產品與雲端服務條款使用

Nano Banana 2 的優勢是產品成熟度與世界知識。Google 官方說明顯示,它可以利用 Gemini 的知識與即時網頁圖片搜尋,生成特定地點、資訊圖表與在地化素材。使用者不必自行管理模型檔、GPU 環境與推論服務,就能在 Gemini 或 API 中使用。

Qwen-Image-2.1 的優勢則是控制權。研究團隊可以把權重放進自己的環境,檢查推論流程,調整工作流,並讓敏感素材留在自管設備中。原生透明圖層、遮罩編輯與最多 10 張參考圖,也更貼近設計軟體的素材組裝需求。

因此,我不會把 Qwen-Image-2.1 當成 Nano Banana 2 的直接替代品。若你要快速產生具有世界知識、網路資訊與 4K 輸出的圖片,Nano Banana 2 仍較省事。若你重視本地部署、流程可控、透明素材與模型研究,Qwen-Image-2.1 的吸引力更高。

原生透明圖層為什麼比排行榜更重要?

一般圖片只有紅、綠、藍三種色彩資訊。RGBA 多了一個 Alpha 通道,用來記錄每個像素的透明程度。這讓模型輸出的物件可以直接疊在其他背景上,而不必先經過去背工具。

Qwen-Image-2.1 生成的透明背景舞獅卡通角色
Qwen 官方展示的原生 RGBA 輸出,角色周圍保留透明通道,可直接用於排版與合成。 圖片來源:Qwen 官方 GitHub

這項能力對實際工作流程的價值很直接:

  • 電商可以生成透明背景商品素材,再套用到不同版型。
  • 設計師可以建立貼紙、圖示與簡報元件,直接放進排版工具。
  • 遊戲與動畫團隊可以先生成角色或道具,再組合到不同場景。
  • 行銷團隊可以保留同一個主體,快速製作橫幅、直式社群圖與廣告變體。

Qwen-Image-2.1 還能接收透明圖層進行編輯,或從照片中抽出主體。這代表它不只在產生最後一張成品,也能產生後續可編輯的素材。對創作者來說,這種可拆分、可重組的輸出,往往比單張排行榜分數更能縮短工作時間。

限制是,官方示範不等於所有複雜邊緣都能正確處理。頭髮、半透明玻璃、煙霧與反光材質,本來就是去背與合成的難題。若工作需要像素級品質,仍應逐張檢查 Alpha 邊緣與原圖細節。

「開放權重」不等於可以免費商用

Qwen 官方貼文使用了 open weights,也就是「開放權重」。這代表模型參數檔可以下載,使用者能在自己的環境執行。它和一般人常說的「開源」並不完全相同,因為能不能修改、散布與商用,還要看授權條款。

Qwen Research License Agreement 明確寫出,Qwen-Image-2.1 的材料只能用於非商業研究或評估。若要商業使用,必須另外向 Qwen 申請商業授權。

以下情境通常已經超出單純研究範圍:

  • 替客戶製作收費圖片或廣告素材。
  • 把模型放進付費 SaaS 或訂閱服務。
  • 用模型輸出支援公司的營利產品。
  • 散布修改後的模型,卻沒有依授權保留條款與標示。

是否構成商業使用仍要依實際情境與合約判斷,但條款本身已經很清楚。權重可以下載,並不代表企業可以直接部署到正式產品。對公司團隊來說,授權限制比排行榜上的 0.46 分更可能影響是否採用。

Qwen-Image-2.1 怎麼用?

不想寫程式的使用者,可以從 ComfyUI 的 Qwen-Image-2.1 工作流開始。官方 GitHub 表示,ComfyUI 已在發布首日提供原生支援,並有文字生圖與圖片編輯範例。

熟悉 Python 的使用者則可以透過 Hugging Face Diffusers 載入模型:

pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
pip install git+https://github.com/huggingface/diffusers

最基本的文字生圖程式如下:

import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1",
    torch_dtype=torch.bfloat16,
).to("cuda")

image = pipe(
    prompt="台北雨夜的霓虹招牌,招牌文字為 QWEN IMAGE 2.1",
    width=2048,
    height=2048,
    num_inference_steps=40,
).images[0]

image.save("qwen-image-2.1.png")

CUDA 是 NVIDIA 顯示卡使用的運算平台。若顯示記憶體不足,官方也提供 CPU offload,讓部分模型暫時放到系統記憶體,但生成速度通常會下降。由於完整 BF16 權重檔超過 33 GB,第一次嘗試前應先確認硬碟空間與設備規格,不要把「7B」誤解成任何家用電腦都能輕鬆執行。

官方還提供兩個 9B 的提示詞重寫模型,分別服務文字生圖與圖片編輯。它們會把簡短指令擴寫成較完整的描述,有助於提升輸出品質,但也會增加下載量與運算需求。若只是先確認硬體能否運作,可以先不用載入重寫模型。

Qwen-Image-2.1 適合哪些人?

我對 Qwen-Image-2.1 的整體判斷是研究與本地創作偏多,商業部署先觀望

它最適合三類使用者。第一類是研究圖片模型、推論加速與工作流整合的開發者。第二類是已經使用 ComfyUI,並且想測試多圖參考、局部編輯與透明素材的創作者。第三類是需要在自管環境處理圖片,不希望把原始素材送往第三方雲端的團隊。

若只是偶爾生成社群圖片,又不想處理模型檔、GPU 與環境相依問題,雲端服務仍然比較簡單。若目的是替公司、客戶或付費產品產生素材,現行非商業授權也會直接擋住正式使用。

後續最值得觀察兩項證據。第一是 Artificial Analysis 等第三方平台的盲測結果,能否重現 Qwen 自家評測的領先。第二是 Qwen 是否推出更寬鬆的商業授權,或由官方代管運算、讓使用者直接呼叫的服務。若第三方評測落後很多,或商業授權長期無法取得,Qwen-Image-2.1 的影響力可能主要停留在研究與社群工作流。

常見問題

Qwen-Image-2.1 是開源模型嗎?

它比較適合稱為「開放權重模型」。模型檔與部分程式碼可以下載,但 Qwen Research License 只授權非商業研究與評估,不符合一般人對可自由商用開源授權的理解。

Qwen-Image-2.1 真的比 Nano Banana 2 強嗎?

在 Qwen-Image-Bench 的官方總分中,Qwen-Image-2.1 以 60.28 分高於 Nano Banana 2 的 59.82 分。不過差距只有 0.46 分,而且評測由 Qwen 團隊建立,目前還缺少同版本的獨立排行榜成績,因此不能推論所有生圖與編輯任務都更強。

Qwen-Image-2.1 可以商用嗎?

現行研究授權不允許未取得另外許可的商業用途。若要用於客戶專案、付費產品或企業營運,應先向 Qwen 取得商業授權並確認適用條款。

一般電腦可以跑 Qwen-Image-2.1 嗎?

能否執行取決於顯示記憶體、系統記憶體、量化方式與是否使用 CPU offload。完整 BF16 權重檔超過 33 GB,官方沒有在模型卡中承諾一個適用所有工作流的最低顯示記憶體數字,因此不能只看 7B 就判斷設備一定跑得動。

Qwen-Image-2.1 可以產生透明背景圖片嗎?

可以。模型支援原生 RGBA 圖片生成與編輯,也能從照片中抽出主體。正式使用時仍要檢查頭髮、玻璃、煙霧與反光等複雜邊緣。

結論:真正的突破是把高階圖片能力交給可自管工作流

Qwen-Image-2.1 的 60.28 分很吸睛,但「比 Nano Banana 2 多 0.46 分」不該成為唯一結論。這份成績來自 Qwen 自建評測,使用中文提示詞與 Qwen 系列裁判模型,還需要第三方盲測補強。

更有意義的進展,是 7B 影像生成核心已能把 2K 生圖、圖片編輯、10 張參考圖、局部控制與原生透明圖層放在同一套可下載工作流中。這降低了研究者與創作者控制模型的門檻,也讓圖片模型從「輸出一張成品」逐漸走向「產生可編輯素材」。

目前最實際的選擇很清楚。研究、本地測試與 ComfyUI 創作可以試 Qwen-Image-2.1。追求免維護、即時世界知識與成熟雲端介面的使用者,Nano Banana 2 仍較方便。商業團隊則應先處理授權,而不是看到開放權重就直接部署。

資料來源

Read more

pen.dev 官方發表視覺:專為構建大膽軟體而生的 Agentic Canvas

前 Adobe 總監打造!全新 pen.dev 震撼登場:網頁一鍵逆向成畫布、AI 雙向生成前端代碼全攻略

前 Adobe XD / Flash 核心主管 Tom Krcha 創立、a16z speedrun 押注的全新 pen.dev 震撼登場!主打「絕不從零開始」,支援任何網站與 localhost 一鍵逆向為可編輯向量圖層;首創 Code on Canvas 在畫布跑 JS 動態生成 UI 控制項;具備 Component Slots、Vibe Shaders 與 MCP 深度串聯 Claude Code / Cursor。本文深度全解析。

Neuralink VOICE 臨床試驗參與者 Terry 透過大腦意念發聲對話

大腦意念直接發聲!Neuralink「VOICE」試驗重磅突破:ALS 漸凍症患者 Terry「用意念對妻子說我愛你」,Grok 語音克隆復原原聲、事實查核與馬斯克十年技術內幕深度解析

失語漸凍症患者只要「想著」說話,就能用自己過去的聲音開口!Neuralink 正式公布 VOICE 言語重建臨床試驗重大進展,受試者 Terry 透過 N1 腦部植入物將大腦訊號即時解碼為語音,動情對妻子說出「我愛你」。本文深度解析兩階段神經訓練機制、xAI Grok 語音克隆黑科技、社群媒體誤傳「第三位植入者」的事實查核(Community Notes 澄清),以及總裁 DJ Seo 親揭馬斯克十年每週親抓核心架構的幕後內幕。