Grok Imagine Image 2.0 是什麼?精準編輯、多圖參考與實際限制一次看

Grok Imagine Image 2.0 把局部編輯、多圖參考、去背、改尺寸與範本整合進同一流程。本文整理它真正實用的升級與導入前限制。

Share
Grok Imagine Image 2.0 生成的冰原旅人與兩條白龍
xAI 在 Image 2.0 公告中展示的奇幻場景生成案例。圖片來源:xAI。 官方來源:https://x.ai/news/grok-imagine-image-2

xAI 在 2026 年 8 月 7 日推出 Grok Imagine Image 2.0。新版已成為 Grok Imagine 的 Quality Mode,也就是偏重輸出品質與細節控制的生成模式,可在 Grok 網頁版、iOS 與 Android App 使用。

這次更新不只追求更漂亮的單張圖片。xAI 把局部修改、精確選取、背景移除、最多 5 張參考圖、智慧改尺寸與工作範本放在同一套工具裡,想解決的是 AI 圖片最常見的問題:第一張看起來不錯,後續卻很難照需求修改。

我的判斷是中性偏多。Image 2.0 的產品方向比單純提高畫質更接近真實創作流程,也已在兩項 Arena 排行榜進入前段。不過,排名仍是初步結果,這一代的 API(讓開發者從自己的程式串接模型的介面)、完整價格與大量真實任務的穩定性也還不清楚。個人創作者值得測試,正式團隊則不必急著全面替換既有工具。

Grok Imagine Image 2.0 是什麼?

Grok Imagine Image 2.0 是 xAI 最新的圖片生成與編輯模型。它可以依照文字描述建立新圖片,也能針對既有圖片修改指定區域、移除背景、融合多張參考素材,再把同一個畫面延伸成不同尺寸。

官方把這一代定位成可以進入真實創作工作的工具,重點包括更準確地遵循指令、處理文字與排版,以及在多次生成和編輯之間保留原本的角色、商品與視覺元素。

功能 官方公布內容 對使用者的意義
指令與排版 加強複雜提示、文字、小字與多區塊版面 更適合海報、資訊圖表與商品視覺,不只做氣氛圖
精準編輯 指定區域修改、圖片分割、背景移除 小地方出錯時,不必整張重新生成
多圖參考 單次最多加入 5 張圖片 可同時提供人物、商品、姿勢與風格參考
Smart resize 支援 9 種常見比例並補齊畫面 同一主視覺可延伸到限時動態、貼文與橫幅
Templates 提供商品照、頭像、圖示與遊戲素材等範本 不熟提示詞的人也能從具體任務開始

這些能力放在一起,才是 Image 2.0 的真正價值。對日常工作來說,能保留已經正確的部分、只修改錯誤區域,通常比再生成十張候選圖更省時間。

文字與排版進步,但「看得清楚」不等於「內容正確」

AI 圖片模型過去很容易把文字變成像字的符號。Image 2.0 的官方案例則包含旅遊行程、字體演變、繪圖教學和 SpaceX 產品資訊圖表,顯示 xAI 正面挑戰多欄版面、小字與視覺層級。

官方展示的字體演變資訊圖,標題、時間軸、分欄和內文都能辨識。這代表模型已不只會在畫面中央放一行大標,而是能規劃資訊密度較高的版面。對社群圖卡、活動海報與簡易產品視覺來說,這會降低先生成背景、再回到 Canva 或 Figma 補字的次數。

但文字清楚仍不代表內容可信。官方電商範本示範中,包裝文字雖然能閱讀,部分英文組合仍顯得不自然。資訊圖表裡的日期、數字、產品規格與拼字,也都可能由模型自行補出。

因此,我對它的版面能力偏正面,對資訊正確性仍維持保守。凡是價格、法規、醫療、財務、產品規格或品牌文案,都應把 AI 圖當作設計初稿,再逐字核對;不能因為字體變清楚,就把圖片當成資料來源。

Grok Imagine Image 2.0 生成的字體演變時間軸資訊圖
官方用多欄時間軸示範 Image 2.0 的英文文字與版面能力;歷史內容仍應另外查證。圖片來源:xAI。 查看官方來源

精準編輯,才是這一代最實用的升級

真實工作很少第一版就定稿。Image 2.0 加入 Magic wand,讓使用者指向要修改的位置,只改指定區域並保留其他畫面。它也支援圖片分割,也就是先辨認並選出畫面中的特定人物或物件,再對那個範圍下指令。

背景移除則能把主體輸出成透明背景,方便放進簡報、商品頁或其他設計。這些功能各自都不新鮮,但整合進生成流程後,使用者不必為了一個錯字、一件衣服或一個背景重新抽整張圖。

這項能力若要進入商業流程,驗收重點不是官方案例有多漂亮,而是「不該改的地方有沒有真的保留」。局部改色後人物臉部是否改變、去背有沒有吃掉髮絲、修正文案是否連帶破壞版面,才會決定它能省下時間,還是製造更多來回。

最多 5 張參考圖,降低只靠提示詞溝通的成本

Image 2.0 單次可接受最多 5 張輸入圖片。使用者可以把人物、商品、姿勢、場景和風格拆成不同參考,減少在一段很長的提示詞裡描述所有細節。

例如製作商品廣告時,可以同時放入商品正面照、包裝細節、品牌色、模特兒姿勢和場景參考。這比只寫「請維持同一個商品」更具體,也更適合反覆建立同一系列素材。

xAI 還展示了用同一角色、不同場景與道具建立一致世界觀的案例。這對分鏡、遊戲素材與影片前期設計有吸引力,但官方示範是精選結果,尚未提供多輪生成的一致率。若角色臉部、服裝或商品標誌在第 5 張開始漂移,多圖輸入仍不能取代人工素材管理。

我會把這項功能視為值得測試的工作方式,而不是已經解決角色一致性的證明。最實際的測法,是固定同一組參考圖,連續做 10 張不同場景,再記錄有多少張可以直接使用,以及每張需要幾次修改。

Smart resize:同一張圖延伸 9 種比例

Smart resize 可以把既有畫面延伸到 1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9 與 2:1。使用者選擇比例後,模型會補出原圖之外的畫面,而不是只把內容硬裁掉。

這項功能最適合一稿多用。品牌可以先完成一張主視覺,再延伸成 Instagram 限時動態、方形貼文、YouTube 縮圖或網站橫幅,減少每個版位都重新生成一次。

不過,補畫面仍可能改變構圖重心,或在邊緣生成不合理的人體與物件。正式輸出前要逐一檢查不同尺寸,不能只確認中央主體還在,就當作所有版位都完成。

Grok Imagine Image 2.0 將同一場景延伸為 9 比 16 直式圖片
Smart resize 可依新比例補畫面,正式使用仍需逐一檢查邊緣物件與構圖。圖片來源:xAI。 查看官方來源

Templates 讓 Image 2.0 更像工具,而不是提示詞展示場

xAI 同步推出多種範本,涵蓋照片修改、商品換色、商品海報、拼貼、吉祥物、電商圖片、UGC 風格照片、專業頭像、圖示、角色 sprite、遊戲道具與 UI、emoji 及周邊商品。

這些範本的價值在於降低起步成本。使用者不必先研究一套提示詞格式,只要選擇「商品換色」或「背景移除」,再提供圖片與要求,就能從明確任務開始。對偶爾使用 AI 圖片的行銷或電商人員,這比多一個模型參數更有感。

範本也會帶來限制。固定流程可以提高成功率,卻可能讓輸出風格與構圖越來越相似。需要高度品牌差異、精確版型或批次自動化的團隊,仍要觀察自訂程度與 API 能力,不能只依靠現成範本。

Grok Imagine Image 2.0 電商圖片範本展示同一零食包裝的多種場景
官方電商範本能維持相近商品視覺,但包裝文字仍有語意可疑之處,對外使用前必須人工校對。圖片來源:xAI。 查看官方來源

Arena 世界第 2 名,該怎麼看?

xAI 表示 Image 2.0 在 Arena 的文字生成圖片與圖片編輯排行榜都位居世界第 2。Arena 是讓使用者匿名比較兩個模型結果、選出偏好作品的平台,再把大量兩兩比較換算成 Elo 分數。Elo 是相對排名,不是考卷分數,也不代表 1,320 分就等於 132% 的正確率。

截至 2026 年 8 月 8 日,Arena 的 Text-to-Image 排行榜顯示:

排名 模型 Elo 票數 狀態
1 GPT-Image-2(medium) 1,380 ± 5 69,194 正式榜單資料
2 Grok Imagine Image 2.0(low) 1,320 ± 12 2,722 Preliminary

圖片編輯榜上,GPT-Image-2(medium)為 1,463 ± 4、184,189 票;Grok Imagine Image 2.0(low)為 1,439 ± 8、5,931 票,同樣排名第 2 並標示 Preliminary。

這組成績足以支持 Image 2.0 已進入第一梯隊,卻還不能證明它在所有任務都穩居第 2。新模型的票數明顯較少,分數誤差範圍也較大;Arena 衡量的是使用者偏好,不會替你檢查海報日期、商品規格、品牌一致性或局部編輯是否完全沒動到其他區域。

因此,我會把 Arena 排名當成值得試用的訊號,不會把它當成採購結論。若後續票數增加後排名仍穩定,第三方測試也能重現文字與編輯表現,這個正面判斷才會更強。

Grok Imagine Image 2.0 怎麼使用?

Image 2.0 已在 Grok Imagine 網頁版 以及 Grok 的 iOS、Android App 提供。官方把它設為新的 Quality Mode,使用者可從 Imagine 介面選擇偏重品質的模式,再輸入文字或上傳參考圖片開始生成。

官方公告沒有列出各帳號方案的生成額度、速度與完整價格,因此實際可用次數仍應以登入後顯示為準。若要比較工具,不要只看月費,還要記錄產出一張可交付圖片所需的生成次數與人工修改時間。

開發者也要注意版本差異。xAI 已有圖片生成與編輯 API,現有文件使用的是 grok-imagine-image-quality 等既有模型;但 Image 2.0 公告明確寫著 API access is coming soon。換句話說,消費者介面已可使用 Image 2.0,不代表這一代已能透過 API 串進自己的產品或自動化流程。

Grok Imagine Image 2.0 適合誰?

現階段最值得測試的使用者包括:

  1. 需要快速製作社群圖卡、活動視覺與簡易資訊圖表的內容團隊。
  2. 經常把同一張主視覺延伸成多種尺寸的行銷與電商人員。
  3. 需要用多張參考圖維持人物、商品或視覺風格的創作者。
  4. 想先建立角色、場景和道具,再延伸成影片分鏡的製作團隊。

如果工作需要精確到像素的版型、完全正確的長文、可重複的批次 API,或嚴格的品牌與法務審核,Image 2.0 目前還不能單獨完成整條流程。比較實際的定位,是把它放在概念發想、素材初稿與局部修改階段,再交給人工設計與審核收尾。

商業使用前,還要注意哪些風險?

xAI 的消費者服務條款表示,在法律允許範圍內,使用者與 xAI 之間由使用者保留輸入與輸出的權利。但這不等於平台保證作品不侵犯第三方的著作權、商標、肖像或其他權利。

使用者仍要確保上傳的商品照、人物照片和品牌素材具備必要權利,也要檢查生成結果是否過度接近他人作品。若輸出涉及真實人物、品牌標誌、新聞事件或重要資訊,人工審核不能省略。

條款也要求使用輸出或 xAI 品牌元素時,遵守 xAI Brand Guidelines 的標示與許可要求。企業要正式導入前,應依實際帳號方案與用途重新檢查當時條款,不要把「我可以下載圖片」直接理解成所有商業情境都已獲得完整授權。

我怎麼看 Grok Imagine Image 2.0?

我對 Image 2.0 的方向中性偏多。精準局部編輯、最多 5 張參考圖、Smart resize 和任務範本,確實比單純提高單張畫質更貼近內容製作。它把「生成一張圖」往「把圖修到能用」推進了一步。

現在最大的反方證據,是官方仍缺少大量真實任務的成功率、完整價格,以及 Image 2.0 的 API。Arena 第 2 名是好訊號,但新模型票數少且仍標示 Preliminary,不能代替自己的工作流程測試。

現階段最實際的做法,是挑一個真實但低風險的任務試跑。例如用同一組商品與品牌素材製作方形貼文、9:16 限時動態和 16:9 橫幅,再記錄文字錯誤、局部修改次數、可用成片率與總耗時。只有這些數字比目前工具更好,Image 2.0 才真正值得進入正式流程。

Grok Imagine Image 2.0 常見問題

Grok Imagine Image 2.0 已經推出了嗎?

已經推出。xAI 在 2026 年 8 月 7 日宣布 Image 2.0 正式提供,並成為 Grok Imagine 的新 Quality Mode,可在網頁版、iOS 與 Android App 使用。

Grok Imagine Image 2.0 可以免費使用嗎?

xAI 公告頁提供直接前往 Grok Imagine 的入口,但沒有公布不同方案的完整額度與限制。是否可免費生成、每天可用幾次及是否需要訂閱,應以登入後的帳號畫面為準。

Image 2.0 最多可以放幾張參考圖?

官方表示,Multi-ref editing 單次最多接受 5 張輸入圖片。這讓使用者可以分別提供人物、商品、姿勢、場景和風格參考,減少只靠文字描述的落差。

Grok Imagine Image 2.0 支援哪些圖片比例?

Smart resize 支援 1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9 與 2:1。模型會依新比例補出畫面,但輸出後仍要檢查邊緣物件、人體與構圖是否合理。

Grok Imagine Image 2.0 有 API 嗎?

截至 2026 年 8 月 8 日,xAI 的新品公告仍寫著 Image 2.0 API 即將推出。xAI 現在雖有其他 Grok Imagine 圖片模型的 API 文件,但不能直接視為 Image 2.0 已開放串接。

Arena 第 2 名代表它比其他圖片模型都強嗎?

不代表。Arena 反映使用者在匿名兩兩比較中的偏好,Image 2.0 的成績目前仍標示 Preliminary。它能證明模型已具競爭力,但不能取代文字正確率、品牌一致性、編輯保留度與成本測試。

結論:真正的升級,是讓 AI 圖片開始可以反覆修改

Grok Imagine Image 2.0 最重要的改變,不是又多一個會生成漂亮圖片的模型,而是把局部編輯、多圖參考、去背、改尺寸和工作範本整合起來。這些功能若能穩定保留正確內容,會比單純的畫質提升更直接影響工作效率。

現在的證據足以讓個人創作者與內容團隊開始測試,還不足以讓企業在沒有比較成本、失敗率與權利風險前全面遷移。先用真實素材做一個小型試作,驗證能否少改幾次、少做幾個版本,會比只看官方案例或排行榜更接近實際答案。

資料來源