Grok Imagine Image 2.0 是什麼?精準編輯、多圖參考與實際限制一次看
Grok Imagine Image 2.0 把局部編輯、多圖參考、去背、改尺寸與範本整合進同一流程。本文整理它真正實用的升級與導入前限制。
xAI 在 2026 年 8 月 7 日推出 Grok Imagine Image 2.0。新版已成為 Grok Imagine 的 Quality Mode,也就是偏重輸出品質與細節控制的生成模式,可在 Grok 網頁版、iOS 與 Android App 使用。
這次更新不只追求更漂亮的單張圖片。xAI 把局部修改、精確選取、背景移除、最多 5 張參考圖、智慧改尺寸與工作範本放在同一套工具裡,想解決的是 AI 圖片最常見的問題:第一張看起來不錯,後續卻很難照需求修改。
我的判斷是中性偏多。Image 2.0 的產品方向比單純提高畫質更接近真實創作流程,也已在兩項 Arena 排行榜進入前段。不過,排名仍是初步結果,這一代的 API(讓開發者從自己的程式串接模型的介面)、完整價格與大量真實任務的穩定性也還不清楚。個人創作者值得測試,正式團隊則不必急著全面替換既有工具。
Grok Imagine Image 2.0 是什麼?
Grok Imagine Image 2.0 是 xAI 最新的圖片生成與編輯模型。它可以依照文字描述建立新圖片,也能針對既有圖片修改指定區域、移除背景、融合多張參考素材,再把同一個畫面延伸成不同尺寸。
官方把這一代定位成可以進入真實創作工作的工具,重點包括更準確地遵循指令、處理文字與排版,以及在多次生成和編輯之間保留原本的角色、商品與視覺元素。
| 功能 | 官方公布內容 | 對使用者的意義 |
|---|---|---|
| 指令與排版 | 加強複雜提示、文字、小字與多區塊版面 | 更適合海報、資訊圖表與商品視覺,不只做氣氛圖 |
| 精準編輯 | 指定區域修改、圖片分割、背景移除 | 小地方出錯時,不必整張重新生成 |
| 多圖參考 | 單次最多加入 5 張圖片 | 可同時提供人物、商品、姿勢與風格參考 |
| Smart resize | 支援 9 種常見比例並補齊畫面 | 同一主視覺可延伸到限時動態、貼文與橫幅 |
| Templates | 提供商品照、頭像、圖示與遊戲素材等範本 | 不熟提示詞的人也能從具體任務開始 |
這些能力放在一起,才是 Image 2.0 的真正價值。對日常工作來說,能保留已經正確的部分、只修改錯誤區域,通常比再生成十張候選圖更省時間。
文字與排版進步,但「看得清楚」不等於「內容正確」
AI 圖片模型過去很容易把文字變成像字的符號。Image 2.0 的官方案例則包含旅遊行程、字體演變、繪圖教學和 SpaceX 產品資訊圖表,顯示 xAI 正面挑戰多欄版面、小字與視覺層級。
官方展示的字體演變資訊圖,標題、時間軸、分欄和內文都能辨識。這代表模型已不只會在畫面中央放一行大標,而是能規劃資訊密度較高的版面。對社群圖卡、活動海報與簡易產品視覺來說,這會降低先生成背景、再回到 Canva 或 Figma 補字的次數。
但文字清楚仍不代表內容可信。官方電商範本示範中,包裝文字雖然能閱讀,部分英文組合仍顯得不自然。資訊圖表裡的日期、數字、產品規格與拼字,也都可能由模型自行補出。
因此,我對它的版面能力偏正面,對資訊正確性仍維持保守。凡是價格、法規、醫療、財務、產品規格或品牌文案,都應把 AI 圖當作設計初稿,再逐字核對;不能因為字體變清楚,就把圖片當成資料來源。

精準編輯,才是這一代最實用的升級
真實工作很少第一版就定稿。Image 2.0 加入 Magic wand,讓使用者指向要修改的位置,只改指定區域並保留其他畫面。它也支援圖片分割,也就是先辨認並選出畫面中的特定人物或物件,再對那個範圍下指令。
背景移除則能把主體輸出成透明背景,方便放進簡報、商品頁或其他設計。這些功能各自都不新鮮,但整合進生成流程後,使用者不必為了一個錯字、一件衣服或一個背景重新抽整張圖。
這項能力若要進入商業流程,驗收重點不是官方案例有多漂亮,而是「不該改的地方有沒有真的保留」。局部改色後人物臉部是否改變、去背有沒有吃掉髮絲、修正文案是否連帶破壞版面,才會決定它能省下時間,還是製造更多來回。
最多 5 張參考圖,降低只靠提示詞溝通的成本
Image 2.0 單次可接受最多 5 張輸入圖片。使用者可以把人物、商品、姿勢、場景和風格拆成不同參考,減少在一段很長的提示詞裡描述所有細節。
例如製作商品廣告時,可以同時放入商品正面照、包裝細節、品牌色、模特兒姿勢和場景參考。這比只寫「請維持同一個商品」更具體,也更適合反覆建立同一系列素材。
xAI 還展示了用同一角色、不同場景與道具建立一致世界觀的案例。這對分鏡、遊戲素材與影片前期設計有吸引力,但官方示範是精選結果,尚未提供多輪生成的一致率。若角色臉部、服裝或商品標誌在第 5 張開始漂移,多圖輸入仍不能取代人工素材管理。
我會把這項功能視為值得測試的工作方式,而不是已經解決角色一致性的證明。最實際的測法,是固定同一組參考圖,連續做 10 張不同場景,再記錄有多少張可以直接使用,以及每張需要幾次修改。
Smart resize:同一張圖延伸 9 種比例
Smart resize 可以把既有畫面延伸到 1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9 與 2:1。使用者選擇比例後,模型會補出原圖之外的畫面,而不是只把內容硬裁掉。
這項功能最適合一稿多用。品牌可以先完成一張主視覺,再延伸成 Instagram 限時動態、方形貼文、YouTube 縮圖或網站橫幅,減少每個版位都重新生成一次。
不過,補畫面仍可能改變構圖重心,或在邊緣生成不合理的人體與物件。正式輸出前要逐一檢查不同尺寸,不能只確認中央主體還在,就當作所有版位都完成。

Templates 讓 Image 2.0 更像工具,而不是提示詞展示場
xAI 同步推出多種範本,涵蓋照片修改、商品換色、商品海報、拼貼、吉祥物、電商圖片、UGC 風格照片、專業頭像、圖示、角色 sprite、遊戲道具與 UI、emoji 及周邊商品。
這些範本的價值在於降低起步成本。使用者不必先研究一套提示詞格式,只要選擇「商品換色」或「背景移除」,再提供圖片與要求,就能從明確任務開始。對偶爾使用 AI 圖片的行銷或電商人員,這比多一個模型參數更有感。
範本也會帶來限制。固定流程可以提高成功率,卻可能讓輸出風格與構圖越來越相似。需要高度品牌差異、精確版型或批次自動化的團隊,仍要觀察自訂程度與 API 能力,不能只依靠現成範本。

Arena 世界第 2 名,該怎麼看?
xAI 表示 Image 2.0 在 Arena 的文字生成圖片與圖片編輯排行榜都位居世界第 2。Arena 是讓使用者匿名比較兩個模型結果、選出偏好作品的平台,再把大量兩兩比較換算成 Elo 分數。Elo 是相對排名,不是考卷分數,也不代表 1,320 分就等於 132% 的正確率。
截至 2026 年 8 月 8 日,Arena 的 Text-to-Image 排行榜顯示:
| 排名 | 模型 | Elo | 票數 | 狀態 |
|---|---|---|---|---|
| 1 | GPT-Image-2(medium) | 1,380 ± 5 | 69,194 | 正式榜單資料 |
| 2 | Grok Imagine Image 2.0(low) | 1,320 ± 12 | 2,722 | Preliminary |
圖片編輯榜上,GPT-Image-2(medium)為 1,463 ± 4、184,189 票;Grok Imagine Image 2.0(low)為 1,439 ± 8、5,931 票,同樣排名第 2 並標示 Preliminary。
這組成績足以支持 Image 2.0 已進入第一梯隊,卻還不能證明它在所有任務都穩居第 2。新模型的票數明顯較少,分數誤差範圍也較大;Arena 衡量的是使用者偏好,不會替你檢查海報日期、商品規格、品牌一致性或局部編輯是否完全沒動到其他區域。
因此,我會把 Arena 排名當成值得試用的訊號,不會把它當成採購結論。若後續票數增加後排名仍穩定,第三方測試也能重現文字與編輯表現,這個正面判斷才會更強。
Grok Imagine Image 2.0 怎麼使用?
Image 2.0 已在 Grok Imagine 網頁版 以及 Grok 的 iOS、Android App 提供。官方把它設為新的 Quality Mode,使用者可從 Imagine 介面選擇偏重品質的模式,再輸入文字或上傳參考圖片開始生成。
官方公告沒有列出各帳號方案的生成額度、速度與完整價格,因此實際可用次數仍應以登入後顯示為準。若要比較工具,不要只看月費,還要記錄產出一張可交付圖片所需的生成次數與人工修改時間。
開發者也要注意版本差異。xAI 已有圖片生成與編輯 API,現有文件使用的是 grok-imagine-image-quality 等既有模型;但 Image 2.0 公告明確寫著 API access is coming soon。換句話說,消費者介面已可使用 Image 2.0,不代表這一代已能透過 API 串進自己的產品或自動化流程。
Grok Imagine Image 2.0 適合誰?
現階段最值得測試的使用者包括:
- 需要快速製作社群圖卡、活動視覺與簡易資訊圖表的內容團隊。
- 經常把同一張主視覺延伸成多種尺寸的行銷與電商人員。
- 需要用多張參考圖維持人物、商品或視覺風格的創作者。
- 想先建立角色、場景和道具,再延伸成影片分鏡的製作團隊。
如果工作需要精確到像素的版型、完全正確的長文、可重複的批次 API,或嚴格的品牌與法務審核,Image 2.0 目前還不能單獨完成整條流程。比較實際的定位,是把它放在概念發想、素材初稿與局部修改階段,再交給人工設計與審核收尾。
商業使用前,還要注意哪些風險?
xAI 的消費者服務條款表示,在法律允許範圍內,使用者與 xAI 之間由使用者保留輸入與輸出的權利。但這不等於平台保證作品不侵犯第三方的著作權、商標、肖像或其他權利。
使用者仍要確保上傳的商品照、人物照片和品牌素材具備必要權利,也要檢查生成結果是否過度接近他人作品。若輸出涉及真實人物、品牌標誌、新聞事件或重要資訊,人工審核不能省略。
條款也要求使用輸出或 xAI 品牌元素時,遵守 xAI Brand Guidelines 的標示與許可要求。企業要正式導入前,應依實際帳號方案與用途重新檢查當時條款,不要把「我可以下載圖片」直接理解成所有商業情境都已獲得完整授權。
我怎麼看 Grok Imagine Image 2.0?
我對 Image 2.0 的方向中性偏多。精準局部編輯、最多 5 張參考圖、Smart resize 和任務範本,確實比單純提高單張畫質更貼近內容製作。它把「生成一張圖」往「把圖修到能用」推進了一步。
現在最大的反方證據,是官方仍缺少大量真實任務的成功率、完整價格,以及 Image 2.0 的 API。Arena 第 2 名是好訊號,但新模型票數少且仍標示 Preliminary,不能代替自己的工作流程測試。
現階段最實際的做法,是挑一個真實但低風險的任務試跑。例如用同一組商品與品牌素材製作方形貼文、9:16 限時動態和 16:9 橫幅,再記錄文字錯誤、局部修改次數、可用成片率與總耗時。只有這些數字比目前工具更好,Image 2.0 才真正值得進入正式流程。
Grok Imagine Image 2.0 常見問題
Grok Imagine Image 2.0 已經推出了嗎?
已經推出。xAI 在 2026 年 8 月 7 日宣布 Image 2.0 正式提供,並成為 Grok Imagine 的新 Quality Mode,可在網頁版、iOS 與 Android App 使用。
Grok Imagine Image 2.0 可以免費使用嗎?
xAI 公告頁提供直接前往 Grok Imagine 的入口,但沒有公布不同方案的完整額度與限制。是否可免費生成、每天可用幾次及是否需要訂閱,應以登入後的帳號畫面為準。
Image 2.0 最多可以放幾張參考圖?
官方表示,Multi-ref editing 單次最多接受 5 張輸入圖片。這讓使用者可以分別提供人物、商品、姿勢、場景和風格參考,減少只靠文字描述的落差。
Grok Imagine Image 2.0 支援哪些圖片比例?
Smart resize 支援 1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9 與 2:1。模型會依新比例補出畫面,但輸出後仍要檢查邊緣物件、人體與構圖是否合理。
Grok Imagine Image 2.0 有 API 嗎?
截至 2026 年 8 月 8 日,xAI 的新品公告仍寫著 Image 2.0 API 即將推出。xAI 現在雖有其他 Grok Imagine 圖片模型的 API 文件,但不能直接視為 Image 2.0 已開放串接。
Arena 第 2 名代表它比其他圖片模型都強嗎?
不代表。Arena 反映使用者在匿名兩兩比較中的偏好,Image 2.0 的成績目前仍標示 Preliminary。它能證明模型已具競爭力,但不能取代文字正確率、品牌一致性、編輯保留度與成本測試。
結論:真正的升級,是讓 AI 圖片開始可以反覆修改
Grok Imagine Image 2.0 最重要的改變,不是又多一個會生成漂亮圖片的模型,而是把局部編輯、多圖參考、去背、改尺寸和工作範本整合起來。這些功能若能穩定保留正確內容,會比單純的畫質提升更直接影響工作效率。
現在的證據足以讓個人創作者與內容團隊開始測試,還不足以讓企業在沒有比較成本、失敗率與權利風險前全面遷移。先用真實素材做一個小型試作,驗證能否少改幾次、少做幾個版本,會比只看官方案例或排行榜更接近實際答案。