Gemini Omni 教學:用文字、圖片生成影片,再用對話直接修改

Gemini Omni 能用文字、圖片生成短片,還能沿用前一版內容繼續修改。本文整理 Gemini、Google Flow 操作與實用 Prompt。

Share
Gemini Omni AI 影片生成與對話式編輯官方主視覺

Gemini Omni 不只是把一句文字變成影片。它更實用的地方,是可以記住前一版內容,讓你用對話繼續換鏡頭、改場景、替換物件,不必每次都從頭生成。

如果你只是想快速做一支短片,從 Gemini app 開始最省事。若你需要整理多個素材、建立場景或進一步控制影片,Google Flow 會比較合適。

這篇 Gemini Omni 教學會帶你完成三件事:從文字生成影片、讓靜態圖片動起來,以及用自然語言修改已生成或上傳的影片。

Gemini Omni 是什麼?

Gemini Omni 是 Google 推出的多模態生成模型家族。「多模態」指的是模型能同時理解不同類型的素材,例如文字、圖片、影片與聲音,再把它們組合成新的內容。

目前第一個推出的版本是 Gemini Omni Flash,重點放在快速生成與編輯短影片。它和一般文字轉影片工具最大的差別,是支援多輪編輯。你可以先生成第一版,再接著說「把背景改成夜晚」、「鏡頭移到人物背後」,模型會沿用前一版繼續修改。

Google 把這種操作比喻成「影片版的 Nano Banana」。真正值得注意的不是名稱,而是工作方式從一次猜中 Prompt,變成先做出版本,再透過對話逐步收斂。

Gemini、Google Flow、AI Studio,該用哪一個?

Gemini Omni 可從不同入口使用,選擇方式取決於你想完成的工作。

入口 適合誰 主要用途
Gemini app 第一次使用 AI 影片的人 快速生成、上傳素材、用對話修改
Google Flow 創作者、行銷與影片工作者 管理素材、建立多個場景、使用較完整的影片工具
Google AI Studio 想測試模型的開發者 試跑 Prompt 與 API 行為
Gemini API 要把影片功能放進產品的團隊 程式串接、自動化與批次流程

對多數讀者來說,最實際的順序是先用 Gemini app 熟悉模型,再決定是否需要 Flow。不要一開始就研究 API,否則會把時間花在串接,而不是確認影片能否符合需求。

使用前要準備什麼?

依照 Gemini 官方說明,個人帳號需有符合資格的 Google AI 方案,工作或學校帳號則需符合資格的 Workspace 授權。這項功能目前不開放給未滿 18 歲的使用者。

台灣已列在 Google Flow 支援地區中。不過功能與用量仍可能因帳號、訂閱層級與平台不同。若介面裡沒有「建立影片」或 Gemini Omni Flash,先確認年齡、方案與帳號類型。

開始前建議準備:

  • 一個明確的影片目的,例如產品展示、知識解說或社群短片。
  • 預計使用的比例。YouTube 橫式影片可用 16:9,Reels、TikTok 與 Shorts 通常用 9:16
  • 一張高解析度參考圖,或一支想修改的短影片。
  • 一段先描述內容、再描述鏡頭與聲音的 Prompt。

Gemini Omni 教學一:用文字生成影片

這是最適合第一次使用的方式。先用文字做出一支短片,再從結果判斷模型是否理解你的場景。

操作步驟

  1. 前往 Gemini 並登入帳號。
  2. 打開左上角側邊欄,選擇「建立影片」(Create video)。
  3. 視需要選擇影片範本。
  4. 輸入 Prompt,並設定直式或橫式比例。
  5. 送出後等待生成。官方提醒,產生影片可能需要幾分鐘;等待期間可以另開新對話。
  6. 完成後可按影片下方的分享按鈕,下載影片或分享到 YouTube。

第一支影片不要塞入太多角色、轉場與場景。短片只有幾秒,如果同時要求人物介紹產品、跑過三個地點、切換五次鏡頭,模型很容易省略其中一部分。

可直接使用的 Prompt

一支 9:16 的 8 秒直式產品短片。

場景:木質桌面上的透明玻璃杯,背景是有自然光的咖啡店。
動作:冰咖啡緩慢倒入杯中,冰塊輕輕碰撞,杯壁出現水珠。
鏡頭:單一連續鏡頭,先從中景緩慢推近到杯子的特寫,不要切鏡。
光線與風格:早晨側光,寫實、乾淨,像生活風格廣告。
聲音:保留倒入咖啡與冰塊碰撞的環境音,不要旁白,不要背景音樂。
限制:畫面不要出現文字、Logo、手或其他人物。

這個 Prompt 把場景、動作、鏡頭、光線、聲音與限制分開。比起只寫「做一支高級咖啡廣告」,模型更容易知道哪些內容不能自行發揮。

Gemini Omni 教學二:把圖片變成影片

如果你已經有產品照、角色圖或草圖,圖片轉影片通常比純文字更容易維持外觀。Gemini app 每次可上傳 1 支影片與最多 5 張圖片,適合把主體、道具與風格圖分開提供。

操作步驟

  1. 進入「建立影片」。
  2. 點選新增圖片,上傳參考圖。
  3. 說明這張圖的角色:它是第一個畫面、主體參考,還是只提供風格。
  4. 描述主體怎麼動、鏡頭怎麼動,以及環境要出現哪些變化。
  5. 生成後先檢查主體外觀,再處理特效或鏡頭細節。

Google 的 Gemini Omni Prompt Guide特別強調,不要只寫「讓它動起來」。圖片已經告訴模型主體長什麼樣子,但沒有告訴它要往哪裡移動、鏡頭如何拍、風與光線要怎麼變化。

草圖轉寫實影片 Prompt

把這張草圖轉成寫實影片。草圖只用來引導物體與動作,不要讓手繪線條出現在成品中。

一顆檸檬外型的小型潛水艇漂浮在清澈海面,接著緩慢下潛。鏡頭從水面高度跟拍,水珠滑過鏡頭,陽光穿透水面形成自然光束。單一連續鏡頭,動作符合浮力與水流,不要加入文字或旁白。

這種做法很適合把包裝草圖、商品概念或分鏡變成動態提案。它不代表模型能取代正式 3D 建模,但可以讓團隊更快確認方向是否值得繼續製作。

Gemini Omni 教學三:用對話修改影片

對話式編輯是 Gemini Omni 最值得用的功能。傳統 AI 影片常遇到一個問題:第一版只有一個地方不對,但重新寫 Prompt 後,連原本正確的人物、構圖與節奏也一起改掉。

Gemini Omni 允許你接著上一版下指令,只修改指定部分。官方列出的常見操作包括替換物件、移除角色、改變鏡頭角度與調整場景。

建議的修改順序

  1. 先修主體與動作。
  2. 再調整鏡頭角度與運鏡。
  3. 接著修改背景、天氣與光線。
  4. 最後處理文字、音效與風格。

一次只改一個主要變數,最容易看出模型有沒有照做。如果你同時要求換人物、改夜景、加雨、換鏡頭與加入字幕,失敗時很難知道是哪一項造成問題。

多輪修改範例

第一輪:

保留人物、服裝、動作與影片長度,只把背景從白天改成夜晚。加入街燈與遠處車流的反光,維持寫實風格。

第二輪:

保持上一版的夜景與人物不變。把鏡頭改成從人物右後方拍攝的過肩視角,運鏡平穩,不要增加新的角色。

第三輪:

保留目前畫面,只加入輕微雨聲與遠處城市環境音。不要音樂,不要改變人物聲音。

這個流程的重點,是每一輪都說清楚「保留什麼」與「只改什麼」。與其反覆重做整支影片,逐輪收斂通常更節省時間,也比較容易維持一致性。

用 Google Flow 製作時,流程有什麼不同?

Google Flow 比 Gemini app 更接近影片工作空間。你可以在同一個專案裡保留素材、嘗試不同模型與生成方式,適合需要比較多版本的人。

建立專案後,先查看 Prompt 輸入框附近的設定,確認目前模型是 Gemini Omni Flash,並檢查影片長度、比例與所需點數。依官方功能表,Flow 的 Gemini Omni Flash 可生成 4、6、8 或 10 秒影片,也能編輯上傳或剛生成的影片。

使用 Flow 時,建議把素材分成三類:

  • 第一幀:影片要從這張畫面開始。
  • 主體參考:用來維持人物、商品或物件外觀。
  • 風格參考:只借用色彩、材質或畫面語言,不照搬內容。

如果你的需求只是「做一支 8 秒短片」,Gemini app 會更快。Flow 的價值在於版本多、素材多,或你準備把多個片段組成完整內容時,能減少來回整理檔案的成本。

Gemini Omni Prompt 怎麼寫?

一個好用的 Prompt 不需要堆滿攝影術語,但至少要回答以下問題。

Prompt 元素 要回答的問題 範例
主體 誰或什麼是畫面重點? 一位穿黃色雨衣的女生
動作 主體在做什麼? 緩慢走過積水的街道
場景 地點與時間是什麼? 清晨的台北巷弄
鏡頭 景別與移動方式? 低角度跟拍、單一連續鏡頭
光線與風格 畫面看起來如何? 柔和陰天光、寫實紀錄片風格
聲音 要保留哪些聲音? 雨聲與腳步聲,不要音樂
限制 哪些內容不能改? 不改人物服裝,不增加路人

可以把它整理成一個容易維護的公式:

[影片比例與長度]+[主體]+[動作]+[場景]+[鏡頭]+[光線/風格]+[聲音]+[保留與禁止事項]

官方建議英文 Prompt 的穩定性較高。你可以先用中文整理需求,再請 Gemini 翻成自然的英文影片 Prompt。這比一開始就硬寫攝影英文更省時間,也比較不容易漏掉限制。

5 個值得實作的 Gemini Omni 用法

Google 官方整理的 builder 案例,不只是在展示特效,也指出 Gemini Omni 適合哪些真實工作。

1. 同一場景快速換鏡位

先保留人物與動作,再要求正面、側面、俯視或過肩鏡頭。這適合廣告提案與分鏡測試,因為你能先比較敘事效果,再決定是否投入實拍。

0:00
/0:00

Leon Lin 使用 Gemini Omni 從多個角度呈現同一人物與城市場景。影片來源:Google Blog/Leon Lin。 查看官方來源

2. 改變季節、天氣與時間

把白天改成夜晚、綠葉改成秋色,或加入下雨與積雪。這類修改適合概念展示,但要留意光影、人物衣著與地面狀態是否一起變得合理。

0:00
/0:00

Carlos Santana 透過語音指令把戶外場景改成夜晚、雨天、秋季與雪景。影片來源:Google Blog/Carlos Santana。 查看官方來源

3. 把草圖變成動態概念

用手繪線條定義物體與運動方向,再要求生成寫實或動畫版本。它適合產品概念與教學示意,不適合拿來證明真實產品已經完成。

4. 轉換動畫與視覺風格

在人物動作不變的前提下,改成黏土動畫、鉛筆素描或紙張拼貼。使用自有素材或授權清楚的參考圖,能降低模仿特定藝術家與作品的風險。

0:00
/0:00

Jerrod Lew 讓人物行走動作保持連續,同時切換實拍、動畫與黏土等視覺風格。影片來源:Google Blog/Jerrod Lew。 查看官方來源

5. 把抽象資訊變成短片

景觀設計前後對照、數據解說與流程示意,都可以先做成視覺草稿。教育或商業內容仍要人工核對知識與數字,不能因為畫面合理就把生成內容當成事實。

0:00
/0:00

Hyperagent 把景觀配置加入空地影片,用前後對照呈現設計構想。影片來源:Google Blog/Hyperagent。 查看官方來源

Gemini Omni 和 Veo 3.1 有什麼差別?

兩者都能生成影片,但使用重點不同。依 Google Flow 的官方功能表,Gemini Omni Flash 強調多種參考素材、上傳影片編輯與對話式修改;Veo 3.1 則提供 Lite、Fast、Quality 等生成選項,並支援延長特定 Veo 影片。

如果你要從一句 Prompt 產出一支新影片,兩者都可以嘗試。如果你已經有影片,想在保留原場景的情況下繼續改內容,Gemini Omni 會更符合需求。

使用限制與常見問題

影片長度、解析度是多少?

Google Flow 目前提供 4、6、8、10 秒選項。Gemini API 文件標示輸出為 3–10 秒、720p、24 FPS。不同入口的功能不完全相同,實際選項以你使用介面顯示為準。

可以上傳自己的影片修改嗎?

可以。Gemini app 與 Flow 都列出影片編輯功能,但各地區與帳號可能有不同限制。短片越清楚、主體越單純,越容易精準修改。

可以使用中文 Prompt 嗎?

Flow 支援中文介面與輸入,但 Google 仍建議使用英文 Prompt 取得較穩定的結果。實際做法可以是先用中文整理需求,再翻成英文送出。

為什麼同一個 Prompt 每次結果不同?

生成影片不是傳統剪輯指令,同一句 Prompt 仍可能產生不同構圖與動作。若某一版已經有大部分正確,不要回到最初重生;直接在同一段對話指出要保留與修改的部分。

點數怎麼計算?

Flow 依模型、影片長度與編輯方式扣除點數,而且一次請求可能產生多個 generation。送出前先查看 Prompt 設定旁顯示的即時成本。訂閱方案的每月點數不會累積到下一個週期。

生成影片可以直接商用嗎?

工具可用不代表所有輸入素材與輸出內容都能直接商用。人物肖像、商標、音樂、參考圖與第三方影片仍受各自權利限制。商業發布前應確認素材來源、授權範圍與 Google 當期條款。

結論:把 Gemini Omni 當成能對話的影片草稿工具

Gemini Omni 最適合的工作,不是一次生成最終成品,而是快速做出第一版,再逐步調整鏡頭、環境、物件與風格。

新手可以先從 8 秒、單一場景、單一動作開始。第一版確認主體與構圖,後續每一輪只改一件事。當素材與版本變多,再把工作移到 Google Flow。這樣比追求一次寫出完美 Prompt 更快,也更容易控制成本。

資料來源