Gemini Omni 教學:用文字、圖片生成影片,再用對話直接修改
Gemini Omni 能用文字、圖片生成短片,還能沿用前一版內容繼續修改。本文整理 Gemini、Google Flow 操作與實用 Prompt。
Gemini Omni 不只是把一句文字變成影片。它更實用的地方,是可以記住前一版內容,讓你用對話繼續換鏡頭、改場景、替換物件,不必每次都從頭生成。
如果你只是想快速做一支短片,從 Gemini app 開始最省事。若你需要整理多個素材、建立場景或進一步控制影片,Google Flow 會比較合適。
這篇 Gemini Omni 教學會帶你完成三件事:從文字生成影片、讓靜態圖片動起來,以及用自然語言修改已生成或上傳的影片。
Gemini Omni 是什麼?
Gemini Omni 是 Google 推出的多模態生成模型家族。「多模態」指的是模型能同時理解不同類型的素材,例如文字、圖片、影片與聲音,再把它們組合成新的內容。
目前第一個推出的版本是 Gemini Omni Flash,重點放在快速生成與編輯短影片。它和一般文字轉影片工具最大的差別,是支援多輪編輯。你可以先生成第一版,再接著說「把背景改成夜晚」、「鏡頭移到人物背後」,模型會沿用前一版繼續修改。
Google 把這種操作比喻成「影片版的 Nano Banana」。真正值得注意的不是名稱,而是工作方式從一次猜中 Prompt,變成先做出版本,再透過對話逐步收斂。
Gemini、Google Flow、AI Studio,該用哪一個?
Gemini Omni 可從不同入口使用,選擇方式取決於你想完成的工作。
| 入口 | 適合誰 | 主要用途 |
|---|---|---|
| Gemini app | 第一次使用 AI 影片的人 | 快速生成、上傳素材、用對話修改 |
| Google Flow | 創作者、行銷與影片工作者 | 管理素材、建立多個場景、使用較完整的影片工具 |
| Google AI Studio | 想測試模型的開發者 | 試跑 Prompt 與 API 行為 |
| Gemini API | 要把影片功能放進產品的團隊 | 程式串接、自動化與批次流程 |
對多數讀者來說,最實際的順序是先用 Gemini app 熟悉模型,再決定是否需要 Flow。不要一開始就研究 API,否則會把時間花在串接,而不是確認影片能否符合需求。
使用前要準備什麼?
依照 Gemini 官方說明,個人帳號需有符合資格的 Google AI 方案,工作或學校帳號則需符合資格的 Workspace 授權。這項功能目前不開放給未滿 18 歲的使用者。
台灣已列在 Google Flow 支援地區中。不過功能與用量仍可能因帳號、訂閱層級與平台不同。若介面裡沒有「建立影片」或 Gemini Omni Flash,先確認年齡、方案與帳號類型。
開始前建議準備:
- 一個明確的影片目的,例如產品展示、知識解說或社群短片。
- 預計使用的比例。YouTube 橫式影片可用
16:9,Reels、TikTok 與 Shorts 通常用9:16。 - 一張高解析度參考圖,或一支想修改的短影片。
- 一段先描述內容、再描述鏡頭與聲音的 Prompt。
Gemini Omni 教學一:用文字生成影片
這是最適合第一次使用的方式。先用文字做出一支短片,再從結果判斷模型是否理解你的場景。
操作步驟
- 前往 Gemini 並登入帳號。
- 打開左上角側邊欄,選擇「建立影片」(Create video)。
- 視需要選擇影片範本。
- 輸入 Prompt,並設定直式或橫式比例。
- 送出後等待生成。官方提醒,產生影片可能需要幾分鐘;等待期間可以另開新對話。
- 完成後可按影片下方的分享按鈕,下載影片或分享到 YouTube。
第一支影片不要塞入太多角色、轉場與場景。短片只有幾秒,如果同時要求人物介紹產品、跑過三個地點、切換五次鏡頭,模型很容易省略其中一部分。
可直接使用的 Prompt
一支 9:16 的 8 秒直式產品短片。
場景:木質桌面上的透明玻璃杯,背景是有自然光的咖啡店。
動作:冰咖啡緩慢倒入杯中,冰塊輕輕碰撞,杯壁出現水珠。
鏡頭:單一連續鏡頭,先從中景緩慢推近到杯子的特寫,不要切鏡。
光線與風格:早晨側光,寫實、乾淨,像生活風格廣告。
聲音:保留倒入咖啡與冰塊碰撞的環境音,不要旁白,不要背景音樂。
限制:畫面不要出現文字、Logo、手或其他人物。
這個 Prompt 把場景、動作、鏡頭、光線、聲音與限制分開。比起只寫「做一支高級咖啡廣告」,模型更容易知道哪些內容不能自行發揮。
Gemini Omni 教學二:把圖片變成影片
如果你已經有產品照、角色圖或草圖,圖片轉影片通常比純文字更容易維持外觀。Gemini app 每次可上傳 1 支影片與最多 5 張圖片,適合把主體、道具與風格圖分開提供。
操作步驟
- 進入「建立影片」。
- 點選新增圖片,上傳參考圖。
- 說明這張圖的角色:它是第一個畫面、主體參考,還是只提供風格。
- 描述主體怎麼動、鏡頭怎麼動,以及環境要出現哪些變化。
- 生成後先檢查主體外觀,再處理特效或鏡頭細節。
Google 的 Gemini Omni Prompt Guide特別強調,不要只寫「讓它動起來」。圖片已經告訴模型主體長什麼樣子,但沒有告訴它要往哪裡移動、鏡頭如何拍、風與光線要怎麼變化。
草圖轉寫實影片 Prompt
把這張草圖轉成寫實影片。草圖只用來引導物體與動作,不要讓手繪線條出現在成品中。
一顆檸檬外型的小型潛水艇漂浮在清澈海面,接著緩慢下潛。鏡頭從水面高度跟拍,水珠滑過鏡頭,陽光穿透水面形成自然光束。單一連續鏡頭,動作符合浮力與水流,不要加入文字或旁白。
這種做法很適合把包裝草圖、商品概念或分鏡變成動態提案。它不代表模型能取代正式 3D 建模,但可以讓團隊更快確認方向是否值得繼續製作。
Gemini Omni 教學三:用對話修改影片
對話式編輯是 Gemini Omni 最值得用的功能。傳統 AI 影片常遇到一個問題:第一版只有一個地方不對,但重新寫 Prompt 後,連原本正確的人物、構圖與節奏也一起改掉。
Gemini Omni 允許你接著上一版下指令,只修改指定部分。官方列出的常見操作包括替換物件、移除角色、改變鏡頭角度與調整場景。
建議的修改順序
- 先修主體與動作。
- 再調整鏡頭角度與運鏡。
- 接著修改背景、天氣與光線。
- 最後處理文字、音效與風格。
一次只改一個主要變數,最容易看出模型有沒有照做。如果你同時要求換人物、改夜景、加雨、換鏡頭與加入字幕,失敗時很難知道是哪一項造成問題。
多輪修改範例
第一輪:
保留人物、服裝、動作與影片長度,只把背景從白天改成夜晚。加入街燈與遠處車流的反光,維持寫實風格。
第二輪:
保持上一版的夜景與人物不變。把鏡頭改成從人物右後方拍攝的過肩視角,運鏡平穩,不要增加新的角色。
第三輪:
保留目前畫面,只加入輕微雨聲與遠處城市環境音。不要音樂,不要改變人物聲音。
這個流程的重點,是每一輪都說清楚「保留什麼」與「只改什麼」。與其反覆重做整支影片,逐輪收斂通常更節省時間,也比較容易維持一致性。
用 Google Flow 製作時,流程有什麼不同?
Google Flow 比 Gemini app 更接近影片工作空間。你可以在同一個專案裡保留素材、嘗試不同模型與生成方式,適合需要比較多版本的人。
建立專案後,先查看 Prompt 輸入框附近的設定,確認目前模型是 Gemini Omni Flash,並檢查影片長度、比例與所需點數。依官方功能表,Flow 的 Gemini Omni Flash 可生成 4、6、8 或 10 秒影片,也能編輯上傳或剛生成的影片。
使用 Flow 時,建議把素材分成三類:
- 第一幀:影片要從這張畫面開始。
- 主體參考:用來維持人物、商品或物件外觀。
- 風格參考:只借用色彩、材質或畫面語言,不照搬內容。
如果你的需求只是「做一支 8 秒短片」,Gemini app 會更快。Flow 的價值在於版本多、素材多,或你準備把多個片段組成完整內容時,能減少來回整理檔案的成本。
Gemini Omni Prompt 怎麼寫?
一個好用的 Prompt 不需要堆滿攝影術語,但至少要回答以下問題。
| Prompt 元素 | 要回答的問題 | 範例 |
|---|---|---|
| 主體 | 誰或什麼是畫面重點? | 一位穿黃色雨衣的女生 |
| 動作 | 主體在做什麼? | 緩慢走過積水的街道 |
| 場景 | 地點與時間是什麼? | 清晨的台北巷弄 |
| 鏡頭 | 景別與移動方式? | 低角度跟拍、單一連續鏡頭 |
| 光線與風格 | 畫面看起來如何? | 柔和陰天光、寫實紀錄片風格 |
| 聲音 | 要保留哪些聲音? | 雨聲與腳步聲,不要音樂 |
| 限制 | 哪些內容不能改? | 不改人物服裝,不增加路人 |
可以把它整理成一個容易維護的公式:
[影片比例與長度]+[主體]+[動作]+[場景]+[鏡頭]+[光線/風格]+[聲音]+[保留與禁止事項]
官方建議英文 Prompt 的穩定性較高。你可以先用中文整理需求,再請 Gemini 翻成自然的英文影片 Prompt。這比一開始就硬寫攝影英文更省時間,也比較不容易漏掉限制。
5 個值得實作的 Gemini Omni 用法
Google 官方整理的 builder 案例,不只是在展示特效,也指出 Gemini Omni 適合哪些真實工作。
1. 同一場景快速換鏡位
先保留人物與動作,再要求正面、側面、俯視或過肩鏡頭。這適合廣告提案與分鏡測試,因為你能先比較敘事效果,再決定是否投入實拍。
Leon Lin 使用 Gemini Omni 從多個角度呈現同一人物與城市場景。影片來源:Google Blog/Leon Lin。 查看官方來源
2. 改變季節、天氣與時間
把白天改成夜晚、綠葉改成秋色,或加入下雨與積雪。這類修改適合概念展示,但要留意光影、人物衣著與地面狀態是否一起變得合理。
Carlos Santana 透過語音指令把戶外場景改成夜晚、雨天、秋季與雪景。影片來源:Google Blog/Carlos Santana。 查看官方來源
3. 把草圖變成動態概念
用手繪線條定義物體與運動方向,再要求生成寫實或動畫版本。它適合產品概念與教學示意,不適合拿來證明真實產品已經完成。
4. 轉換動畫與視覺風格
在人物動作不變的前提下,改成黏土動畫、鉛筆素描或紙張拼貼。使用自有素材或授權清楚的參考圖,能降低模仿特定藝術家與作品的風險。
Jerrod Lew 讓人物行走動作保持連續,同時切換實拍、動畫與黏土等視覺風格。影片來源:Google Blog/Jerrod Lew。 查看官方來源
5. 把抽象資訊變成短片
景觀設計前後對照、數據解說與流程示意,都可以先做成視覺草稿。教育或商業內容仍要人工核對知識與數字,不能因為畫面合理就把生成內容當成事實。
Hyperagent 把景觀配置加入空地影片,用前後對照呈現設計構想。影片來源:Google Blog/Hyperagent。 查看官方來源
Gemini Omni 和 Veo 3.1 有什麼差別?
兩者都能生成影片,但使用重點不同。依 Google Flow 的官方功能表,Gemini Omni Flash 強調多種參考素材、上傳影片編輯與對話式修改;Veo 3.1 則提供 Lite、Fast、Quality 等生成選項,並支援延長特定 Veo 影片。
如果你要從一句 Prompt 產出一支新影片,兩者都可以嘗試。如果你已經有影片,想在保留原場景的情況下繼續改內容,Gemini Omni 會更符合需求。
使用限制與常見問題
影片長度、解析度是多少?
Google Flow 目前提供 4、6、8、10 秒選項。Gemini API 文件標示輸出為 3–10 秒、720p、24 FPS。不同入口的功能不完全相同,實際選項以你使用介面顯示為準。
可以上傳自己的影片修改嗎?
可以。Gemini app 與 Flow 都列出影片編輯功能,但各地區與帳號可能有不同限制。短片越清楚、主體越單純,越容易精準修改。
可以使用中文 Prompt 嗎?
Flow 支援中文介面與輸入,但 Google 仍建議使用英文 Prompt 取得較穩定的結果。實際做法可以是先用中文整理需求,再翻成英文送出。
為什麼同一個 Prompt 每次結果不同?
生成影片不是傳統剪輯指令,同一句 Prompt 仍可能產生不同構圖與動作。若某一版已經有大部分正確,不要回到最初重生;直接在同一段對話指出要保留與修改的部分。
點數怎麼計算?
Flow 依模型、影片長度與編輯方式扣除點數,而且一次請求可能產生多個 generation。送出前先查看 Prompt 設定旁顯示的即時成本。訂閱方案的每月點數不會累積到下一個週期。
生成影片可以直接商用嗎?
工具可用不代表所有輸入素材與輸出內容都能直接商用。人物肖像、商標、音樂、參考圖與第三方影片仍受各自權利限制。商業發布前應確認素材來源、授權範圍與 Google 當期條款。
結論:把 Gemini Omni 當成能對話的影片草稿工具
Gemini Omni 最適合的工作,不是一次生成最終成品,而是快速做出第一版,再逐步調整鏡頭、環境、物件與風格。
新手可以先從 8 秒、單一場景、單一動作開始。第一版確認主體與構圖,後續每一輪只改一件事。當素材與版本變多,再把工作移到 Google Flow。這樣比追求一次寫出完美 Prompt 更快,也更容易控制成本。
資料來源
- Google Blog:See what 5 builders are making with Gemini Omni
- Google DeepMind:Gemini Omni
- Google DeepMind:Gemini Omni Prompt Guide
- Gemini Apps Help:Generate videos with Gemini Apps
- Google Flow Help:Models and supported features
- Google Flow Help:Supported regions
- Google Flow Help:Credits
- Gemini API:Generate and edit videos with Gemini Omni Flash
- Google One 台灣:Google AI 方案