Gemini Omni 1.1 Flash 教學:用 360p 試稿、延伸 40 秒,再輸出 4K
Gemini Omni 1.1 Flash 實作教學:先用 360p 低成本試稿,再控制首尾影格、分段延伸影片,最後輸出 1080p 或 4K。
Google 在 2026 年 8 月 27 日發布 Gemini Omni 1.1 Flash。這次更新不只增加 4K 輸出,也補上 360p 草稿、首尾影格控制、參考影片與最長 40 秒的累積場景延伸。
如果只把它當成「輸入一句話,等待 AI 產生影片」,很容易把預算花在反覆重抽。比較實際的用法,是先用低解析度測試人物、動作與鏡頭,再延伸選中的版本,最後才升級畫質。
這篇文章會用一支產品短片為例,帶你走過完整流程:選擇工具、準備素材、撰寫 Prompt、用 360p 試稿、控制首尾畫面、延伸影片,以及輸出 1080p 或 4K。
我的評價是中性偏多。Gemini Omni 1.1 Flash 已補上不少實際製作會需要的控制工具,但 4K 仍是放大輸出,長影片也要分段延伸。它更像可反覆修改的 AI 影片工作台,還不是 Premiere Pro 或 DaVinci Resolve 的完整替代品。
Gemini Omni 1.1 Flash 是什麼?
Gemini Omni 是 Google 用來生成與編輯影片的多模態模型。「多模態」指的是它可以同時理解文字、圖片、影片與聲音,再把這些素材組合成同一段內容。
舊版 Gemini Omni Flash 已經支援文字轉影片、圖片轉影片與對話式修改。1.1 版沒有推翻原本做法,而是補上更接近正式製作的控制能力。
| 新功能 | 能解決什麼問題? | 需要注意什麼? |
|---|---|---|
| 10 秒上下文場景延伸 | 讓人物、光線與故事較容易接續 | 仍須分段延伸,不能一次生成完整 40 秒 |
| 首尾影格控制 | 指定開始與結束畫面,由模型補出中間轉場 | 不等於逐格手動控制 |
| 最多 3 支參考影片 | 參考動作、角色與畫面風格 | 每支最多 3 秒,參考影片的音訊會被忽略 |
| 360p 草稿 | 用較低成本快速比較多個版本 | 適合挑方向,不適合直接交付 |
| 1080p/4K 輸出 | 把入選影片放大成較高解析度 | 兩者都是 upscaling,不是原生高解析生成 |
這些功能放在一起看,1.1 版的定位就很清楚:先用低成本草稿找方向,再處理鏡頭與一致性,最後才投入高解析輸出。這比一開始就花錢生成 4K 更符合真實工作流程。
延伸閱讀:Gemini Omni 教學:用文字、圖片生成影片,再用對話直接修改
開始前先選工具:Gemini app、Flow 還是 AI Studio?
同一個模型有不同入口,選錯工具會讓操作變複雜。先依照自己的目的決定:
API 是讓不同軟體互相呼叫功能的介面。如果只是做一支社群短片,不需要先研究 API;只有要把影片生成功能放進網站、App 或自動化流程時才值得使用。
| 使用情境 | 建議入口 | 原因 |
|---|---|---|
| 偶爾生成或延伸一段短片 | Gemini app | 操作最直接,不需要寫程式 |
| 管理多個素材與版本 | Google Flow | 適合比較草稿、延伸故事與整理製作流程 |
| 測試模型能力與 Prompt | Google AI Studio | 可直接選模型並調整輸入內容 |
| 串入產品或批次生成 | Gemini API | 可由程式自動送出請求與管理結果 |
Gemini Omni 1.1 Flash 教學:從 10 秒草稿做到完整短片
以下用「製作一支咖啡機產品短片」當例子。目標不是一次做完整支廣告,而是先取得一個穩定鏡頭,再把它延伸成 20 至 40 秒的素材。
步驟一:先寫清楚鏡頭目標
開始前先決定五件事:主體、動作、場景、鏡頭與聲音。不要只輸入「幫我做一支高級咖啡廣告」,因為模型必須自行猜測太多細節,每次結果也會差很多。
可以使用下面這個 Prompt 結構:
主體:畫面中最重要的人物或商品
動作:主體要做什麼
場景:地點、時間與光線
鏡頭:景別、角度與運鏡方式
聲音:環境音、音效或旁白需求
限制:不要出現的文字、人物或鏡頭變化
例如:
一台霧黑色義式咖啡機放在清晨的木質廚房檯面上。
鏡頭從咖啡豆特寫緩慢向後拉,接著移向咖啡流入白色杯子的畫面。
自然晨光從左側進入,整體風格乾淨、寫實、溫暖。
保留研磨聲與咖啡滴落聲,不要出現人物、字幕、Logo 或突然切換場景。
這樣寫的目的不是把 Prompt 拉得很長,而是減少模型自行補猜的空間。如果輸出仍不穩定,可以改用英文描述,因為官方文件目前以英文完成較完整的品質評估。
步驟二:先用 360p 產生 3 至 4 個版本
第一輪不要急著生成 4K。先用 360p 做 3 至 4 個草稿,每次只改一項變數,例如鏡頭速度、光線或商品位置。
如果人物與場景都正確,只有鏡頭太快,就只調整運鏡描述,不必重新設計整段 Prompt。Google 表示,360p 的系統吞吐量最高可比 720p 快 60%,價格約為 720p 的三分之一。這不是每次請求都保證加速,但很適合用來淘汰方向錯誤的版本。
步驟三:用首尾影格控制鏡頭終點
找到合適的畫面方向後,可以指定第一個畫面與最後一個畫面,讓模型補出中間的連續動作。這種做法稱為影格插值,白話來說,就是先決定鏡頭從哪裡出發、最後停在哪裡,再讓 AI 完成中間過程。
在咖啡機範例中,第一張圖可以是咖啡豆特寫,最後一張圖則是完成的咖啡杯。這比只用文字要求「從咖啡豆移動到咖啡杯」更容易控制構圖與終點。
步驟四:分段延伸,不要一次塞完整故事
完成第一段影片後,再決定下一段只推進哪一個動作。例如第一段停在咖啡倒入杯中,第二段就延伸到蒸氣升起與鏡頭慢慢靠近杯面。
延伸 Prompt 可以這樣寫:
延續目前的廚房、晨光、咖啡機與白色杯子,不要改變商品外觀。
咖啡流停止後,杯面蒸氣緩慢上升,鏡頭平順地向前推近。
保留原本的環境音與寫實風格,不要新增人物、字幕或切換場景。
如果故事需要從廚房切換到咖啡店,建議另做一個新鏡頭,再用剪輯軟體接起來。場景延伸更適合維持同一空間、人物與運鏡,不適合把多場戲硬塞進同一次生成。
步驟五:把影片分段延伸到 40 秒
場景延伸是這次最重要的升級。舊方法只參考影片最後 1 秒,新版會分析最後 10 秒,再決定人物位置、鏡頭運動、光線與聲音如何接續。
這個差異直接影響連貫性。只看最後 1 秒時,模型容易知道「畫面停在哪裡」,卻不知道人物剛才做了什麼。增加到 10 秒後,它能取得較完整的動作與敘事上下文,延伸時較不容易突然換人、換場景或跳掉情緒。
不過,官方所說的 40 秒是累積長度。透過 API,每次延伸會新增 3 至 10 秒。使用者可以重複延伸,最多累積到 40 秒,而不是按一次就產生一支 40 秒影片。延伸也只能接在影片尾端,不能向前補畫面或修改中段。
這讓我更看好它用於同一場景的短敘事,例如產品展示、角色對話或連續運鏡。若要做多場景長片,仍應先拆分鏡頭,再交給傳統剪輯工具組合。
參考影片怎麼用?先提供動作,不要交給 AI 重剪劇情
如果只用文字描述「從 A 轉到 B」,模型可能自行決定構圖。Gemini Omni 1.1 Flash 現在可指定第一個畫面與最後一個畫面,再生成兩者之間的連續動作。這種做法稱為影格插值,白話來說,就是把兩張關鍵畫面之間缺少的過程補出來。
它適合旋轉鏡頭、推拉變焦、人物進出畫面與無縫循環。創作者可以先鎖定開頭和結尾,不必把所有運鏡都交給模型猜。
另一項更新是影片參考。模型最多可接收 3 支參考影片,每支最長 3 秒,用來借用動作、人物外觀或視覺情境。例如,提供舞蹈動作影片與角色圖片,讓新角色依照參考動作表演。
這項功能仍有明顯邊界。參考影片中的音訊不會被採用,模型也不擅長同時理解多支影片之間的故事關係。因此,它適合把單一動作轉移到新角色,不適合拿幾段完整影片要求 AI 自動重剪劇情。
步驟六:算清楚成本,最後才輸出 1080p 或 4K
生成影片最常被低估的成本,不是最後那支成品,而是前面被淘汰的版本。Google 因此加入 360p 草稿模式,官方表示速度最高可比標準 720p 快 60%,價格則是 720p 的三分之一。
截至 2026 年 8 月 29 日,Gemini API 採影片秒數計價:
| 解析度 | 每秒價格 | 生成 10 秒的價格 |
|---|---|---|
| 360p | US$0.03 | US$0.30 |
| 720p | US$0.10 | US$1.00 |
| 1080p | US$0.15 | US$1.50 |
| 4K | US$0.30 | US$3.00 |

最實際的做法,是先以 360p 產生 3 至 4 個版本,每次只改一項變數。確認人物、動作與鏡頭後,再把入選版本輸出為 1080p 或 4K。若一開始就用 4K 反覆抽版本,10 次 10 秒生成要花 US$30;同樣的草稿階段用 360p 則是 US$3。
這也說明 4K 不一定是首選。社群短片在手機上播放時,1080p 往往已足夠。只有需要大尺寸展示、後製裁切或客戶交付時,4K 的額外成本才比較合理。
Gemini Omni 1.1 Flash 在哪裡可以用?
開發者可直接在 Google AI Studio 測試,或透過 Gemini API 串進自己的影片工具。企業團隊則可從 Gemini Enterprise Agent Platform 部署。
一般使用者不需要碰 API。Google 表示,Gemini Omni 1.1 已在 Google Flow 向全球 Google AI Plus、Pro 與 Ultra 訂閱者開放;Gemini app 的場景延伸也向這三種方案的全球訂閱者提供。不同帳號可能仍會分批看到入口,實際功能與用量要以登入後畫面為準。
如果只想快速生成或延伸一段短片,Gemini app 最省事。需要管理素材、比較多個版本與建立完整製作流程時,Google Flow 會比較適合。要把功能放進產品或自動化大量生成,才需要 Google AI Studio 與 API。
Gemini Omni 1.1 Flash 值得用嗎?
若工作需要反覆試稿、保持角色一致,或把一段鏡頭延伸成較長敘事,Gemini Omni 1.1 Flash 值得測試。10 秒上下文與低成本草稿會直接減少每次從頭重做的浪費,首尾影格也讓結果更容易收斂。
但如果需求是精準剪接、調色、字幕時間軸、音訊混音或多人協作,它仍不能取代成熟剪輯軟體。官方也明確列出幾項限制:不能在影片中段延伸、不支援 voice editing、上傳影片最長 10 秒,英文以外的語言尚未完成同等程度的評估。
因此,我會把它定位成「生成與初剪工作台」,而不是最終後製工具。先用 Omni 找畫面、測運鏡與延伸故事,再把選中的素材交給 Premiere Pro、DaVinci Resolve 或其他剪輯工具完成字幕、聲音與輸出,會是目前成本與控制最平衡的做法。
延伸閱讀:Google 推出 Veo 3.1 模型:為 AI 影片創作帶來更豐富音訊與精確編輯
Gemini Omni 1.1 Flash 常見問題
Gemini Omni 1.1 Flash 可以一次生成 40 秒影片嗎?
不行。API 每次生成或延伸 3 至 10 秒,可透過多輪操作把影片累積延伸到 40 秒。40 秒是累積長度,不是單次輸出長度。
4K 是原生生成嗎?
不是。官方文件把 1080p 與 4K 都標示為 upscaled output,也就是把生成結果放大到較高解析度。畫面尺寸提高,不代表細節一定等同原生 4K 拍攝。
Gemini Omni 1.1 Flash 免費嗎?
完整消費者功能目前提供給 Google AI Plus、Pro 與 Ultra 訂閱者。開發者使用 Gemini API 則依輸出解析度與影片秒數計費。方案用量、Flow 點數與 API 費用是不同機制,不能直接互換。
生成影片會標示 AI 來源嗎?
會。Google 表示生成影片會加入肉眼看不到、但可由系統偵測的 SynthID 浮水印。透過 Gemini app、Google Flow 或 YouTube 建立與編輯的內容,另會加入 C2PA Content Credentials,提供內容來源資訊。
結論:先把試稿流程做對,再追求 4K
Gemini Omni 1.1 Flash 沒有解決 AI 影片的所有問題,但它開始處理創作者每天遇到的真實摩擦:草稿太貴、延伸後人物跑掉、運鏡難控制,以及每次修改都要重來。
現階段最值得採用的不是直接追求 4K,而是建立分層流程。先用 360p 找到可用方向,再用首尾影格與參考素材控制動作,接著延伸故事,最後才把入選版本升到 1080p 或 4K。這套流程若能降低重跑次數,Omni 1.1 的價值才會真正反映在製作成本上。