Gemini Omni 1.1 Flash 發布:4K、40 秒場景延伸與價格一次看
Gemini Omni 1.1 Flash 加入 10 秒上下文場景延伸、首尾影格控制、360p 草稿及 4K 放大輸出,重點是把試稿到交付接成完整流程。
Google 在 2026 年 8 月 27 日發布 Gemini Omni 1.1 Flash。這次更新表面上有 4K 輸出,但真正實用的改變,是讓 AI 影片從「每次重抽一支」逐漸變成能控制、延伸與反覆修改的製作流程。
新版本可參考原影片最後 10 秒來延伸場景,還能指定第一個與最後一個畫面、用 360p 快速試稿,再把選中的成品放大到 1080p 或 4K。對廣告提案、社群短片與分鏡測試來說,這比單純提高畫質更有價值。
我的評價是中性偏多。Gemini Omni 1.1 Flash 已補上不少實際製作會需要的控制工具,但 4K 仍是放大輸出,長影片也要分段延伸。它更像可反覆修改的 AI 影片工作台,還不是 Premiere Pro 或 DaVinci Resolve 的完整替代品。
Gemini Omni 1.1 Flash 是什麼?
Gemini Omni 是 Google 用來生成與編輯影片的多模態模型。「多模態」指的是它可以同時理解文字、圖片、影片與聲音,再把這些素材組合成同一段內容。
舊版 Gemini Omni Flash 已經支援文字轉影片、圖片轉影片與對話式修改。1.1 版沒有推翻原本做法,而是補上更接近正式製作的控制能力。
| 新功能 | 能解決什麼問題? | 需要注意什麼? |
|---|---|---|
| 10 秒上下文場景延伸 | 讓人物、光線與故事較容易接續 | 仍須分段延伸,不能一次生成完整 40 秒 |
| 首尾影格控制 | 指定開始與結束畫面,由模型補出中間轉場 | 不等於逐格手動控制 |
| 最多 3 支參考影片 | 參考動作、角色與畫面風格 | 每支最多 3 秒,參考影片的音訊會被忽略 |
| 360p 草稿 | 用較低成本快速比較多個版本 | 適合挑方向,不適合直接交付 |
| 1080p/4K 輸出 | 把入選影片放大成較高解析度 | 兩者都是 upscaling,不是原生高解析生成 |
這些功能放在一起看,1.1 版的定位就很清楚:先用低成本草稿找方向,再處理鏡頭與一致性,最後才投入高解析輸出。這比一開始就花錢生成 4K 更符合真實工作流程。
Google 展示如何指定第一個與最後一個畫面,再由 Gemini Omni 1.1 Flash 生成連續運鏡與轉場。 影片來源:Google 官方公告。
延伸閱讀:Gemini Omni 教學:用文字、圖片生成影片,再用對話直接修改
影片可以延伸到 40 秒,但不是一次生成
場景延伸是這次最重要的升級。舊方法只參考影片最後 1 秒,新版會分析最後 10 秒,再決定人物位置、鏡頭運動、光線與聲音如何接續。
這個差異直接影響連貫性。只看最後 1 秒時,模型容易知道「畫面停在哪裡」,卻不知道人物剛才做了什麼。增加到 10 秒後,它能取得較完整的動作與敘事上下文,延伸時較不容易突然換人、換場景或跳掉情緒。
不過,官方所說的 40 秒是累積長度。透過 API,每次延伸會新增 3 至 10 秒。使用者可以重複延伸,最多累積到 40 秒,而不是按一次就產生一支 40 秒影片。延伸也只能接在影片尾端,不能向前補畫面或修改中段。
這讓我更看好它用於同一場景的短敘事,例如產品展示、角色對話或連續運鏡。若要做多場景長片,仍應先拆分鏡頭,再交給傳統剪輯工具組合。
首尾影格與參考影片,讓運鏡更容易控制
如果只用文字描述「從 A 轉到 B」,模型可能自行決定構圖。Gemini Omni 1.1 Flash 現在可指定第一個畫面與最後一個畫面,再生成兩者之間的連續動作。這種做法稱為影格插值,白話來說,就是把兩張關鍵畫面之間缺少的過程補出來。
它適合旋轉鏡頭、推拉變焦、人物進出畫面與無縫循環。創作者可以先鎖定開頭和結尾,不必把所有運鏡都交給模型猜。
另一項更新是影片參考。模型最多可接收 3 支參考影片,每支最長 3 秒,用來借用動作、人物外觀或視覺情境。例如,提供舞蹈動作影片與角色圖片,讓新角色依照參考動作表演。
這項功能仍有明顯邊界。參考影片中的音訊不會被採用,模型也不擅長同時理解多支影片之間的故事關係。因此,它適合把單一動作轉移到新角色,不適合拿幾段完整影片要求 AI 自動重剪劇情。
360p 草稿省多少?Gemini Omni 1.1 API 價格整理
生成影片最常被低估的成本,不是最後那支成品,而是前面被淘汰的版本。Google 因此加入 360p 草稿模式,官方表示速度最高可比標準 720p 快 60%,價格則是 720p 的三分之一。
截至 2026 年 8 月 28 日,Gemini API 採影片秒數計價:
| 解析度 | 每秒價格 | 生成 10 秒的價格 |
|---|---|---|
| 360p | US$0.03 | US$0.30 |
| 720p | US$0.10 | US$1.00 |
| 1080p | US$0.15 | US$1.50 |
| 4K | US$0.30 | US$3.00 |

最實際的做法,是先以 360p 產生 3 至 4 個版本,每次只改一項變數。確認人物、動作與鏡頭後,再把入選版本輸出為 1080p 或 4K。若一開始就用 4K 反覆抽版本,10 次 10 秒生成要花 US$30;同樣的草稿階段用 360p 則是 US$3。
這也說明 4K 不一定是首選。社群短片在手機上播放時,1080p 往往已足夠。只有需要大尺寸展示、後製裁切或客戶交付時,4K 的額外成本才比較合理。
Gemini Omni 1.1 Flash 在哪裡可以用?
開發者可直接在 Google AI Studio 測試,或透過 Gemini API 串進自己的影片工具。企業團隊則可從 Gemini Enterprise Agent Platform 部署。
一般使用者不需要碰 API。Google 表示,Gemini Omni 1.1 已在 Google Flow 向全球 Google AI Plus、Pro 與 Ultra 訂閱者開放;Gemini app 的場景延伸也向這三種方案的全球訂閱者提供。不同帳號可能仍會分批看到入口,實際功能與用量要以登入後畫面為準。
如果只想快速生成或延伸一段短片,Gemini app 最省事。需要管理素材、比較多個版本與建立完整製作流程時,Google Flow 會比較適合。要把功能放進產品或自動化大量生成,才需要 Google AI Studio 與 API。
Gemini Omni 1.1 Flash 值得用嗎?
若工作需要反覆試稿、保持角色一致,或把一段鏡頭延伸成較長敘事,Gemini Omni 1.1 Flash 值得測試。10 秒上下文與低成本草稿會直接減少每次從頭重做的浪費,首尾影格也讓結果更容易收斂。
但如果需求是精準剪接、調色、字幕時間軸、音訊混音或多人協作,它仍不能取代成熟剪輯軟體。官方也明確列出幾項限制:不能在影片中段延伸、不支援 voice editing、上傳影片最長 10 秒,英文以外的語言尚未完成同等程度的評估。
因此,我會把它定位成「生成與初剪工作台」,而不是最終後製工具。先用 Omni 找畫面、測運鏡與延伸故事,再把選中的素材交給 Premiere Pro、DaVinci Resolve 或其他剪輯工具完成字幕、聲音與輸出,會是目前成本與控制最平衡的做法。
延伸閱讀:Google 推出 Veo 3.1 模型:為 AI 影片創作帶來更豐富音訊與精確編輯
Gemini Omni 1.1 Flash 常見問題
Gemini Omni 1.1 Flash 可以一次生成 40 秒影片嗎?
不行。API 每次生成或延伸 3 至 10 秒,可透過多輪操作把影片累積延伸到 40 秒。40 秒是累積長度,不是單次輸出長度。
4K 是原生生成嗎?
不是。官方文件把 1080p 與 4K 都標示為 upscaled output,也就是把生成結果放大到較高解析度。畫面尺寸提高,不代表細節一定等同原生 4K 拍攝。
Gemini Omni 1.1 Flash 免費嗎?
完整消費者功能目前提供給 Google AI Plus、Pro 與 Ultra 訂閱者。開發者使用 Gemini API 則依輸出解析度與影片秒數計費。方案用量、Flow 點數與 API 費用是不同機制,不能直接互換。
生成影片會標示 AI 來源嗎?
會。Google 表示生成影片會加入肉眼看不到、但可由系統偵測的 SynthID 浮水印。透過 Gemini app、Google Flow 或 YouTube 建立與編輯的內容,另會加入 C2PA Content Credentials,提供內容來源資訊。
結論:真正的升級,是先試稿再精修
Gemini Omni 1.1 Flash 沒有解決 AI 影片的所有問題,但它開始處理創作者每天遇到的真實摩擦:草稿太貴、延伸後人物跑掉、運鏡難控制,以及每次修改都要重來。
現階段最值得採用的不是直接追求 4K,而是建立分層流程。先用 360p 找到可用方向,再用首尾影格與參考素材控制動作,接著延伸故事,最後才把入選版本升到 1080p 或 4K。這套流程若能降低重跑次數,Omni 1.1 的價值才會真正反映在製作成本上。