Gemini Agentic Video Understanding 是什麼?長影片分析最多省 88% Token,功能與限制完整解析

Gemini Agentic Video Understanding 讓模型依問題主動搜尋影片片段。本文解析最多省 88% Token 的原理、適用情境、費用與 Preview 限制。

Share
Gemini Agentic Video Understanding 官方主視覺
Google 在 2026 年 9 月 1 日公布 Gemini Agentic Video Understanding。 圖片來源:Google 官方公告(https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/)

以前把一堂 90 分鐘課程交給 AI 分析,模型通常會按照固定頻率擷取畫面,再把大量影格、聲音與逐字稿一起送進模型。影片越長,處理的資料越多,成本也跟著增加。若降低取樣頻率,又可能剛好漏掉關鍵動作。

Google 在 2026 年 9 月 1 日公布 Gemini Agentic Video Understanding,改用另一種做法:模型先理解問題,再決定要查看哪個時間區段、讀逐字稿、聽音訊,或提高特定片段的影格取樣率。

Google 官方測試顯示,這套方法在長影片任務中可減少最多 88% 的 Token、降低最多 66% 的分析成本,正確率則相對提升最高約 7%。Token 可以把它理解成 AI 處理資訊時的計價單位。不過,這些都是不同測試中的最佳結果,不代表每支影片都會得到相同幅度。

我的判斷是中性偏多。對需要整理課程、會議、監視器畫面或大量素材的團隊,這是一個值得測試的架構升級。不過功能仍屬 Preview,也就是尚未進入正式穩定版,導入前仍要用自己的影片比較正確率、成本與延遲。

Gemini Agentic Video Understanding 是什麼?

Gemini Agentic Video Understanding 是 Gemini API 的影片分析模式。API 是讓開發者用程式把 Gemini 功能接進自家產品的介面。Agentic 在這裡不是指 AI 會自行替你發布影片或執行商業決策,而是模型能依照任務目標,主動選擇下一步要找什麼證據。

Google 既有的 Static 模式會以固定頻率讀取影片,預設為每秒 1 個影格,也就是 1 FPS。這種方式簡單而穩定,但不管某一段有沒有用,都可能先放進模型的上下文,也就是這次回答能參考的資料範圍。Agentic 模式則會在分析過程中,動態呼叫影片工具取得需要的影格、音訊或逐字稿。

兩者的差別,可以想成看一場 90 分鐘發表會:

  • Static 模式像是固定每秒拍一張照片,再把整疊照片交給分析者。
  • Agentic 模式會先瀏覽內容與線索,找到產品發布所在的時間區段,再回頭細看畫面和聽取說明。

Gemini 早已能「看懂影片」,這次新增的是讓模型自己規劃怎麼看。真正的價值,在於把影片取樣與搜尋策略從開發者手寫規則,移到模型的推理循環裡。

延伸閱讀:Google I/O 2026 完整總覽:Gemini 3.5、Antigravity 2.0、Android XR 眼鏡

Agentic Video 如何運作?先找線索,再集中查看

Gemini Agentic Video Understanding 依問題動態取得影格、音訊與逐字稿
模型可依問題呼叫逐字稿、影格或音訊工具,再整合證據回答。 圖片來源:Google 官方公告

當使用者提供影片與問題後,Gemini 不必立刻把整支影片用同一種解析方式讀完。它可以在「思考」與「觀察」之間來回,直到找到足以回答問題的證據。

整個流程可以拆成 4 步:

  1. 讀取使用者的問題,判斷要找人物、動作、聲音、對話,還是特定時間點。
  2. 先掃描影片時間軸與逐字稿,縮小可能相關的區段。
  3. 針對關鍵片段取得影格或音訊,必要時改用更高的 FPS 重新查看快速動作。
  4. 整合不同時間點的證據,再產生答案與時間位置。

這種方法特別適合「大部分內容都不相關,答案只藏在少數片段」的問題。例如,從 3 小時監視器畫面找出某個物件何時被移動,或從完整發表會找出 3 項重要產品更新。

不過,主動搜尋不等於永遠更快。模型要先推理、呼叫工具,再取得下一段資料。Google 文件也提醒,5 分鐘以下的短片可能因為這些往返,提高產生第一個回答前的等待時間。

最多省 88% Token,數字該怎麼看?

Gemini 3.7 Flash 開啟 Agentic Video 後的 Token 與正確率比較
官方三項評測的 Token 降幅介於 58.4% 至 88%,正確率相對提升約 1.1% 至 7.2%。 圖片來源:Google 官方公告

Google 用 Gemini 3.7 Flash 比較 Static 與 Agentic 兩種模式。在 1H-VideoQA 與 LVBench 長影片評測中,Agentic 模式的 Token 分別從 397,600 降至 47,700,以及從 300,300 降至 36,000,兩組都約減少 88%。

但 Minerva 複雜推理測試的 Token 降幅約為 58.4%,不是 88%。這表示節省幅度會隨影片內容、問題與模型的搜尋策略而變化。「最多省 88%」應該理解為官方測試中的最佳結果,而不是固定折扣。

正確率也不是直接增加 7 個百分點。在 Minerva 測試中,正確率從 73.7% 增至 79.0%,增加 5.3 個百分點,換算為相對提升約 7.2%。另外兩項長影片測試的相對增幅約為 1.1% 與 4.1%。

這些結果仍有一個實務價值:過去降低 Token 往往意味著減少取樣、犧牲細節。這次 Google 展示的是 Token 下降時,正確率反而提高。若這個方向能在自有資料重現,團隊就不必一直在成本與品質之間二選一。

0:00
/0:00

Google 以 LongVideoBench 示範 Gemini 3.7 Flash 在 Static 與 Agentic 模式下的 Token 用量與答案差異。 影片來源:Google 官方公告

Gemini Agentic Video 可以做什麼?

1.從長影片找出特定瞬間

模型能在數小時的影片中搜尋某個事件,並回傳相關時間點。這適合會議錄影、課程、訪談、賽事與素材庫搜尋。

如果要找的是一個不到 1 秒的畫面變化,Agentic 模式可以先鎖定區段,再提高取樣率查看。相較全片固定使用高 FPS,這種做法有機會保留細節,又不讓整支影片的 Token 一起膨脹。

2.偵測異常動作

監視器、製造流程與運動影片經常包含大量重複畫面。模型可以先用低成本方式掃描,再針對可疑區段重新取樣,檢查快速動作或短暫異常。

但這類用途不能只靠自然語言回答就直接觸發安全、醫療或人事決策。若錯判會造成人身或財務影響,仍需要明確的規則、人工複核與可追溯的原始片段。

3.計算動作與物件

固定每秒只看一格,可能漏掉快速完成的開合跳、產品通過輸送帶,或畫面一閃而過的物件。Agentic 模式能在需要的區段調高 FPS,再重新計數。

這不代表它已經等同專用電腦視覺系統。若任務要求零漏算、固定鏡頭校正或即時控制,仍應與傳統偵測模型和規則系統比較。

0:00
/0:00

Google 示範 Gemini 3.7 Flash 依需要改用不同 FPS 重新查看快速動作,再計算開合跳次數。 影片來源:Google 官方公告

4.替影片剪輯流程找素材

Google 把精確片段搜尋與剪輯點定位列為應用方向。實際工作流可以先讓 Gemini 找出「講者提到價格的段落」或「畫面開始切換的瞬間」,再把時間碼交給剪輯工具處理。

Gemini 在這裡主要負責理解與定位,不是直接輸出剪好的 MP4。若要完成自動剪輯,仍需串接 FFmpeg、HyperFrames 或其他時間軸工具。

延伸閱讀:Claude Code 剪影片教學:搭配 HyperFrames 自動加字幕、動畫與輸出 MP4

Agentic 與 Static 模式怎麼選?

比較項目 Agentic 模式 Static 模式
讀取方式 依問題動態取得影格、音訊與逐字稿 預設固定以 1 FPS 擷取影格
適合影片 長影片、多小時錄影 5 分鐘以下短片
適合問題 找特定片段、長片問答、異常與計數 全片逐格檢查、重視首字延遲
Token 用量 依搜尋路徑變動,長影片通常較省 隨影片長度與解析度較規律增加
等待時間 短片可能因推理與工具呼叫稍慢 短片通常較直接
支援模型 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 所有支援影片輸入的 Gemini 模型

最實際的做法,是依影片與問題選擇模式。長課程、長會議與只找少數事件的任務,可以先用 Agentic。短片或要求整段逐格核對的流程,則繼續使用 Static。Gemini API 也允許在同一個請求中,替不同影片指定不同模式。

哪些模型與平台已經支援?

截至 2026 年 9 月 2 日,Agentic Video Understanding 支援以下模型:

  • Gemini 3.7 Flash。
  • Gemini 3.6 Flash。
  • Gemini 3.5 Flash-Lite。

開發者可透過 Gemini API、Google AI Studio 與 Gemini Enterprise Agent Platform 使用,輸入來源包含影片檔案與 YouTube 影片。Google 表示,這項能力之後也會進入 Gemini app 的 Flash/Flash-Lite 模型,並在未來幾個月用於 YouTube 觀看頁面的 Ask YouTube。

後兩項仍是預告,不應寫成所有一般使用者已經拿到新功能。對不寫程式的人來說,目前可以先理解用途,但真正可控的 Agentic 模式仍以開發平台為主。

另外,Gemini Omni 著重生成與修改影片。Agentic Video Understanding 則是閱讀、搜尋與分析既有影片。兩者名稱都與影片有關,但解決的問題不同。

延伸閱讀:Gemini Omni 教學:用文字、圖片生成影片,再用對話直接修改

開發者如何啟用 Agentic Video Understanding?

開發者要做的核心設定,是在影片輸入中把 processing 設為 agentic。以下是 Google 文件的 Python 寫法簡化版:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://www.youtube.com/watch?v=YOUR_VIDEO_ID",
            "processing": "agentic",
        },
        {
            "type": "text",
            "text": "整理這場發表會的 3 項重要更新,附上時間點與畫面證據。",
        },
    ],
)

print(interaction.output_text)

API 是讓程式呼叫 Gemini 的介面。你不必把取樣、切片與逐字稿搜尋全部自己寫完,但 Prompt 仍要明確定義問題、輸出格式與證據要求。

若要用於產品,建議先準備 20~50 支具代表性的影片,讓 Agentic 與 Static 回答同一批問題,再比較 4 個指標:答案正確率、引用時間點是否準確、每次請求成本,以及第 95 百分位延遲,也就是大多數使用者遇到的較慢等待時間。

只看平均成本很容易誤判。如果便宜 60%,卻有少數重要問題找錯片段,省下的 API 費用可能抵不過人工修正與使用者信任成本。

Gemini Agentic Video 費用怎麼算?

Google 表示 Agentic Video Understanding 不收額外功能費,仍依 Gemini API 的輸入與輸出 Token 計價。它降低成本的方式,是減少實際送進模型處理的影片內容,而不是提供另一套固定折扣。

以 Gemini 3.7 Flash 的 Standard 方案為例,截至 2026 年 9 月 2 日,2026 年 12 月 31 日前的輸入價格為每 100 萬 Token 0.75 美元,輸出為 3.75 美元。2027 年 1 月 1 日起將分別調整為 1.50 與 7.50 美元。

因此,「最多降低 66% 成本」仍要視實際問題而定。Agentic 模式除了載入的影格、音訊與逐字稿,也會產生導航推理所用的 Token。影片越長、問題越聚焦,通常越容易展現節省效果。如果問題要求完整檢查每一秒,模型就沒有太多內容可以跳過。

正式導入前要注意哪些限制?

1.目前仍是 Preview

Google Cloud 文件把 Agentic Video Understanding 標示為 Preview,API 也只在 v1beta1 提供,而且預設為 Static 或未啟用。Preview 功能可能調整介面、限制與行為,正式產品不應只靠一次串接就假設長期穩定。

2.官方數據不是所有工作負載的保證

88% Token、66% 成本與約 7% 品質提升,都是「最高」結果。官方圖表也採特定模型、推理等級、媒體解析度與 Static 取樣設定。自己的影片長度、語言、字幕品質與問題類型不同,結果可能明顯改變。

3.主動搜尋仍可能找錯地方

Agentic 模式的效率來自不必看完所有內容,風險也在同一點:如果第一輪線索判斷錯誤,模型可能沒有載入真正關鍵的片段。正式流程應要求回傳時間點與證據,並保留人工抽查機制。

4.多輪對話要保留影片上下文

使用 Stateless 模式,也就是伺服器不替程式保留前一輪對話狀態時,開發者必須把先前回應中的處理步驟帶到下一輪。否則影片上下文會遺失,後續問題的品質可能大幅下降。這不是一般使用者會看到的問題,卻會直接影響產品串接是否可靠。

5.影片權利與個資不會因為更省 Token 就消失

把會議、監視器、客戶訪談或內部訓練影片送進 API 前,仍要確認上傳權限、資料保存政策、個資告知與存取控制。模型能分析,不代表團隊已取得處理影片中人物、聲音與機密資訊的權利。

Gemini Agentic Video 值得用嗎?

如果你的產品經常處理 10 分鐘以上影片,而且問題通常只指向少數片段,我認為值得立刻做小規模測試。它可能把原本需要自行維護的切片、逐字稿搜尋與影格重取樣流程,收斂成一個由模型主動規劃的分析循環。

但我不建議現在就把所有影片任務全面切換。短片、逐格稽核與高風險判定仍有保留 Static 或專用模型的理由。更務實的導入順序是:先選一個高 Token、低風險的長影片工作,例如課程章節整理或素材搜尋,建立 Agentic/Static 對照測試,再逐步擴大。

真正會改變這個判斷的,是團隊能否在自有影片上同時看到三件事:成本穩定下降、時間點引用可靠,以及錯誤率沒有把人工複核成本推高。這比下一張官方評測圖更重要。三項都成立,Agentic Video Understanding 才算從漂亮 Demo 變成值得維護的產品能力。

FAQ 常見問題

Gemini Agentic Video Understanding 是影片生成工具嗎?

不是。它用來理解、搜尋與分析既有影片,輸出通常是答案、摘要或時間點。若要生成或修改影片,可使用 Gemini Omni、Veo 或其他影片工具。

真的可以節省 88% Token 嗎?

Google 在兩項長影片評測中測得約 88% 的 Token 降幅,但另一項測試約為 58.4%。實際節省幅度會受到影片長度、問題、語言與需要查看的片段比例影響。

Agentic 模式一定比 Static 準確嗎?

不一定。官方測試顯示三項評測都有提升,但 Agentic 可能因搜尋路徑錯誤而漏掉證據。短片、逐格檢查或高風險任務仍應進行對照測試與人工複核。

一般 Gemini app 使用者現在能用嗎?

Google 已先向 Gemini API、Google AI Studio 與 Gemini Enterprise Agent Platform 開放。Gemini app 的 Flash/Flash-Lite 模型與 YouTube 的 Ask YouTube 屬後續推出項目,實際可用時間仍以帳號介面為準。

使用 Agentic Video 需要額外付費嗎?

Google 沒有另收功能費,仍按照所用模型的輸入與輸出 Token 計價。成本是否下降,要看 Agentic 模式實際省下多少影片處理量。

資料來源