AI Agent 影片工具 OpenMontage 實測:真的能接手整套影片製作流程嗎?

用技嘉 AORUS MASTER 16 GEN 2 實測 OpenMontage:從 Framework、Skill 與 Tool 的差異,到鹿港、老德里與文章動畫案例,拆解前期設定、雲端 API、本地運算和成片品質。我只給 2.5~3 星,卻看好它的製作架構。

Share
AI Agent 影片工具 OpenMontage 實測:真的能接手整套影片製作流程嗎?

如果有一天,做影片只需要交代題目,AI 就能研究資料、寫腳本、找參考圖、生成鏡頭,再把旁白與動畫組成成片,創作者的工作會變成什麼?

這次我沿用前一篇合作文章的 AORUS MASTER 16 GEN 2,測試開源 AI 影片製作系統 OpenMontage。我想看的,是它能不能把一堆分散的工具,真正組成一套可用的製作流程。

OpenMontage 是什麼?先把它理解成 Framework

OpenMontage

OpenMontage 是一套由 AI Agent 驅動的影片製作框架。你提出需求,Agent 讀取專案裡的流程與操作指引,決定先做什麼、使用哪些工具,以及何時停下來讓你確認。

研究、提案、腳本、分鏡、素材、剪輯與合成,都有對應的階段。框架也會保存中間產物與決策,所以你有機會回頭檢查:它選了哪個模型?為什麼換工具?現在卡在哪一段?

因此,我會先看它怎麼安排製作,而不是只看模型清單有多長。成片品質仍取決於指揮流程的 Agent、選用的生成模型,以及每個步驟是否真的照規劃執行。

💡
Skill、Framework、Tool,差在哪?
Skill:教 Agent 怎麼做事的工作指引,例如字幕排版與動畫節奏。
Tool:實際執行工作的工具,例如 FFmpeg、語音轉錄或影片生成 API。
Framework:安排階段、交接資料、記錄決策與檢查成果的架構,OpenMontage 屬於這一層。
用片場比喻:Skill 是工作手冊,Tool 是器材,Framework 是製作制度;Agent 則讀懂需求並調度它們。

OpenMontage 工具實測 TL;DR:

單就 OpenMontage 的這個工具,五顆星,我目前只給 3 顆,這個分數評的是我這輪的上手成本與交付穩定度,不是所有影片模型的能力,也不是對未來潛力打分。它有幾個讓我眼睛一亮的流程,但距離「交代完就能放心收片」,還有明顯差距。

  • 新手門檻主要在前期:環境、模型、API 權限與費用先處理好,後面用對話操作才會輕鬆。
  • 亮點是把前製與生成接起來:研究題目、找視覺參考、準備角色圖,再接影片生成,比單獨填一次提示詞更接近製作工作。
  • 不同 pipeline 的表現有落差:流程寫得完整,不代表每次都能把規劃落實到畫面。
  • 動畫引擎接上了,設計品質仍不穩:Remotion/HyperFrames 提供製作能力,構圖、字級、節奏與逐鏡審查仍要另外顧。
  • 最值得參考的是框架設計:即使現在只給 3 星,我仍覺得這個架構很有啟發性。

這次的工作平台:AORUS MASTER 16 GEN 2

原本做一支影片,要分別處理腳本、畫面、聲音、動畫和剪輯。現在透過 OpenMontage,可以交給 Agent 協調整套製作流程:拆解需求、選擇工具,再把各階段的成果接成一支影片。

操作變簡單了,背後需要處理的運算卻沒有變少。 當我們把更多步驟搬回本地,同一台機器就得接續承擔 Agent 推理、影片與語音生成,以及最後的動畫渲染、剪輯和編碼。這考驗的不只是顯卡,也包括 CPU、記憶體,以及長時間運算時的散熱能力。

這次我使用的工作平台,是 GIGABYTE AORUS MASTER 16 GEN 2,搭載 RTX 5090 Laptop GPU、24GB VRAM 與 32GB RAM。把這輪使用的工具拆開來看,就比較容易理解硬體在其中扮演什麼角色:

製作環節使用工具本地/雲端分工筆電需要處理的工作
腳本與分鏡Qwen 3.8本地部署時由筆電推理;接 API 時由雲端推理本地推理需要容納模型與上下文,使用 GPU、VRAM 與系統記憶體
Agent 推理與調度Qwen 3.8+OpenMontage推理位置取決於 Qwen 的部署方式;本機工具由筆電執行管理專案、讀取素材、調用工具,接續各階段產物
AI 影片生成Wan本地部署時使用筆電 GPU;使用託管服務時由雲端生成本地生成對 GPU 與 VRAM 的需求高,負載隨模型、解析度與片長改變
動畫製作Qwen 3.8 調用 Remotion/HyperFrames模型負責編寫與調用;動畫可在本機預覽、渲染執行動畫程式、渲染畫面,需要 CPU、記憶體及依效果而定的 GPU 資源
剪輯與輸出FFmpeg本地執行串接片段、處理音軌與字幕、編碼輸出;支援的編碼可使用硬體加速

語音生成則依選用的 TTS 模型或服務,安排在本地或雲端執行。

RTX 5090 Laptop GPU 的 24GB VRAM,是這台筆電用來承接本地 AI 工作的重要條件。 執行語言模型或 Wan 這類影片模型時,除了運算速度,還得考慮模型與生成過程能否放進顯示記憶體。較充裕的 VRAM,讓選擇模型與調整生成設定時多一些空間;實際可跑的規模,仍取決於模型版本、量化方式和輸出設定。

到了動畫與後製階段,CPU 和系統記憶體也會接手大量工作。這次配置的 32GB RAM,需要支撐 Agent 工具、瀏覽器預覽、素材處理與渲染程序。整套流程可以由同一台筆電協調,但大型模型仍適合依階段載入、釋放資源,讓運算能力用在當下需要的工作上。

檢視成果時,這台筆電的 16 吋 2560 × 1600 OLED 螢幕、240Hz 更新率與 100% DCI-P3 色域,也提供了檢查人物細節、字幕和動畫畫面的工作空間。詳細配置可參考 技嘉官方規格。

對這種 Agent 影片工作流來說,AORUS MASTER 16 GEN 2 的價值,是把本地 AI 運算、動畫預覽與影片後製集中在一台可攜設備裡。從交代需求、修改分鏡,到檢查最後的輸出,創作者能在同一個工作環境中完成整套製作。

ComfyUI × MiniMax H3 本機影片生成教學:用 AORUS MASTER 16 GEN 2 拆解三模型實測

它有中控台,但不是拖拉時間軸的剪輯軟體

OpenMontage 的操作核心是和 Agent 對話。它另外提供 Backlot 製作看板,把研究、提案、腳本、分鏡和決策呈現出來。你能看到哪個階段完成、哪裡在等確認,以及 Agent 選了什麼路線。

這種介面對理解流程很有幫助。不過,它和剪映、Premiere 的操作邏輯不同:你主要是在審查製作計畫與回饋結果,而不是一直用滑鼠修時間軸。看板顯示 completed,也不等於畫面已經符合你的審美標準。

新手真正的第一步:先決定影片需要哪些元素

我覺得前期最難的,往往是把「想做什麼」翻譯成「需要接哪些能力」。如果一開始就把所有服務都申請一輪,你會花很多時間設定根本用不到的東西。

  • 需要人聲嗎?已有錄音,就先處理轉錄與字幕;需要生成旁白,才挑 TTS 服務。
  • 需要 AI 生成影片嗎?如果只是實拍素材加文字圖卡,未必需要影片生成 API。
  • 需要對嘴嗎?原生帶對白的生成影片、旁白配畫面,以及另外做嘴型同步,是不同需求。
  • 需要虛擬角色嗎?先決定是固定講者、跨鏡頭一致的人物,還是平面角色動畫,再挑工具。
  • 需要精準的字卡或圖表嗎?這類工作可以交給程式動畫與合成引擎。

需求縮小後,再請 Agent 檢查目前有哪些工具可用,補上必要套件或服務金鑰。需要 API 的部分,還要確認帳戶額度、模型權限與單次費用。這些準備完成後,用對話推進製作才比較接近你想像中的 AI 工作室。

我會建議第一次只做一個小題目,例如「一段旁白加三張資訊卡」,或「一張參考圖生成一個短鏡頭」。先確認能交付,再加角色、對白與更多鏡頭。

實測一:鹿港短片,先看單段生成能不能接到成片

第一個例子是鹿港老街背包客短片:以 MiniDV 旅遊影像為方向,包含街景、買杏仁茶與人物互動。最後交付的是約 15.08 秒、1440 × 2560、24fps 的直式影片,有音軌並加上字幕。

在字幕的呈現上有蠻詭異的黑邊、字體大小也過大,一旦發現這種情況,沒辦法直接在影片做細修(相較 hyperframes 會提供影片編輯的 UI 、 Remotion 也是可以直接從 react 來改)。

實測二:文章變動畫,能輸出和好看之間仍有距離

我也測了文章改成動畫解說,留下約 34 秒的短版與約 79.06 秒、1080 × 1920、30fps 的完整版本。完整版本使用 Remotion,內容以文字、數據卡與圖表為主。

實測發現 OpenMontage 裡面其實有 remotion-best-practices 與動畫相關指引,但真正的問題是:Agent 有沒有在正確階段讀取、採用,並檢查成片?根據我的實測經驗來看,蠻有可能是 System prompt 過長,導致 Skill 沒有被正確讀取。

Qwen > OpenMontage > Remotion

我目前的影片製作流程,是透過 Qwen 直接調用 Remotion 來製作動畫,而這篇文章展示的案例則是 Qwen 在 OpenMontage 的框架下來運作 Remotion,兩者的品質差蠻多的。

為什麼規劃完整,成片卻可能走樣?

我的一個猜測,是整套指令與階段規範非常長,Agent 要同時顧研究、創意、工具限制和審查,可能在某些 pipeline 裡失去重點。

這輪能確認的是:有元件能力與分鏡要求不一致、有輸出設定需要修正,也有生成服務狀態回報造成的混亂。這些原因不應全部混成一句「模型不夠聰明」。對我而言,比再加一大段指令更值得做的,是每個階段交付更小、能驗收的結果。

例如,先核對一個場景的字級與動畫,再複製到整支片;先確認一段生成的角色與畫面比例,再做下一段。前面的計畫需要能一路追到最後的畫面。

本地支援有多少?開源框架不等於全本地工作室

OpenMontage

OpenMontage 有 WAN、Hunyuan、CogVideo、LTX 等本地影片生成路線,也有本機轉錄與合成工具。不過,對照整份 provider 清單與我這輪真正用到的能力,我的感受仍是:現成選擇多半圍繞雲端 API,本地路線需要另外處理模型和環境。

「影片在本機合成」、「影片模型在本機推論」和「指揮流程的 Agent 也在本機」是三件事。只做到其中一項,不能宣稱素材完全不出門。以本文案例來說,雲端生成與本機後製是混合使用的。

誰適合現在試?我的結論

如果你願意處理環境、讀錯誤訊息,想建立一套可追蹤、可修改的影片流程,OpenMontage 值得拆開來研究。它把研究、製作、審查與工具選擇放在同一個框架裡,這件事對創作者很有啟發性。

但如果你需要的是今天交件、第一次就穩定好看的短影音,或期待完全不碰設定的一鍵工具,我暫時不會把它當成唯一的製作方案。

所以我的評價仍是 2.5~3/5。現在的完成度讓我保留,但它很符合我對未來影片製作的想像:創作者把注意力放在題目、敘事與審美,Agent 協調研究和執行工具,中間產物與修改過程都能留下來。

AORUS MASTER 16 GEN 2 在這次合作裡,是承接這些工具與素材的可攜工作平台。至於成片能不能交付,最後還是要回到流程是否可靠、畫面是否達到要求,以及人有沒有看過每一個重要鏡頭。

想跟著試,可以先從 OpenMontage 官方專案 開始,列出自己需要的影片元素,只接必要工具。若想了解另一種以節點安排製作的方式,也可以接著讀 前一篇 ComfyUI 合作實測。