ComfyUI × MiniMax H3 本機影片生成教學:用 AORUS MASTER 16 GEN2 拆解三模型實測

從 ComfyUI 安裝、MiniMax H3 多幀工作流到本機硬體配置,實測 H3、Google Veo 3 與 Seedance 2.5 在相同素材與提示詞下的影片生成表現,並使用搭載 RTX 5090 Laptop GPU 的 AORUS MASTER 16 GEN2,拆解本機 AI 影片生成的完整創作流程。

Share
ComfyUI × MiniMax H3 本機影片生成教學:用 AORUS MASTER 16 GEN2 拆解三模型實測
本文為 GIGABYTE 技嘉合作內容。以下以創作流程與測試素材為主,說明如何在筆電本機操作 AI 影片生成。

最近 AI 影片模型進步得很快。但比起追問「哪一款最強」,我更想知道:可以下載到自己電腦裡的影片模型,現在能不能真的放進創作流程?

這次我把 MiniMax H3、Google Veo 3 與 Seedance 2.5 放在同一個題目下觀察:使用《海街日記》的鏡頭作為參考,讓模型處理人物位置、細微反應與鏡頭之間的銜接。H3 則透過 ComfyUI,在 GIGABYTE AORUS MASTER 16 GEN2 本機執行。

這篇會從工具、配備一路講到多幀工作流與提示詞。第一次接觸 ComfyUI 的讀者,可以先完成單張圖生影片,再進入多幀;已經有生成經驗的讀者,可以直接看後面的測試設計與觀察。

ComfyUI 是什麼?先把節點看成一張製作流程圖

看到如此複雜的節點與連線也不用擔心,ComfyUI 有推出自動引導功能,引導到放圖片的節點、下載模型的節點等。

ComfyUI 是以節點連線組織生成流程的工具。文字、圖片、模型、取樣與輸出各自負責一件事,再把結果交給下一個步驟。

第一次打開,先不用理解所有參數。你可以沿著資料流看五件事:

  1. 素材在哪裡? 找到載入圖片的位置,確認圖像沒有放錯。
  2. 模型是哪一個? 看載入器選的是什麼權重,而不是只看工作流名稱。
  3. 我要它做什麼? 在文字區定義人物、構圖、動作與聲音。
  4. 影片如何生成? 先沿用範本的取樣設定,確認基本流程能跑通。
  5. 結果存在哪裡? 檢查輸出影片、音訊,以及能否一併保存設定。

它對創作者的價值,是能留下可以反覆修改的流程。今天換圖片,明天改動作,再下一次加入後製,你不必每次重新建立整個專案。

注意:使用 ComfyUI 不等於全部在本機運算。 工作流也可能包含呼叫雲端的節點(如本次的 Seedance 2.5 測試就是透過 API 完成)。要確認素材是否離開電腦,必須檢查實際節點與服務。

本次測試的主角:MiniMax H3:開源影片模型的霸主

MiniMax H3 是 MiniMax 在 2026 年推出的開源權重(open-weights)全模態影片生成模型(也就是 Hailuo 3.0 系列的底層模型),主打「一個模型打通文字、圖片、影片、聲音」而不是分開的專用模型。 

主要能力

  • 文字生成影片、首尾幀控制、參考影像/影片/音訊生成(最多可吃 9 張圖、3 段影片、3 段音訊做參考)
  • 支援用自然語言做精確的影片編輯
  • 原生立體聲音訊(配樂、對白、音效都是模型生成,不是後製加上去的)
  • 輸出可達 2K、24fps、5–15 秒,長 prompt 可到 7000 字
  • 有個較快的變體 H3 Max,解析度降到 768p 但生成可壓到 3 秒內

在地端(local)跑的狀況 這是目前你會看到很多教學文章的原因——它是少數開源出來、真的可以自己部署的影片生成模型:

  • 主流工具是 ComfyUI(有官方/社群 workflow)、WanGP(原本給 WAN 系列影片模型用,對低 VRAM 友善)、以及一鍵包裝的 Pinocchio
  • VRAM 需求依畫質分級,大致上:
    • 6GB(如 RTX 2060):能跑但畫質明顯打折,短片要 10–15 分鐘
    • 12–16GB(如 RTX 4060):畫質好一些、速度較快,但還不到滿血
    • 24GB(RTX 4090 / RTX 5090 Laptop GPU):可以正常生成,還能做 LoRA 訓練
    • 32GB+(RTX 5090 / RTX 6000):官方建議的完整規格,可跑滿 15 秒、高解析度
    • 也有 4-bit(NF4)量化版,可以在 Apple Silicon 上用 8GB VRAM 跑,但畫質會再打折

四種生成方式,差別在你想控制什麼

方式 你提供什麼 適合解決的創作問題
文生影片 文字描述 還沒有畫面,先探索場景與敘事
圖生影片 起始圖片+動作描述 已有一張畫面,希望從它開始動起來
參考生影片 參考素材+各素材的用途 希望人物、服裝、構圖或風格有依據
多幀生成 多張畫面+時間安排與引導 已有分鏡,希望特定時刻對應特定構圖

前面三種在 ComfyUI 的 H3 原生教學中有對應範本;多幀則有獨立的 Multiframe Reference 範本

多張參考圖與多幀控制要分開理解。 前者像把人物與場景資料交給模型;後者還要指定「什麼時候出現哪個畫面」(如下所列)。光在提示詞寫時間,是文字上的要求;把圖片接到時間軸引導,則多了一層實際條件。不要因為上傳了四張圖,就認為模型會自動照四個時間點排列。

這次選多幀題目,原因也很實際:創作者往往已經有分鏡,真正需要的是把分鏡接成有表演、有節奏的影片。

MiniMax H3 多幀範例,上方為四張參考畫面,下方為示範畫面
H3 多幀範例:上方排列參考畫面。圖片:Comfy-Org;此為範本示意,並非本次實測成果。

本次測試硬體:GIGABYTE AORUS MASTER 16 GEN2

AORUS MASTER 16 GEN2 正面與鍵盤產品圖
AORUS MASTER 16 GEN2。圖片:GIGABYTE。

這次使用的設備配置整理如下:

項目 本次配置 在流程中的角色
筆電 GIGABYTE AORUS MASTER 16 GEN2 在同一台設備整理素材、操作 ComfyUI 與檢視成果
顯示晶片 NVIDIA GeForce RTX 5090 Laptop GPU 承擔支援 GPU 的模型推論
顯示記憶體 24GB VRAM 容納模型運算所需資料,影響可用設定與記憶體餘裕
系統記憶體 32GB RAM 支援作業系統、素材處理與模型載入/卸載

GIGABYTE 的 AORUS MASTER 16 GEN2 有 RTX 5090 Laptop GPU、24GB GDDR7 VRAM 配置。H3 的模型並不僅僅是簡單的「生影片而已」,其中也包含音樂、理解提示詞的模型...,而 搭載 5090 24GB VRAM 的 AORUS MASTER 16 GEN2 具有優秀的 AI 運算能力 & 足夠的 VRAM 來調用 Minimax H3,在生成的過程也保持著穩定的效能,讓整體的 AI workflow 過程順利進行。

如果要自己準備電腦,我會怎麼選?

以下是工作流程上的選擇建議,不是 H3 官方最低配備,也不代表某個容量保證能跑所有模型:

需求 準備方向 應先接受的取捨
先認識 ComfyUI 用現有設備跑適合它的小型工作流 不必一開始就載入重型影片模型
朝這次本機影片流程靠近 以 24GB VRAM 等級作規劃參考,核對量化版本及卸載設定 仍要逐一確認模型、解析度與時長是否能容納
同時剪輯、開多個創作工具 評估比 32GB 更充裕的 RAM,例如 64GB RAM 增加不會把 GPU 的 VRAM 一起變大
經常保留模型與大量輸出 使用 SSD,按實際下載容量預留模型、快取與輸出的空間 不要只計算單支成片的檔案大小

我會先確認手上的工作流,再決定硬體。影片生成的負載不只由模型名稱決定,還包含權重精度、參考圖數量、片長、解析度及記憶體管理方式。

對這次合作機型而言,最值得討論的是工作方式:參考圖、工作流與生成結果可以留在同一台筆電處理,外出修改分鏡時也能帶著走。這個價值比單列一串規格更貼近創作者的日常。

本次未提供每輪生成秒數、尖峰記憶體、溫度或功耗紀錄,因此不宣稱即時生成、特定加速倍數,也不把此處配置當成完整 BF16 權重全部常駐 GPU 的保證。

實作一:安裝 ComfyUI,先跑通最小流程

步驟 1|使用官方 Windows 安裝入口

前往 ComfyUI Windows Desktop,下載適用 NVIDIA 的版本,依安裝程序選擇資料位置並完成初次設定。若你已有 Portable 或手動安裝環境,先備份原工作流,再依原安裝方式更新,不必另外建一套混用。

安裝後先確認程式正常開啟、能辨識 GPU,以及模型存放位置。若模板提示缺少新節點,先確認版本與更新狀態,再查依賴問題。硬體與安裝支援以 系統需求 為準。

步驟 2|從 H3 範本開始,不要手拉整張圖

在範本庫搜尋 MiniMax H3,先做一次小測試,再開啟 MiniMax H3: Multiframe Reference。讓範本告訴你需要哪些檔案,避免從不同教學各抓一個模型拼在一起。

H3 的模型檔案通常分成主模型、文字編碼器、影音 VAE;加速模式另有配套。原生 T2V/I2V 使用 fl2va 類權重,R2V 使用 ref2va,不能因為檔名都含 H3 就互換。下載與放置請對照 H3 範本的模型清單

範本要求的檔案類別 放置位置(相對於 ComfyUI 模型根目錄)
Diffusion model models/diffusion_models/
Text encoder models/text_encoders/
Video/Audio VAE models/vae/
範本要求的 LoRA models/loras/

放好後,重新整理模型清單或重啟程式,再逐一檢查載入器能否選到正確檔案。以你下載的範本當下要求為準,不要把舊版檔名當成永久固定規格。

步驟 3|先用單張圖確認輸入到輸出

  1. 放入一張清楚、比例適合的圖片。
  2. 提示詞只寫一個動作,例如「人物停頓後慢慢抬眼,鏡頭固定」。
  3. 先保留範本設定,一次只排一個任務。
  4. 執行生成,確認輸出檔可開啟,畫面時長與音訊狀態正常。
  5. 另存工作流,記下模型版本與設定,作為之後修改的起點。

這個小測試的目的,是先排除環境與檔案問題。不要同時換模型、改片長、加參考圖,又調整取樣器,否則出錯時很難知道是哪個變數造成的。

實作二:把《海街日記》拆成可以操作的多幀條件

《海街日記》測試參考畫面。讀者自行練習也可成自己準備好的分鏡。

這段戲真正難的地方,不是大動作,而是安靜的表演。原片從車站空間切到車門口三姊妹,再切到妹妹:大姊開口、兩側姊姊注意力改變,妹妹停頓後抬起視線。

步驟 1|除了給參考圖片外,還要先定義三個鏡頭與四個觀察拍點

以下時間沿用原腳本的 8 秒敘事設計

時間設計 鏡頭/拍點 提示詞必須交代什麼
0–2.5 秒 A:車站遠景 列車接近,鏡頭固定,柔和陰天光
2.5–5.2 秒 B:車門口三姊妹 大姊居中,兩側姊姊在她開口後短暫看向她
5.2 秒起 C:妹妹近景 主角居中清楚,左右前景肩膀模糊
C 鏡後段 同一鏡頭的表情變化 避開視線 → 停頓 → 緩慢抬眼

四個拍點不代表一定要四次切鏡。最後一個拍點應該在妹妹的同一個近景裡完成;若把它寫成另一個鏡頭,反而容易失去想測的表演連續性。

步驟 5|把參考圖與時間引導接好

多幀範本中,參考圖的 Picture 編號依連接順序對應;Add Guide 負責把畫面放到指定幀位置。如果同一張圖既要被提示詞引用、又要指定時間,還需要同時接到相應參考輸入。時間以 24fps 換算,公式為 round(秒數 × 24),且引導不能超過輸出片長。

步驟 6|提示詞先講角色,再講鏡頭與反應

我的拆法是:場景 → 人物位置 → 時間線 → 細微動作 → 鏡頭限制 → 聲音。比起只寫「電影感」,這些條件比較容易從成果中檢查。

下面是依本次腳本濃縮、供讀者練習的英文提示詞。Picture 標記是 H3 範例用法;移到其他平台時,需要換成該平台的參考方式。

Create an approximately 8-second live-action sequence at a quiet rural Japanese train station.

REFERENCES
<Picture 1>: station wide-shot composition.
<Picture 2>: three adult sisters standing in the red train doorway.
<Picture 3>: the youngest sister centered between blurred foreground shoulders.
<Picture 4>: the youngest sister slowly look up 
Use the reference order and guide timing configured in the workflow.

CHARACTERS
The eldest sister stands in the center, wearing a black jacket and white shirt, with her hair tied back.
The second sister stands on the viewer's left, with long dark hair and a sleeveless black outfit.
The third sister stands on the viewer's right, with short dark hair and a dark outfit.
The youngest sister has a short bob and a sailor-style school uniform. She faces the older sisters from outside the train.

TIMELINE
0.0–2.5s: Static wide shot. A muted red train approaches through a green rural landscape. Soft overcast daylight, low contrast.
2.5–5.2s: Hard cut to the train doorway. The eldest sister gently invites the younger girl to live with them. The two sisters beside her briefly glance toward her with subtle surprise. Their bodies remain almost still.
5.2s–end: Hard cut to the youngest sister. Keep her face sharp and centered, framed by blurred shoulders on both sides. She initially avoids eye contact, pauses, then slowly raises her gaze toward the older sisters.

CAMERA AND PERFORMANCE
Keep the camera locked off within every shot. Preserve character positions and restrained expressions. No camera orbit, dramatic push-in, large gestures, crying, or exaggerated smile. Keep the final gaze change within one continuous shot.

SOUND
Quiet station ambience and restrained dialogue. No added background music. Keep dialogue language consistent across test versions.

步驟 7|看看最後生成的成果

MiniMax H3 vs Veo 3 vs Seedance 2.5:本輪觀察

素材標示

成片尺寸

檔案時長(約)

影格率

音軌

MiniMax H3

1280 × 736
(Local 最高支援720p 的影片生成)

8.000 秒
(Local 最高支援 15秒的影片生成)

24fps

Veo 3

1280 × 720

10.005 秒

(需訂閱 Gemini 使用)

24fps

Seedance 2.5

1920 × 1080

8.064 秒
(8秒的花費約為 100 元台幣 Token)

24fps

MiniMax H3 在本機生成的調色與人物表情表現都相當到位。Local 端目前只能出到 720p,但可以再用其他工具放大到更高解析度,而且這段生成成本是 0。相較之下,Seedance 2.5 生成一支 8 秒影片要價約 100 元台幣,而且在切換 ref 參考圖片時,鏡頭常會出現明顯的晃動跳接。這輪下來,MiniMax H3 的表現算是相當驚艷。

跟 Veo 3 比起來,Veo 3 還是有點可惜。第一個問題是它沒辦法完整參考 ref 圖片,原因是版權限制讓 Veo 3 不能生成影片。不過必須說,Gemini 對提示詞與畫面調性的理解仍然很強。

Seedance 這輪最讓人驚艷的地方,是原始素材照片裡的中文字幕,Seedance 不只正確讀懂字幕,還用日文腔調把中文字幕念出來,誇張到讓人意外。想想那些日本動漫,如果技術真能做到這種程度,還需要配音嗎?

MiniMax H3:值得放大的,是反應與視線

我在實測時,MiniMax H3 真的很令人驚艷,不管是對於參考圖片 / 提示詞的理解程度,抑或是影片的色彩一致性。我想這需要歸功在 MiniMax H3 的整個影片流程,增加了一段 Qwen 32B 對於提示詞的拆解,讓整體影片的一致性遠勝於 Veo / Seedance 2.5。

Veo 3:參考圖片變成限制,但是對於文字提示詞的理解度仍高

三個影片模型的素材、提示詞都是一樣的,但 Veo3 因為平台上的限制,沒辦法完整參考圖片,但這也算是老限制了,所以自然在參考圖片上的一致性掌握度略差。

Seedance 2.5:竟然能把字幕變成聲音!

我認為 Seedance 最讓我驚豔的就是竟然能理解參考圖片中的文字,並模仿日本的口音說出中文字幕,儘管在參考圖片的串聯間發生明顯地晃動感,但也是瑕不掩瑜。

我自己認為這輪最有價值的結果,是本機 H3 已能產出可供逐鏡討論的成片,而且品質很不錯。 至於哪款更適合你,仍需回到你最常做的題材、能接受的生成時間,以及是否需要自己掌握流程。

常見問題

出現記憶體不足,先怎麼排查?

先記下出錯節點與設定,關閉非必要的創作程式,一次只執行一個任務;再回到能成功的最小流程,逐項降低輸入負載。需要換量化或卸載方式時,優先使用該範本支援的方案。不要任意更名權重,或直接把別種精度的檔案當成可互換。

找不到模型或節點,該重裝嗎?

先檢查檔案是否下載完整、所在資料夾是否正確、載入器是否選對,以及 ComfyUI 是否更新到範本所需版本。遇到額外節點,先確認它來自哪個專案;不要一次安裝大量無關套件,讓故障來源更難追。

圖片接對了,動作還是不對?

檢查文字是否互相矛盾,例如「完全不動」卻又要求明顯轉頭;「全片固定鏡頭」卻沒有說明允許鏡頭間硬切。把要求改成「每一鏡內鏡位固定」,通常比一句籠統的限制更清楚。

可以說本機比較便宜嗎?

這次沒有足夠的時間與成本紀錄支持這個結論。本機有設備與操作成本,雲端則有使用費與服務限制。要做比較,至少要記下總嘗試次數、成功片數、實際等待時間與費用;只拿最好的一支影片比較,會漏掉大量試錯成本。

結論:把模型測試變成自己的創作方法

這次我想展示的,是從參考畫面、提示詞到本機輸出的完整思路。ComfyUI 讓每一段流程可以被保存與修改;MiniMax H3 則讓人物關係、表情與多幀條件,成為可以在本機反覆測試的題目。

這次搭配的 AORUS MASTER 16 GEN2 RTX 5090 Laptop GPU、24GB VRAM 與 32GB 系統記憶體,把 H3 的本機操作放進一台能帶著走的設備。對需要邊改分鏡、邊試生成、再接剪輯的人來說,這是有實際用途的組合。

如果要跟著做,我建議先從「一張圖、一個動作、一支短片」開始。確認成功後,再加入第二個鏡頭與更多時間引導。當你能指出模型在哪個拍點偏離要求,下一次修改就有方向,生成影片也就開始成為可累積的方法。

Read more