MiniMax H3 教學|3 種生成模式、官方 Prompt 公式與多模態參考完整指南
MiniMax H3 的重點不是把 Prompt 寫得很像導演,而是清楚指定每份素材的用途、影片核心、時間軸與聲音。本篇用 3 個範例帶你完成第一支可控的多模態影片。
MiniMax H3 是一款可以同時理解文字、圖片、影片與音訊的 AI 影片模型。第一次使用時,最容易犯的錯不是 Prompt 太短,而是一次放進太多要求,卻沒有說清楚每份素材要負責什麼。
這篇 MiniMax H3 教學會從 Hailuo AI 網頁版開始,依序帶你選模式、準備素材、寫 Prompt、設定影片規格,再用純文字、圖片轉影片與全能參考 3 種範例實作。
先給結論:新手的第一支影片建議只做 5~10 秒、1 個主體、1 個主要動作,最多安排 2 個鏡頭。先確認人物、動作與聲音可控,再增加素材和分鏡,比一開始就寫 15 秒電影預告更省時間。
MiniMax H3 可以做什麼?
H3 的「多模態」是指模型能一起理解不同形式的資料。你可以讓一張圖片提供人物外觀、一段影片提供動作與運鏡,再讓一段音訊提供節奏或音色,最後用文字說明它們要如何組合。
依照 MiniMax H3 官方規格,影片可帶原生立體聲,支援橫式、方形與直式等常見比例。Hailuo 官方產品頁目前標示網頁版可建立 5~15 秒影片,最高選項顯示為 2K/1440p。
這些規格真正有用的地方,不是讓每支影片自動變成成品,而是把角色、動作、鏡頭與聲音放進同一個工作流程。對品牌短片、商品展示、社群內容、MV 視覺與 UI 動態提案來說,可以少做幾次跨工具轉檔。
但 2K 只代表輸出尺寸更高,不代表人物臉部、商品結構、Logo 與小字一定正確。正式使用前仍要逐幀檢查。
開始前先選對 MiniMax H3 模式
H3 的模式很多,對新手來說可先整理成 3 類。
| 模式 | 你要準備什麼 | 最適合的任務 | 最大限制 |
|---|---|---|---|
| 純文字生成 | 一段 Prompt | 概念短片、氣氛畫面、故事提案 | 人物與產品外觀較難鎖定 |
| 圖片生成影片 | 1 張首幀,或首幀加尾幀 | 商品動態、角色動作、畫面轉場 | 兩張圖不等於一定能做無縫循環 |
| 全能參考 | 圖片、影片、音訊與 Prompt | 鎖定人物、動作、運鏡、音色或剪輯節奏 | 素材關係沒說清楚時更容易互相衝突 |
如果只是第一次測試,先從圖片生成影片開始最實際。圖片能固定起始構圖,Prompt 只要集中描述接下來的動作、鏡頭與聲音,變數比純文字少。
全能參考適合已經有品牌素材或明確參考片的團隊。官方規格最多支援 9 張圖片、3 段影片與 3 段音訊,總計不超過 12 個檔案。不過「可以放 12 個」不代表第一次就該放滿。先用 2~4 份素材,更容易找出是哪個條件造成偏差。
MiniMax H3 網頁版操作教學
步驟 1:開啟 Hailuo AI 並選擇 MiniMax H3
進入 Hailuo AI 建立影片頁面,登入帳號後確認模型顯示為 MiniMax H3。目前建立區可看到全能參考、比例、解析度、秒數與建立按鈕。
介面與方案可能更新,因此不要只照舊截圖找按鈕。最可靠的確認方式,是送出前再次檢查模型名稱、素材數量、比例、解析度與影片長度。
步驟 2:選擇純文字、圖片或全能參考
沒有素材時,直接使用文字生成。要固定起始畫面時,上傳 1 張圖片並把它指定為首幀。想讓影片從畫面 A 走到畫面 B,才使用首尾幀。
若要同時參考人物、動作、運鏡或聲音,選擇全能參考。音訊不能單獨成為全能參考的唯一輸入,官方規格要求它搭配圖片或影片。
步驟 3:上傳素材,逐一說明用途
素材上傳後,不要只寫「照這些參考做」。請依介面顯示的編號,在 Prompt 開頭交代每份素材的角色,例如:
@Image1 是人物外觀參考,保留短髮、米色風衣與臉部特徵。
@Video1 是動作與運鏡參考,只取走路速度和側向跟拍,不沿用原人物與場景。
@Audio1 是節奏參考,只參考鼓點速度,不複製原旋律。
這一步是全能參考最重要的設定。模型需要知道「參考什麼」與「不要複製什麼」,否則它可能把人物、場景、風格與動作混在一起。
步驟 4:用 4 段式公式寫 Prompt
MiniMax 官方 Prompt 指南對不同模式有更完整的結構。一般網頁使用者可以先簡化成下面 4 段:
完整 Prompt = 參考素材的用途
+ 影片的單一核心創意
+ 按時間排列的畫面與鏡頭
+ 聲音、配樂與不要出現的內容
「核心創意」只要用一句話回答:誰、在哪裡、做什麼、什麼風格。接著再用時間軸寫畫面,不必一開始就堆滿攝影術語。
例如,與其寫「一支高級、有質感、令人驚豔的咖啡廣告」,不如寫「雨天午後,一杯熱咖啡放在木桌上,鏡頭慢慢靠近,蒸氣在窗邊逆光中清楚可見,整體是安靜寫實的生活廣告」。後者都是看得見的畫面,模型比較容易執行。
步驟 5:設定長度、比例與解析度
比例要先看發布場景,而不是一律選最大畫面:
| 發布位置 | 建議比例 | 新手建議長度 |
|---|---|---|
| YouTube、網站橫幅 | 16:9 | 5~10 秒 |
| Instagram 貼文 | 1:1 或 4:5 類直式比例 | 5~10 秒 |
| Reels、TikTok、Shorts | 9:16 | 5~10 秒 |
| 電影片頭或寬幅提案 | 21:9 | 5~10 秒 |
解析度不是越高越適合測試。初稿先確認構圖、人物、動作和聲音,通過後再產生較高解析版本,能避免把額度花在方向錯誤的片段上。
步驟 6:生成後按驗收順序修改
生成完成後,不要只看整體是否漂亮。依照以下順序檢查:
- 主體是否正確:人物、商品、服裝與場景有沒有被換掉。
- 動作是否正確:動作次序、方向與速度是否符合 Prompt。
- 鏡頭是否正確:切鏡時間、景別與運鏡是否合理。
- 聲音是否正確:台詞、口型、音效與配樂是否互相配合。
- 商業細節是否正確:Logo、文字、手指、包裝與產品結構是否可用。
一次只改最重要的一類問題。如果同時重寫人物、場景、動作、鏡頭和配樂,你會很難知道是哪個修改真正有效。
MiniMax H3 Prompt 範例 1:純文字生成影片
這個範例適合先測試氣氛、鏡頭與聲音,不要求固定人物。
【核心創意】
10 秒,16:9。清晨的台北巷弄裡,一間早餐店剛開門,老闆把第一籠熱騰騰的包子放到櫃台。寫實紀錄片風格,柔和自然光。
【畫面流程】
0~4 秒:大全景,安靜的巷弄仍帶著薄霧,早餐店鐵門升起,暖黃燈光從店內照到濕潤地面。鏡頭緩慢向前移動。
4~10 秒:切到中近景,老闆把竹蒸籠放上櫃台並掀開蓋子,白色蒸氣湧出。鏡頭輕微靠近蒸籠,最後停在包子與蒸氣上。
【聲音】
保留鐵門聲、蒸氣聲與遠處機車經過的環境音。沒有人說話。
非敘事性配樂:N/A。
【限制】
不要字幕、不要品牌 Logo、不要突然出現其他人物、不要快速切鏡。
這份 Prompt 只有 2 個鏡頭,每個鏡頭各做一件事。對新手來說,這比在 10 秒內塞進 5 個場景更容易驗收。
官方範例展示文字轉影片的完整 2K 流程;精選成果不代表每次生成都有相同穩定度。影片來源:MiniMax 官方 GitHub。
MiniMax H3 Prompt 範例 2:圖片生成商品影片
上傳一張商品照後,先說明它是首幀與商品外觀依據,再描述畫面如何從這張圖開始發展。
@Image1 是首幀,也是咖啡罐的產品外觀參考。完整保留罐身比例、深綠色包裝與正面標籤位置,不新增其他文字。
【核心創意】
8 秒,9:16。把這張咖啡罐商品照做成乾淨的社群廣告。畫面從靜止商品開始,咖啡豆落下,最後以產品正面定格。
【畫面流程】
0~3 秒:從 @Image1 開始,鏡頭非常緩慢靠近。背景維持米白色,右上方柔光照亮罐身邊緣。
3~6 秒:少量咖啡豆從畫面上方落下,在商品周圍形成弧線,不遮住正面標籤。
6~8 秒:咖啡豆停止,鏡頭回到正面中景,商品位於畫面中央並保持清楚。
【聲音】
咖啡豆落在木桌上的輕微聲音。低音量、慢節奏的木吉他配樂,最後一秒淡出。
【限制】
不要改變包裝形狀、不要新增標語、不要讓咖啡豆穿過商品、不要快速旋轉鏡頭。
商品影片最需要檢查的不是氛圍,而是包裝有沒有被改寫。只要標籤、文字或瓶身結構錯誤,就應回到後製合成正確商品圖,不要因為輸出是 2K 就直接採用。
圖片模式能固定起始構圖,但後續人物、產品與文字仍須逐幀檢查。影片來源:MiniMax 官方 GitHub。
MiniMax H3 Prompt 範例 3:全能參考人物、動作與聲音
這個範例使用 1 張人物圖、1 段動作影片與 1 段音訊。素材越多,越要限定每份素材的用途。
@Image1 是主角外觀參考,保留臉部、短黑髮、白色襯衫與深藍長褲。
@Video1 只提供 3 步向前、轉身與抬頭的動作節奏,不沿用原人物、服裝與背景。
@Audio1 只提供鼓點速度與情緒,不直接複製旋律。
【核心創意】
10 秒,16:9。主角在雨後的城市天台完成 @Video1 的動作,最後抬頭看見雲層散開。寫實電影感,但保持自然表演。
【畫面流程】
0~5 秒:中景側向跟拍。@Image1 的主角依照 @Video1 的速度向前走 3 步後轉身。地面有雨水反光,遠處城市保持虛化。
5~10 秒:切到胸部以上近景。主角慢慢抬頭,雲層間出現柔和陽光。最後 2 秒不再切鏡,保持同一張臉與服裝。
【聲音】
腳步踩過積水的聲音與微弱城市環境音。配樂只參考 @Audio1 的速度和情緒,音量低於環境音。
【限制】
不要複製 @Video1 的人物與背景,不要新增對白、字幕或 Logo,不要改變主角服裝。
如果結果的動作正確但臉部不穩定,先不要增加更多人物圖。優先縮短片長、減少切鏡,並在人物第一次出現和切鏡後再次指定同一位主角。
全能參考可指定影片、圖片與音訊各自負責的角色;素材越多,越需要寫清楚保留與修改範圍。影片來源:MiniMax 官方 GitHub。
分鏡怎麼寫,H3 才容易遵循?
分鏡是同一段連續拍攝的畫面。對 H3 來說,時間點、主體和景別比「很有電影感」更具體。
每個鏡頭可以依序寫 4 件事:
- 何時開始,例如
4 秒時切鏡。 - 拍誰或拍什麼,例如
同一位主角。 - 用什麼景別,例如
中景切到臉部近景。 - 發生什麼動作,例如
主角轉身並抬頭。
台詞也要符合鏡頭時間。3 秒鏡頭塞進一大段對話,容易造成語速、口型與動作互相擠壓。若一句話跨過切鏡,請明確寫出「台詞從第一個鏡頭開始,切到第二個鏡頭後繼續,說完才閉嘴」。
聲音怎麼寫?環境音、台詞與配樂要分開
H3 會一起生成畫面與立體聲。這能減少後製步驟,也代表聲音需求不能只寫「有音效」。
- 環境音:角色所在空間真的會聽到的聲音,例如雨聲、腳步、門聲與人群。
- 台詞:指定說話者、語言、完整內容與說話時間。
- 非敘事性配樂:角色聽不到、只給觀眾聽的背景音樂。
如果不要配樂,可以直接寫:
非敘事性配樂:N/A。
不要額外加入背景音樂。
這類限制能提高成功機率,但不是保證。若畫面中的人物仍出現不需要的口型,可以加上「人物全程不說話、嘴巴自然閉合」,並避免使用「對著鏡頭講述」等容易觸發說話的動作。仍不穩定時,改用側臉、中景或背影,比持續要求臉部特寫更實際。
5 個常見失敗原因與修改方法
| 問題 | 常見原因 | 優先修改方式 |
|---|---|---|
| 人物跨鏡頭變臉 | 切鏡太多,或沒有重申同一人物 | 減少鏡頭;每次切鏡寫明同一位主角與保留特徵 |
| 上傳素材卻沒被採用 | 沒說素材用途 | 在 Prompt 開頭寫明人物、動作、場景、運鏡或音色參考 |
| 畫面自己出現台詞或口型 | 主角正對鏡頭但沒有持續動作 | 指定不說話與自然閉嘴,安排閱讀、行走或觀察等動作 |
| 音樂時間不受控 | 只寫秒數,沒有描述事件關係 | 改寫成「事件前沒有音樂、事件發生時進入、事件後完全停止」 |
| 首尾幀無法無縫循環 | 模型會補出中間變化,也可能重畫尾幀 | 把循環當成需驗收的結果;縮短動作,並準備後製修接點 |
負面指令的作用是降低不想要內容出現的機率,不是硬性遮罩。字幕、手指、Logo 或商品文字屬於高風險細節,正式交付仍要人工檢查與後製。
H3 API、MiniMax Hub 與本機部署怎麼選?
一般創作者先用 Hailuo AI 網頁版,維護成本最低。需要用自然語言協助整理研究、素材與 Prompt 的人,也可以評估 MiniMax Hub;但它是另一個工作介面,不代表每支影片都能免除分鏡與素材驗收。
要把 H3 串進自家產品時,再看 MiniMax H3 API 文件。API 已提供文字、圖片與參考轉影片,適合批次任務、權限控管與流程自動化。
本機部署屬於進階路線。MiniMax 已發布 H3 Base 的兩類權重,但官方完整流程還包含沒有全部開放的 Context-IR 與 2K Regenerate 模組。換句話說,「H3 Base 可以下載」不等於網頁版的完整體驗能全部離線重現。

如果團隊只是要做內容,先用網頁版驗證需求最實際。只有在資料治理、客製推論或大量固定流程足以抵銷 GPU、部署與維護成本時,本機方案才值得評估。
MiniMax H3 可以商用嗎?先分清楚輸出與官方素材
MiniMax H3 Community License表示 MiniMax 不主張使用者生成 Output 的權利,但使用者仍要對輸入和輸出負責。人物肖像、品牌商標、商品照、音樂、參考影片與訓練素材的權利,不會因為經過 AI 生成就自動消失。
另一個容易混淆的地方是官方展示素材。官方 GitHub 上可以看到圖片、GIF 與影片,不代表任何全球商業網站都能直接轉載。H3 Community License 有地域限制,公開網站也可能被排除地區的讀者存取。因此,最安全的做法是把官方素材當成編輯參考,正式發布改用自己有權使用的輸入與 H3 測試成果,或先取得 MiniMax 的書面授權。
FAQ
MiniMax H3 新手最適合從哪種模式開始?
先用 1 張圖片做 5~10 秒圖片轉影片。首幀能固定起始構圖,Prompt 只要描述動作、鏡頭與聲音,比同時控制多份素材容易。
MiniMax H3 最多可以上傳多少參考素材?
官方全能參考規格最多支援 9 張圖片、3 段影片與 3 段音訊,全部合計最多 12 個檔案。參考音訊不能單獨成為唯一輸入,必須搭配圖片或影片。
MiniMax H3 Prompt 一定要用英文嗎?
不一定。H3 官方列出的穩定對話語言包含中文與英文,網頁版也能接受自然語言描述。若要精確控制台詞,請標出說話者、語言與完整內容,不要讓模型自行猜台詞。
MiniMax H3 能生成無聲影片嗎?
可以在 Prompt 中指定人物不說話、列出需要的環境音,並把非敘事性配樂設為 N/A。若完全不需要聲音,也可以在後製移除音軌;如果畫面仍有說話口型,則需要重新生成或調整鏡頭。
MiniMax H3 已經完全開源了嗎?
不是。H3 Base 的 FL2VA 與 Ref2VA 權重已經發布,但 H3-Context-IR 與 H3-Regenerate-2K 尚未全部開源。官方完整 2K 流程仍會使用由 MiniMax 在雲端運行的 API。
MiniMax H3 適合直接做正式廣告嗎?
它適合快速提案、分鏡與素材版本測試,但正式廣告仍要檢查人物、商品、Logo、文字、音樂權利與聲畫同步。對品牌團隊來說,真正的驗收標準是可用成片率與重做成本,不是最好的一次生成有多漂亮。
結論:先把 H3 當成可控的製作流程,不是許願框
MiniMax H3 最有用的地方,是讓圖片、影片、音訊與文字指令在同一個任務中合作。要把這項能力用好,關鍵不是 Prompt 越長越好,而是每份素材都有明確角色,每個鏡頭只推進一件事,聲音和限制也寫在對的位置。
第一支影片先做小:5~10 秒、單一主體、1 個主要動作、最多 2 個鏡頭。等你能穩定重現人物、動作與聲音,再增加全能參考和複雜分鏡。這種做法看起來保守,實際上最快找到可維護、可重複的 AI 影片工作流。