MiniMax H3 是什麼?2K、原生音效與多模態參考,AI 影片開始走向完整製作
MiniMax H3 不只把 AI 影片提高到 2K,而是讓人物、運鏡、聲音與風格能在同一段指令中組合。一次看懂多模態能力、技術設計與導入限制。
MiniMax 在 2026 年 7 月 31 日發布 H3。這是一款通用多模態生成模型,可以同時理解文字、圖片、影片與音訊,並生成最長 15 秒、最高 2K、帶有原生立體聲的影片。
「多模態」指的是模型不只接收文字,也能理解不同形式的素材及其關係。創作者可以要求 H3 參考一段影片的運鏡、另一張圖片的人物,再使用一段音訊的歌聲,最後把它們組合成新影片。
我的判斷是中性偏多。H3 最有價值的升級不是 2K,而是把過去分散在多個模型與工具的工作,放回同一段自然語言指令裡。這可能降低素材轉換與反覆對齊的成本。不過,現有能力證據大多來自 MiniMax 官方展示,完整技術報告、H3 API 規格與可下載權重也還沒全部到位,現在更適合測試,而不是直接替換正式製作流程。
MiniMax H3 是什麼?它不是另一個聊天模型
MiniMax H3 是影片生成模型,不是 MiniMax M3 文字模型的改版。H3 延續 Hailuo 影片模型路線,但重新設計成能跨越不同任務與素材類型的通用生成系統。
過去的 AI 影片工具常把工作拆開。文字轉影片用一個模型,圖片轉影片用另一個模式;要參考角色、動作、首尾幀或聲音,又各自有不同入口。創作者必須先處理素材,再逐步把結果送進下一套工具。
H3 想改變的是這段流程。依照 MiniMax 官方說明,模型從預訓練階段就一起學習文字轉圖片、文字轉影片、原生多鏡頭、文字轉音訊,以及圖片、影片與音訊的參考與編輯。自然語言成為素材之間的連接方式,使用者只要描述「哪個素材提供人物、哪個素材提供動作、聲音要如何搭配」,不用先選定一個狹窄任務。

這個方向比單純提高解析度更重要。商業影片很少只靠一句 Prompt 完成,真正的工作通常是保留品牌識別、延續人物外觀、模仿既有鏡頭節奏,再讓聲音對上畫面。如果 H3 能穩定理解這些關係,它處理的就不只是「生成一段好看的影片」,而是創意製作的一部分。
MiniMax H3 有哪些主要功能?
H3 的規格很好懂,但每個規格的價值不同。以下整理官方已公布的能力與它們對使用者的實際意義。
| 能力 | MiniMax 官方資訊 | 對創作者的意義 |
|---|---|---|
| 輸入素材 | 文字、圖片、影片、音訊 | 可把人物、運鏡、風格與聲音放進同一個任務 |
| 影片長度 | 最長 15 秒 | 比短片段更容易做出完整廣告鏡頭或片頭 |
| 解析度 | 最高 2K,官方稱預設提供 2K | 留下更多裁切、字幕與後製空間 |
| 聲音 | 原生立體聲 | 畫面與語音、音效、音樂由同一生成流程處理 |
| 任務 | 生成、參考與編輯 | 不必為每種素材關係切換不同專用模型 |
| 商業情境 | 廣告、品牌、電商、產品設計、UI/UX、遊戲 | 對需要視覺一致與快速提案的團隊較有價值 |
原生立體聲代表聲音不是影片完成後才由另一套工具貼上,而是模型在生成過程中一起處理語音、音效與音樂。這不保證每次都能完美對嘴,但至少聲畫關係被放進同一個生成目標,而不是完全分離的兩段工作。
15 秒也比數字看起來更實用。一支短廣告、產品開場或社群影片,往往需要建立場景、做出主要動作,再留時間給品牌文字。片段太短時,創作者只能多次生成並剪接,人物與畫面風格更容易在接點變化。長度增加不能消除一致性問題,卻能減少一部分拼接需求。
H3 官方 2K 生成示範。高解析輸出增加後製空間,但仍要檢查人物、文字與產品細節。影片來源:MiniMax 官方。
H3 官方原生立體聲示範,聲音與畫面由同一生成流程處理。影片來源:MiniMax 官方。
多模態參考是 H3 最值得注意的升級
MiniMax 的官方範例同時提供一段 Hitchcock 式運鏡影片、一張人物圖片與一段歌聲,再要求 H3 讓圖片中的人物唱歌,並套用參考影片的鏡頭運動。這個例子展示的不是三種輸入格式,而是模型要理解三份素材各自扮演的角色。
這段官方示範用來說明 H3 如何理解不同參考素材的用途,不代表所有輸入都能得到相同品質。影片來源:MiniMax 官方。
對品牌與電商團隊來說,這種控制方式很實際。品牌可能已經有產品照片、Logo 規範、過去廣告的鏡頭語言與配樂方向。傳統生成流程要把這些條件拆成多次操作,任何一步偏離都要回頭修改。H3 若能在一次任務中保留多個參考關係,就有機會減少溝通與重做。
但這也是最需要實測的能力。官方展示是挑選過的成功案例,沒有告訴我們同一組素材生成 10 次,有幾次能同時守住人物、動作、Logo、小字與聲畫同步。對商業使用而言,「最好的一次多漂亮」不如「可用成片率有多高」重要。
因此,我會把 H3 視為值得測試的新型製作介面,而不是已被證明能全自動交付的影片系統。只要人物走樣、產品結構錯誤或品牌文字拼錯,2K 只會讓錯誤看得更清楚。
H3 為什麼能輸出 2K?三個技術設計一次看懂
MiniMax 公布了 H3 的三個核心技術方向,但完整技術報告尚未發布。現階段可以理解設計目標,不宜把官方工程數據當成第三方已重現的結果。
H3-Contextual Omni Representation:先理解素材之間的關係
一般影片描述只要說明畫面裡有什麼。H3 還要理解參考素材和目標影片的關係,例如人物來自哪張圖片、運鏡模仿哪段影片、聲音如何配合多個鏡頭。
MiniMax 把這套方法稱為 Contextual Omni Representation。白話來說,它先用語言把人物、動作、聲音與鏡頭之間的關係描述清楚,再讓模型學習這些關係。官方表示,一份來源素材的理解過程可能需要約 10 萬 Token 的推論,最後濃縮成平均約 4,000 Token 的描述。Token 是模型切分與處理文字、符號等資訊的基本單位。
這個設計讓我更看好複雜參考素材的潛力,因為它試圖先解決「每份素材要拿來做什麼」,再開始生成。不過,濃縮也可能漏掉細節,實際測試仍要檢查品牌文字、人物特徵與鏡頭節奏是否在壓縮後被保留下來。
H3-VAE:用更高壓縮效率處理長影片與 2K 畫面
VAE 可以把它想成影片模型的壓縮與還原器。它先把高解析畫面壓成模型較容易處理的表示,再將生成結果還原成影片。
MiniMax 表示,H3-VAE 經過重新設計,帶來 4 倍有效序列長度。這代表模型能在相近計算負擔下處理更多時間與畫面資訊,也是 H3 支援原生 2K 的關鍵之一。
這項設計有直接的產品意義。影片的解析度與長度增加時,計算量很快膨脹,若壓縮效率不夠,成本與等待時間就會失控。H3-VAE 想解決的不是畫質規格本身,而是讓高解析影片在成本上有機會進入日常工作流。
In-Context Regeneration:重新生成高解析畫面,不只放大
一般超解析流程會把低解析影片交給專用放大模型,根據現有畫面猜出更多細節。H3 的 In-Context Regeneration 則讓基礎模型再次讀取原始的文字、圖片、影片與音訊條件,重新生成高解析結果。
MiniMax 認為,這種做法能找回小字與細節,因為模型不是只看低解析畫面,也能回到最初參考素材。不過,「重新生成」也意味著內容可能改變。對產品外觀、Logo、人物臉部與 UI 畫面而言,團隊仍要逐幀檢查,不能只確認輸出檔案達到 2K。
H3 的價格真的比較便宜嗎?目前只能確認官方相對說法
MiniMax 宣稱,H3 在 2K 解析度下的每秒價格,低於其所稱主流模型的三分之一;768p 每秒價格則低於主流 720p 模型的一半。這個方向很有吸引力,但官方發布文章沒有列出比較模型、訂閱方案、信用點換算與重跑成本。
因此,現在不能做出公平的絕對價格表。影片生成的真實成本也不是「單次價格乘以秒數」而已。若一支可交付影片平均需要重跑 5 次,便宜的單次生成仍可能比成功率較高的模型更貴。
比較 H3 時,我會記錄四個數字:每次生成成本、平均等待時間、可用成片率,以及人工修正時間。這四項相加,才是團隊真正付出的總成本。只看官方每秒定價,容易忽略失敗與重做。
MiniMax H3 現在怎麼用?網頁版已上線,API 與權重仍要分開看
2026 年 8 月 4 日,Hailuo AI 官方首頁已標示 H3 上線。一般使用者可以從網頁產品開始測試,不需要自行架設模型。
開發者要注意另一條界線。API 是讓程式呼叫模型的介面,適合把生成能力接進自家產品或自動化流程。MiniMax API 官方文件目前列出的影片模型仍是 Hailuo 2.3、Hailuo 2.3-Fast 與 Hailuo 02 等既有型號,還沒有 H3 的正式型號、輸入限制與計費參數。
「網頁版已能使用」不等於「API 已正式開放」,更不等於「可下載到自己的伺服器」。如果只是內容團隊試做素材,先用 Hailuo AI 最實際;若要串接產品,應等官方文件明確列出 H3,再依正式參數開發。
MiniMax H3 已經開源嗎?官方有承諾,但權重尚未落地
MiniMax 在發布文章中表示,計畫於數日內開放 H3 模型權重,讓社群適配更多 AI 硬體並建立客製版本。模型權重可以理解成模型訓練後保留下來的核心參數,取得權重後,開發者才有機會自行部署或調整模型。
但截至 2026 年 8 月 4 日,MiniMax 官方 Hugging Face、ModelScope 與 GitHub尚未出現 H3 權重與正式授權文件。現況應寫成「官方預告開放權重」,不能寫成「H3 已開源」。
這個差別會影響企業採用。權重是否可下載、授權是否允許商業使用、需要多少 GPU、能否在常見推論框架運作,都要等模型卡與授權文件。只有一句「Open Model」,不足以證明一般團隊已能自行部署。
H3 適合哪些人?我會先看三種工作
H3 最適合先由已經有素材庫與明確驗收標準的團隊測試。第一種是品牌與廣告團隊,他們需要角色、產品、Logo、鏡頭語言與聲音保持一致。第二種是電商與社群內容團隊,需要快速把產品照延伸成多個短影片版本。第三種是遊戲、影視與 UI/UX 團隊,用影片快速驗證場景、介面動態與提案方向。
純粹想把一句文字變成漂亮影片的使用者,也能用 H3,但未必會用到它最有差異的能力。若沒有圖片、影片與音訊參考,多模態工作流的價值就不明顯,選擇速度更快或價格更清楚的模型可能更實際。
正式測試時,可以準備 10~20 組代表性素材,每組重複生成多次,檢查以下項目:
- 人物與產品在不同鏡頭是否保持一致。
- Logo、小字與包裝是否正確。
- 運鏡是否真的來自參考影片,而不是只保留大致風格。
- 語音、音效與動作是否同步。
- 生成幾次才能得到一支可交付影片。
如果 H3 能降低第五項的重做次數,它才真正改善成本。若只是最高畫質更漂亮,但成功率與人工修正沒有進步,對商業團隊的價值仍有限。
MiniMax 自己也承認 H3 還沒完成
MiniMax 在官方文章中列出三個後續方向:加強多模態理解、擴大模型規模,以及改善部分場景的視覺細節。下一代 H 系列還計畫整合 M 系列模型的理解能力。
這段資訊比宣傳規格更值得注意。它表示 H3 雖然已能生成 2K 與原生聲音,對複雜素材的理解與細節穩定度仍有進步空間。對使用者來說,這不是拒絕使用的理由,而是設定合理預期的依據。
我的結論維持中性偏多。H3 把 AI 影片的競爭從「單次生成畫質」推向「能否理解完整創意脈絡」,方向是對的,也比單純增加解析度更接近真實製作需求。但在技術報告、第三方測試、API 與權重正式公布前,它仍是一個值得進入測試清單的新模型,不是可以無條件取代現有工具的答案。
FAQ
MiniMax H3 是誰開發的?
MiniMax H3 由 MiniMax 開發,於 2026 年 7 月 31 日公布。它屬於 Hailuo 影片模型路線,和主打文字、Coding 與 Agent 的 MiniMax M3 不同。
MiniMax H3 可以生成多長、什麼解析度的影片?
官方公布 H3 最長可生成 15 秒影片,最高支援 2K,並能同時生成原生立體聲。實際可選規格與消耗仍要以 Hailuo AI 當下介面為準。
MiniMax H3 可以輸入哪些參考素材?
H3 能理解文字、圖片、影片與音訊。官方展示把參考影片的運鏡、參考圖片的人物及參考音訊的歌聲組合成新影片。
MiniMax H3 已經開源了嗎?
還不能這樣說。MiniMax 已預告開放模型權重,但 2026 年 8 月 4 日官方 Hugging Face、ModelScope 與 GitHub 尚未看到 H3 權重及正式授權文件。
MiniMax H3 有 API 嗎?
Hailuo AI 網頁版已經上線 H3,但 MiniMax 官方 API 文件在 2026 年 8 月 4 日尚未列出 H3 型號與參數。需要產品串接的團隊應等正式 API 文件,再開始估算開發與維護成本。
MiniMax H3 適合商業使用嗎?
付費服務條款表示,MiniMax 不主張付費訂閱者下載之生成內容的所有權,使用者可保留相關權利並作商業使用。不過,使用者仍須確保輸入素材、人物肖像、品牌商標與音樂本身有合法權利;生成內容可商用,也不代表官方展示影片可直接轉載。