MiniMax Music 3 開放權重:最長 5 分鐘、8 GB VRAM 也能部署,AI 生歌走向本機製作

MiniMax Music 3 開放完整模型權重,支援最長 5 分鐘歌曲與本機部署。本文整理功能、GPU 需求、商用授權、官方音訊 Demo 與限制。

Share
紫色背景上的 MiniMax Music 3 開放權重音樂生成模型主視覺
MiniMax 將 Music 3 定位為可投入製作流程的開放權重音樂模型。 圖片來源:MiniMax 官方模型倉庫

AI 音樂工具已經能用一句提示詞生成歌曲,但大多數產品把模型留在雲端。使用者可以按下生成,卻無法把核心模型下載到自己的電腦,更難控制資料、部署環境與後續整合。

MiniMax Music 3 改變的是這一層。MiniMax 公開了模型權重、推論範例與部署方法,開發者可以自行下載,在 NVIDIA GPU 上生成最長 5 分鐘的完整歌曲。它不只接收歌詞,也能理解曲風、速度、情緒變化、唱腔、樂器與各段編曲安排。

這次發布值得關注,但不等於一般創作者都該立刻下載。模型倉庫約 53.4 GiB,官方低記憶體方案雖然可壓到 8 GB VRAM,代價是把模型分批搬移到 GPU,生成速度會變慢。它採用的也不是 Apache 2.0 或 MIT,而是包含商用標示與營收門檻的自訂授權。

我的判斷是中性偏正面。對 AI 音樂開發者來說,Music 3 是少見的完整歌曲開放權重模型。對只想快速做短影音配樂的人來說,網頁版或讓程式呼叫服務的 API 仍然比較省事。

MiniMax Music 3 是什麼?

MiniMax Music 3 是一款文字生成音樂模型。使用者提供歌詞與音樂描述後,模型會一次產生包含人聲、旋律、樂器與編曲的立體聲歌曲,而不是只輸出 MIDI、單一旋律或幾秒鐘的音效。

「開放權重」代表開發者可以下載 AI 已訓練完成的參數,在自己的硬體上執行與整合。它和一般雲端生歌服務最大的差別,是模型不必永遠留在供應商的伺服器上。不過,開放權重不代表沒有使用條件,Music 3 仍受 MiniMax 自訂授權約束。

項目 MiniMax Music 3 公開規格 對使用者的意義
最長歌曲 5 分鐘 可以直接規劃主歌、副歌、橋段與尾奏,不只做短片段
輸入 歌詞+音樂描述 內容與唱法、曲風、配器可以分開控制
輸出 32 kHz、16-bit、stereo WAV 可直接取得帶人聲與伴奏的音訊檔
部署方式 SGLang-Omni、Diffusers、ComfyUI 可做 API 服務、Python 工作流或節點式創作流程
硬體 CUDA GPU;24 GB 以上較直接,8 GB 可用低記憶體方案 一般無獨立顯卡的筆電不是主要使用環境
授權 MiniMax-Music3 COMMUNITY LICENSE 可商用,但有名稱標示、營收門檻與安全義務

真正的新聞價值不是「AI 又會唱歌了」,而是完整模型可以進入開發者自己的產品與研究環境。這讓團隊有機會控制部署位置、建立固定工作流,或針對自己的題材測試模型,不必把所有素材直接交給第三方雲端服務。

最長 5 分鐘之外,Music 3 強在哪裡?

5 分鐘只是一個容易理解的數字。更重要的是,模型試圖在這段時間裡維持歌曲結構,而不是把數個聽起來相似的片段接在一起。

歌詞與音樂描述分開輸入

使用者可以在歌詞中加入 [Intro][Verse][Pre-Chorus][Chorus][Bridge][Solo][Outro] 等段落標籤。這些標籤告訴模型每句歌詞在歌曲中的位置。

另一個輸入欄位則負責音樂描述。MiniMax 建議先交代全曲的曲風、速度與情緒走向,再描述主唱的聲線、演唱方式與和聲。最後才補上各段落的樂器、節奏、空間感與製作效果。

這種設計的好處,是創作者不必把所有要求塞進一句提示詞。例如同一份歌詞可以要求「96 BPM 的木吉他流行曲,女聲貼近收音,副歌加入和聲與鼓組,最後一段擴大空間感」。模型因此比較像在接收一份簡化製作 Brief,而不是只看曲風關鍵字抽卡。

從前後結構到每一幀的聲音細節

Music 3 採用兩層語言模型。8B Global LLM 負責理解整首歌的長距離結構,角色比較像製作人,決定主題如何重複、段落怎麼推進,以及聲線與節奏如何延續。8B 代表約 80 億個參數,這一層由 Qwen3-8B 初始化,再針對音樂資料訓練。

0.6B Local LLM 則處理每個音訊片段的細節,角色更接近錄音與音色工程,補上人聲咬字、樂器質感與局部聲學資訊。接著,2.4B 的 Flow Matching 模組與 Flow-VAE 解碼器會把模型內部的音樂表示轉回可播放的波形。

MiniMax Music 3 由歌詞與結構化音樂描述生成音訊的模型架構圖
Music 3 先用 Global LLM 規劃長篇結構,再由 Local LLM 與 Flow Matching 還原局部聲音細節。 圖片來源:MiniMax 官方模型倉庫。Copyright © 2026 MiniMax,依 MiniMax-Music3 COMMUNITY LICENSE 使用。

這套分工說明了 MiniMax 想解決的問題:長歌曲需要記得前後關係,高品質音訊又需要處理非常密集的局部細節。把兩件事交給不同層級的模型,方向上比用單一模型同時硬撐更合理。

但架構合理不等於成果已經勝過所有競品。MiniMax 沒有在模型卡公布跨模型的標準化比較,也沒有提供第三方盲測。官方 Demo 可以用來判斷聲音風格,不能直接證明所有歌詞、語言與曲風都能穩定維持 5 分鐘品質。

先聽兩首官方生成範例

第一首是 MiniMax 官方 Demo 提供的 Mandarin Pop/Traditional Ballad 範例,長度約 2 分 22 秒。歌詞包含主歌、副歌、第二段主歌、預副歌與橋段,可以用來觀察中文演唱、段落切換與配器變化。

官方音訊:播放中文歌曲範例(2 分 22 秒)

音訊來源:MiniMax Music 3 官方 Demo。點擊後會另開官方音訊,不會在文章中自動播放。

第二首是約 4 分 48 秒的 Country/Alt-Country Ballad。它接近官方公布的 5 分鐘上限,比短篇 Demo 更適合檢查模型能否在長歌曲中維持主歌、副歌、器樂間奏、橋段與結尾。

官方音訊:播放長歌曲範例(4 分 48 秒)

音訊來源:MiniMax Music 3 官方 Demo。點擊後會另開官方音訊,不會在文章中自動播放。

這兩首仍是發布方挑選的範例,不是獨立測試。它們最適合用來確認 Music 3 想呈現的能力,再搭配自己的固定測試題材做比較。

8 GB VRAM 能跑,但不代表一般電腦都跑得動

VRAM 是顯示卡專門存放模型與運算資料的記憶體。MiniMax 提供的 Diffusers 範例以 24 GB 以上 VRAM 為較直接的配置;開啟 CPU offloading 後,運作時約需 22 GB VRAM。CPU offloading 會把暫時不用的模型元件移到電腦主記憶體,需要時再送回顯示卡。

如果顯示卡只有 8 GB VRAM,官方還提供逐層載入語言模型的方式。這能降低顯示記憶體門檻,但資料必須在 CPU 與 GPU 之間反覆搬移,因此比較適合驗證模型能不能工作,不適合把「8 GB 可載入」直接理解成「8 GB 可以快速生歌」。

部署還有幾個實際成本:

  • Hugging Face 倉庫檔案合計約 53.4 GiB,下載與儲存空間都不能忽略。
  • 官方目前要求 CUDA,也就是主要面向 NVIDIA GPU,沒有提供 Apple Silicon 或純 CPU 的正式路徑。
  • 目前只支援非串流生成,不能一邊運算一邊立即播放已完成的前半段。
  • 文字提示上限為 5,000 tokens,音訊生成上限為 9,000 acoustic frames。

這讓 Music 3 的本機部署價值很明確:團隊可以掌握模型與資料,但也要自行負擔硬體、維運、排隊、失敗重試與輸出保存。雲端工具收的是使用費,本機模型省下部分 API 依賴,換來的是工程成本,兩者不是單純的免費與付費差別。

開放權重等於免費商用嗎?

下載模型不需要支付權重費用,商用卻不是完全無條件。

MiniMax-Music3 COMMUNITY LICENSE,商業產品或服務若使用這套模型,介面必須清楚顯示 MiniMax-Music3。若使用者與關係企業透過相關產品或服務產生的合計年營收超過 2,000 萬美元,還必須先向 MiniMax 取得書面授權。

若企業把 Music 3 做成對外開放的生成服務,還要建立、測試並定期檢視合理的保護措施,降低使用者生成侵權或違規內容的風險。授權的 Acceptable Use Policy 也要求,公開散布模型生成內容時,必須清楚揭露內容由機器生成。

這些條款不妨礙小型團隊研究或推出產品,但會影響產品設計。名稱標示要放在哪裡、如何處理疑似仿冒歌手或侵權歌詞、公開內容如何揭露 AI 生成,都不能等服務上線後才處理。

還有一個常見誤解需要拆開:模型授權允許商用,不代表每一首輸出都自動沒有版權風險。使用者仍要確保輸入的歌詞、參考內容與其他素材有合法權利,也不能把模型生成結果當成對第三方權利的保證。

延伸閱讀:被唱片公司告了兩年!Suno 估值卻翻倍,拿到 126 億台幣融資

本機模型、網頁版與 API 該怎麼選?

Music 3 同時出現在 MiniMax 官網與開放權重生態中,但三種使用方式解決的問題不同。

使用方式 適合誰 優勢 主要代價
MiniMax 網頁版 想快速產歌的一般創作者 不必安裝環境或準備 GPU 可控制的部署與整合範圍較少
MiniMax API 要把生歌功能放進 App 的產品團隊 串接速度快,基礎設施由平台處理 受模型名稱、費率、配額與平台政策影響
Hugging Face 開放權重 研究者、AI 音樂工程團隊、需要自有部署的企業 可控制模型位置、推論流程與資料路徑 需要 CUDA 硬體、儲存空間與維運能力

截至 2026 年 8 月 14 日,MiniMax 官網首頁已把 Music 3.0 列為旗艦模型,但標準 Music Generation API 文件仍主要列出 music-2.6music-2.6-freemusic-cover。開發者不能只看產品名稱就假設 API 與 Hugging Face 權重完全相同,串接時應以帳號實際可選的模型名稱與當期文件為準。

如果目標是做一支短影音的背景音樂,我會先選網頁版,因為部署 Music 3 的時間可能比做完影片還長。如果要研究固定風格生成、把音樂功能放進內部系統,或需要控制資料留存位置,開放權重才會展現價值。

延伸閱讀:不只是一鍵生歌:ElevenLabs Music v2 的分段編輯功能,正在改變 AI 音樂製作流程

MiniMax Music 3 目前有哪些限制?

第一個限制是控制仍然屬於生成式控制。段落標籤、BPM、調性、樂器與唱法都是引導,官方明確表示,生成結果不一定會嚴格符合每一項要求。需要精準節拍、固定旋律或逐軌交付的專業製作,仍要進入數位音訊工作站繼續編修。

第二個限制是工具鏈仍在快速整合。官方列出 SGLang-Omni、Diffusers 與 ComfyUI,但不同路徑的硬體需求與成熟度不完全相同。能成功載入模型只是第一步,實際產品還要處理生成時間、併發數、錯誤率與每首歌的運算成本。

第三個限制是缺少可比較的品質證據。模型卡沒有公布歌詞正確率、長篇一致性、人聲自然度或提示詞遵循度的標準化測試。對企業來說,最實際的方法不是只聽官方精選範例,而是準備一組固定歌詞與曲風,在相同條件下比較 Music 3、現有雲端服務與人工製作流程。

最後是輸出與權利管理。Music 3 產生的是合成人聲與伴奏混合後的 WAV,官方模型卡沒有把逐軌分離、局部重畫或可編輯工程檔列為核心輸出。若工作流程需要單獨調整鼓、貝斯、主唱與和聲,仍要另外加入分軌工具或其他音樂製作軟體。

MiniMax Music 3 值得用嗎?

值得,但前提是你真的需要「自己掌握模型」。

Music 3 最有價值的使用者,是正在開發 AI 音樂產品、研究生成模型,或需要把素材留在自有環境的團隊。最長 5 分鐘、歌詞與編曲分離控制,以及 24 GB 級顯示卡可部署的路徑,讓它比只能展示技術的研究模型更接近實際應用。

一般內容創作者則不需要因為「開放權重」四個字就改用本機部署。若沒有 NVIDIA GPU,也不打算維護生成服務,使用網頁版或 API 會更快。真正該比較的是完成一首可用歌曲所需的總時間,而不是模型下載是否免費。

我對 Music 3 維持中性偏正面,最大的加分來自可下載、可部署與完整歌曲控制;沒有進一步給出更高評價,是因為第三方品質驗證、中文歌詞表現、實際生成速度與商業工作流都還缺少公開數據。若後續出現獨立盲測、穩定的低記憶體整合,以及更清楚的 API 與開放權重版本對照,它才更有機會從開發者新玩具走向成熟的音樂基礎設施。

FAQ:MiniMax Music 3 常見問題

MiniMax Music 3 可以免費使用嗎?

模型權重可以免費下載,但本機執行需要自行負擔顯示卡、主記憶體、儲存空間與電力。商用也必須遵守 MiniMax-Music3 COMMUNITY LICENSE,不是下載後就沒有任何條件。

MiniMax Music 3 可以商用嗎?

可以,但商業產品介面必須顯示 MiniMax-Music3。相關產品或服務合計年營收超過 2,000 萬美元時,必須事先取得 MiniMax 書面授權;對外提供生成服務者也要建立合理的防濫用與防侵權措施。

只有 8 GB VRAM 的顯示卡可以執行嗎?

官方 Diffusers 範例提供 8 GB VRAM 的低記憶體方式,做法是把語言模型逐層搬進 GPU。它能降低載入門檻,但速度會比把模型主要元件留在顯示卡上慢,較適合測試而不是高流量服務。

Mac 可以本機執行 MiniMax Music 3 嗎?

官方目前把 CUDA 列為必要條件,主要支援 NVIDIA GPU,沒有提供 Apple Silicon 的正式部署方式。Mac 使用者若只想生成歌曲,現階段使用 MiniMax 網頁服務會比較直接。

MiniMax Music 3 和 MiniMax 網頁版是同一個模型嗎?

MiniMax 官網已展示 Music 3.0,Hugging Face 則提供 Music 3 開放權重,但官方文件沒有完整說明各平台是否採用完全相同的 checkpoint、推論設定與功能。開發者應分別依各平台文件與實際模型名稱評估,不要把結果直接視為相同。

資料來源