MiniMax Music 3 開放權重:最長 5 分鐘、8 GB VRAM 也能部署,AI 生歌走向本機製作
MiniMax Music 3 開放完整模型權重,支援最長 5 分鐘歌曲與本機部署。本文整理功能、GPU 需求、商用授權、官方音訊 Demo 與限制。
AI 音樂工具已經能用一句提示詞生成歌曲,但大多數產品把模型留在雲端。使用者可以按下生成,卻無法把核心模型下載到自己的電腦,更難控制資料、部署環境與後續整合。
MiniMax Music 3 改變的是這一層。MiniMax 公開了模型權重、推論範例與部署方法,開發者可以自行下載,在 NVIDIA GPU 上生成最長 5 分鐘的完整歌曲。它不只接收歌詞,也能理解曲風、速度、情緒變化、唱腔、樂器與各段編曲安排。
這次發布值得關注,但不等於一般創作者都該立刻下載。模型倉庫約 53.4 GiB,官方低記憶體方案雖然可壓到 8 GB VRAM,代價是把模型分批搬移到 GPU,生成速度會變慢。它採用的也不是 Apache 2.0 或 MIT,而是包含商用標示與營收門檻的自訂授權。
我的判斷是中性偏正面。對 AI 音樂開發者來說,Music 3 是少見的完整歌曲開放權重模型。對只想快速做短影音配樂的人來說,網頁版或讓程式呼叫服務的 API 仍然比較省事。
MiniMax Music 3 是什麼?
MiniMax Music 3 是一款文字生成音樂模型。使用者提供歌詞與音樂描述後,模型會一次產生包含人聲、旋律、樂器與編曲的立體聲歌曲,而不是只輸出 MIDI、單一旋律或幾秒鐘的音效。
「開放權重」代表開發者可以下載 AI 已訓練完成的參數,在自己的硬體上執行與整合。它和一般雲端生歌服務最大的差別,是模型不必永遠留在供應商的伺服器上。不過,開放權重不代表沒有使用條件,Music 3 仍受 MiniMax 自訂授權約束。
| 項目 | MiniMax Music 3 公開規格 | 對使用者的意義 |
|---|---|---|
| 最長歌曲 | 5 分鐘 | 可以直接規劃主歌、副歌、橋段與尾奏,不只做短片段 |
| 輸入 | 歌詞+音樂描述 | 內容與唱法、曲風、配器可以分開控制 |
| 輸出 | 32 kHz、16-bit、stereo WAV | 可直接取得帶人聲與伴奏的音訊檔 |
| 部署方式 | SGLang-Omni、Diffusers、ComfyUI | 可做 API 服務、Python 工作流或節點式創作流程 |
| 硬體 | CUDA GPU;24 GB 以上較直接,8 GB 可用低記憶體方案 | 一般無獨立顯卡的筆電不是主要使用環境 |
| 授權 | MiniMax-Music3 COMMUNITY LICENSE | 可商用,但有名稱標示、營收門檻與安全義務 |
真正的新聞價值不是「AI 又會唱歌了」,而是完整模型可以進入開發者自己的產品與研究環境。這讓團隊有機會控制部署位置、建立固定工作流,或針對自己的題材測試模型,不必把所有素材直接交給第三方雲端服務。
最長 5 分鐘之外,Music 3 強在哪裡?
5 分鐘只是一個容易理解的數字。更重要的是,模型試圖在這段時間裡維持歌曲結構,而不是把數個聽起來相似的片段接在一起。
歌詞與音樂描述分開輸入
使用者可以在歌詞中加入 [Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Bridge]、[Solo] 與 [Outro] 等段落標籤。這些標籤告訴模型每句歌詞在歌曲中的位置。
另一個輸入欄位則負責音樂描述。MiniMax 建議先交代全曲的曲風、速度與情緒走向,再描述主唱的聲線、演唱方式與和聲。最後才補上各段落的樂器、節奏、空間感與製作效果。
這種設計的好處,是創作者不必把所有要求塞進一句提示詞。例如同一份歌詞可以要求「96 BPM 的木吉他流行曲,女聲貼近收音,副歌加入和聲與鼓組,最後一段擴大空間感」。模型因此比較像在接收一份簡化製作 Brief,而不是只看曲風關鍵字抽卡。
從前後結構到每一幀的聲音細節
Music 3 採用兩層語言模型。8B Global LLM 負責理解整首歌的長距離結構,角色比較像製作人,決定主題如何重複、段落怎麼推進,以及聲線與節奏如何延續。8B 代表約 80 億個參數,這一層由 Qwen3-8B 初始化,再針對音樂資料訓練。
0.6B Local LLM 則處理每個音訊片段的細節,角色更接近錄音與音色工程,補上人聲咬字、樂器質感與局部聲學資訊。接著,2.4B 的 Flow Matching 模組與 Flow-VAE 解碼器會把模型內部的音樂表示轉回可播放的波形。

這套分工說明了 MiniMax 想解決的問題:長歌曲需要記得前後關係,高品質音訊又需要處理非常密集的局部細節。把兩件事交給不同層級的模型,方向上比用單一模型同時硬撐更合理。
但架構合理不等於成果已經勝過所有競品。MiniMax 沒有在模型卡公布跨模型的標準化比較,也沒有提供第三方盲測。官方 Demo 可以用來判斷聲音風格,不能直接證明所有歌詞、語言與曲風都能穩定維持 5 分鐘品質。
先聽兩首官方生成範例
第一首是 MiniMax 官方 Demo 提供的 Mandarin Pop/Traditional Ballad 範例,長度約 2 分 22 秒。歌詞包含主歌、副歌、第二段主歌、預副歌與橋段,可以用來觀察中文演唱、段落切換與配器變化。
官方音訊:播放中文歌曲範例(2 分 22 秒)
音訊來源:MiniMax Music 3 官方 Demo。點擊後會另開官方音訊,不會在文章中自動播放。
第二首是約 4 分 48 秒的 Country/Alt-Country Ballad。它接近官方公布的 5 分鐘上限,比短篇 Demo 更適合檢查模型能否在長歌曲中維持主歌、副歌、器樂間奏、橋段與結尾。
官方音訊:播放長歌曲範例(4 分 48 秒)
音訊來源:MiniMax Music 3 官方 Demo。點擊後會另開官方音訊,不會在文章中自動播放。
這兩首仍是發布方挑選的範例,不是獨立測試。它們最適合用來確認 Music 3 想呈現的能力,再搭配自己的固定測試題材做比較。
8 GB VRAM 能跑,但不代表一般電腦都跑得動
VRAM 是顯示卡專門存放模型與運算資料的記憶體。MiniMax 提供的 Diffusers 範例以 24 GB 以上 VRAM 為較直接的配置;開啟 CPU offloading 後,運作時約需 22 GB VRAM。CPU offloading 會把暫時不用的模型元件移到電腦主記憶體,需要時再送回顯示卡。
如果顯示卡只有 8 GB VRAM,官方還提供逐層載入語言模型的方式。這能降低顯示記憶體門檻,但資料必須在 CPU 與 GPU 之間反覆搬移,因此比較適合驗證模型能不能工作,不適合把「8 GB 可載入」直接理解成「8 GB 可以快速生歌」。
部署還有幾個實際成本:
- Hugging Face 倉庫檔案合計約 53.4 GiB,下載與儲存空間都不能忽略。
- 官方目前要求 CUDA,也就是主要面向 NVIDIA GPU,沒有提供 Apple Silicon 或純 CPU 的正式路徑。
- 目前只支援非串流生成,不能一邊運算一邊立即播放已完成的前半段。
- 文字提示上限為 5,000 tokens,音訊生成上限為 9,000 acoustic frames。
這讓 Music 3 的本機部署價值很明確:團隊可以掌握模型與資料,但也要自行負擔硬體、維運、排隊、失敗重試與輸出保存。雲端工具收的是使用費,本機模型省下部分 API 依賴,換來的是工程成本,兩者不是單純的免費與付費差別。
開放權重等於免費商用嗎?
下載模型不需要支付權重費用,商用卻不是完全無條件。
依 MiniMax-Music3 COMMUNITY LICENSE,商業產品或服務若使用這套模型,介面必須清楚顯示 MiniMax-Music3。若使用者與關係企業透過相關產品或服務產生的合計年營收超過 2,000 萬美元,還必須先向 MiniMax 取得書面授權。
若企業把 Music 3 做成對外開放的生成服務,還要建立、測試並定期檢視合理的保護措施,降低使用者生成侵權或違規內容的風險。授權的 Acceptable Use Policy 也要求,公開散布模型生成內容時,必須清楚揭露內容由機器生成。
這些條款不妨礙小型團隊研究或推出產品,但會影響產品設計。名稱標示要放在哪裡、如何處理疑似仿冒歌手或侵權歌詞、公開內容如何揭露 AI 生成,都不能等服務上線後才處理。
還有一個常見誤解需要拆開:模型授權允許商用,不代表每一首輸出都自動沒有版權風險。使用者仍要確保輸入的歌詞、參考內容與其他素材有合法權利,也不能把模型生成結果當成對第三方權利的保證。
延伸閱讀:被唱片公司告了兩年!Suno 估值卻翻倍,拿到 126 億台幣融資
本機模型、網頁版與 API 該怎麼選?
Music 3 同時出現在 MiniMax 官網與開放權重生態中,但三種使用方式解決的問題不同。
| 使用方式 | 適合誰 | 優勢 | 主要代價 |
|---|---|---|---|
| MiniMax 網頁版 | 想快速產歌的一般創作者 | 不必安裝環境或準備 GPU | 可控制的部署與整合範圍較少 |
| MiniMax API | 要把生歌功能放進 App 的產品團隊 | 串接速度快,基礎設施由平台處理 | 受模型名稱、費率、配額與平台政策影響 |
| Hugging Face 開放權重 | 研究者、AI 音樂工程團隊、需要自有部署的企業 | 可控制模型位置、推論流程與資料路徑 | 需要 CUDA 硬體、儲存空間與維運能力 |
截至 2026 年 8 月 14 日,MiniMax 官網首頁已把 Music 3.0 列為旗艦模型,但標準 Music Generation API 文件仍主要列出 music-2.6、music-2.6-free 與 music-cover。開發者不能只看產品名稱就假設 API 與 Hugging Face 權重完全相同,串接時應以帳號實際可選的模型名稱與當期文件為準。
如果目標是做一支短影音的背景音樂,我會先選網頁版,因為部署 Music 3 的時間可能比做完影片還長。如果要研究固定風格生成、把音樂功能放進內部系統,或需要控制資料留存位置,開放權重才會展現價值。
延伸閱讀:不只是一鍵生歌:ElevenLabs Music v2 的分段編輯功能,正在改變 AI 音樂製作流程
MiniMax Music 3 目前有哪些限制?
第一個限制是控制仍然屬於生成式控制。段落標籤、BPM、調性、樂器與唱法都是引導,官方明確表示,生成結果不一定會嚴格符合每一項要求。需要精準節拍、固定旋律或逐軌交付的專業製作,仍要進入數位音訊工作站繼續編修。
第二個限制是工具鏈仍在快速整合。官方列出 SGLang-Omni、Diffusers 與 ComfyUI,但不同路徑的硬體需求與成熟度不完全相同。能成功載入模型只是第一步,實際產品還要處理生成時間、併發數、錯誤率與每首歌的運算成本。
第三個限制是缺少可比較的品質證據。模型卡沒有公布歌詞正確率、長篇一致性、人聲自然度或提示詞遵循度的標準化測試。對企業來說,最實際的方法不是只聽官方精選範例,而是準備一組固定歌詞與曲風,在相同條件下比較 Music 3、現有雲端服務與人工製作流程。
最後是輸出與權利管理。Music 3 產生的是合成人聲與伴奏混合後的 WAV,官方模型卡沒有把逐軌分離、局部重畫或可編輯工程檔列為核心輸出。若工作流程需要單獨調整鼓、貝斯、主唱與和聲,仍要另外加入分軌工具或其他音樂製作軟體。
MiniMax Music 3 值得用嗎?
值得,但前提是你真的需要「自己掌握模型」。
Music 3 最有價值的使用者,是正在開發 AI 音樂產品、研究生成模型,或需要把素材留在自有環境的團隊。最長 5 分鐘、歌詞與編曲分離控制,以及 24 GB 級顯示卡可部署的路徑,讓它比只能展示技術的研究模型更接近實際應用。
一般內容創作者則不需要因為「開放權重」四個字就改用本機部署。若沒有 NVIDIA GPU,也不打算維護生成服務,使用網頁版或 API 會更快。真正該比較的是完成一首可用歌曲所需的總時間,而不是模型下載是否免費。
我對 Music 3 維持中性偏正面,最大的加分來自可下載、可部署與完整歌曲控制;沒有進一步給出更高評價,是因為第三方品質驗證、中文歌詞表現、實際生成速度與商業工作流都還缺少公開數據。若後續出現獨立盲測、穩定的低記憶體整合,以及更清楚的 API 與開放權重版本對照,它才更有機會從開發者新玩具走向成熟的音樂基礎設施。
FAQ:MiniMax Music 3 常見問題
MiniMax Music 3 可以免費使用嗎?
模型權重可以免費下載,但本機執行需要自行負擔顯示卡、主記憶體、儲存空間與電力。商用也必須遵守 MiniMax-Music3 COMMUNITY LICENSE,不是下載後就沒有任何條件。
MiniMax Music 3 可以商用嗎?
可以,但商業產品介面必須顯示 MiniMax-Music3。相關產品或服務合計年營收超過 2,000 萬美元時,必須事先取得 MiniMax 書面授權;對外提供生成服務者也要建立合理的防濫用與防侵權措施。
只有 8 GB VRAM 的顯示卡可以執行嗎?
官方 Diffusers 範例提供 8 GB VRAM 的低記憶體方式,做法是把語言模型逐層搬進 GPU。它能降低載入門檻,但速度會比把模型主要元件留在顯示卡上慢,較適合測試而不是高流量服務。
Mac 可以本機執行 MiniMax Music 3 嗎?
官方目前把 CUDA 列為必要條件,主要支援 NVIDIA GPU,沒有提供 Apple Silicon 的正式部署方式。Mac 使用者若只想生成歌曲,現階段使用 MiniMax 網頁服務會比較直接。
MiniMax Music 3 和 MiniMax 網頁版是同一個模型嗎?
MiniMax 官網已展示 Music 3.0,Hugging Face 則提供 Music 3 開放權重,但官方文件沒有完整說明各平台是否採用完全相同的 checkpoint、推論設定與功能。開發者應分別依各平台文件與實際模型名稱評估,不要把結果直接視為相同。