MAI-Voice-2.1 與 Flash 更新:微軟語音 AI 把高音質與低延遲分成兩條路
Microsoft AI 這次把語音生成的需求分成兩條路:重視音質的 MAI-Voice-2.1,以及重視反應速度與大量使用的 MAI-Voice-2.1-Flash。對做有聲內容與客服對話的團隊而言,同一個「AI 配音」需求,其實可能需要很不同的模型。
Microsoft AI 這次把語音生成的需求分成兩條路:重視音質的 MAI-Voice-2.1,以及重視反應速度與大量使用的 MAI-Voice-2.1-Flash。對做有聲內容與客服對話的團隊而言,同一個「AI 配音」需求,其實可能需要很不同的模型。
本文會進一步說明自然聲音與快速回應,並分析實際使用條件與評估方法。
2026 年 10 月 1 日的更新同時包含多語言與短音訊聲音匹配。本文整理價格與速度口徑,並說明如何依作品或對話情境選擇,避免把聲音好聽當成每個場合的唯一標準。

兩種語音模型的用途不同
依 Microsoft AI 官方模型頁,MAI-Voice-2.1 把文字轉為自然語音,每百萬字元 22 美元,模型推論延遲約 550 毫秒。Flash 版本每百萬字元 15 美元,模型推論延遲約 45 毫秒。字元是計費單位,和錄音分鐘數不能直接互換。
官方 同日公告 另以端到端延遲約 150 毫秒描述 Flash 的生成示範。45 與 150 毫秒衡量不同階段,使用者真正聽到聲音的時間還包含連線、排程與播放處理,不能混成一個數字比較。
同一個聲音可以跨語言
官方公告說明支援 23 種語言與 26 個地區語系設定,可讓同一個聲音以不同語言說話,也可用幾秒參考音訊匹配聲線。對多語言品牌或教學內容,這能減少每換一種語言就改變角色聲音的問題。
聲線一致仍要與發音正確分開驗收。臺灣用語、人物名字、專業術語與中英混讀,需要逐項聽過。短音訊能建立相似聲線,也不等於取得對方聲音的使用同意。
有聲內容和即時客服,選擇標準不同
有聲書、長篇旁白與品牌影片,可以先比較段落情緒與穩定性。客服或即時助理則必須把等待時間、打斷處理與多輪對話放在一起測,聲音品質只是一部分。
我會先選一段包含中文、英文品牌與數字的固定稿,讓兩個版本讀相同內容。長篇作品看修稿與重配的時間,即時產品看使用者是否能順暢接話。這能讓較低單價與較高音質的取捨變得具體。
自然聲音與快速回應,對應不同的產品需求
有聲書的聽眾可以接受開始前稍等片刻,卻會在意長時間聆聽是否自然。客服使用者則可能只想迅速得到一句清楚的回答。Microsoft AI 把 MAI-Voice-2.1 與 Flash 分成兩個方向,讓開發者依音質與反應需求取捨。這種產品分工比單純宣佈「更像人」更有用,因為它直接對應不同工作情境。
官方模型頁把一般版本定位在保真度優先的用途,例如有聲內容與旁白。Flash 則偏向對延遲敏感的客服與助理。保真度在這裡指聲音細節與表達品質能否保持。實際選擇仍需要聆聽代表性稿件,不能只因 Flash 名稱較快,就推論它適合所有內容,也不能因為一般版價格較高,就假設每句話都更好。
一個產品甚至可能同時需要兩者。互動課程的即時問答重視快速回應,固定課程旁白則重視長句、停頓與情緒一致。這是產品設計的假設例子,是否能在同一套架構中切換,仍要看整合方式與聲音配置。模型分工提供的是選擇空間,實際體驗需要產品團隊建立一致的聲音標準。
四十五毫秒的推論,不等於使用者四十五毫秒就聽到
官方頁面列出一般版約五百五十毫秒、Flash 約四十五毫秒的模型推論延遲。推論延遲是模型處理輸入所需的一部分時間,使用者聽到聲音之前,還有網路傳輸、聲音封裝與播放準備。若前面還要等待語言模型寫好回答,整個流程會更長。因此,數字比較應保留相同時間口徑。
對語音助理而言,從使用者說完到第一段聲音播放的等待,往往更接近實際感受。團隊應測量這段端到端時間,並觀察不同長度的回答。短回答可以很快開始,長回答則需要保持後續聲音供應,避免說到一半突然停住。最初反應很快但持續播放不穩,仍會讓對話顯得不自然。
客服產品還要考慮使用者打斷。助理開始說話後,使用者可能補充或更正需求。播放控制、收音與對話管理需要協調,不能由語音生成模型單獨完成。官方音檔展示可以幫助比較聲線與表現,但不能據此推論整套產品已自動支持所有打斷情境。這也是模型能力與對話體驗之間的差距。
情緒與停頓控制,應服從內容的意思
模型卡說明,MAI-Voice-2.1 可以在句子或回合層級控制語氣,並利用語音合成標記語言設定部分表達。這類標記是寫在文本週圍、指導朗讀方式的結構,不是另一個語言模型。對內容製作而言,它可以幫助安排停頓與說話風格,但過多控制也可能讓聲音失去自然的節奏。
假設一段課程旁白先解釋概念,再提醒常見錯誤,創作者可以針對兩種段落安排不同語氣,卻不必為每個字加上情緒標籤。更重要的是先把稿件寫得適合聽:短而完整的句子、明確的主詞,以及容易理解的數字念法。原稿如果充滿縮寫與括號,再好的聲音也可能讓聽衆難以跟上。
檢查時可以同時聽完整段落與容易出錯的局部。品牌名稱、人名、日期、金額與外文縮寫,需要特別確認。聲音自然並不表示念法正確,情緒豐富也不能彌補關鍵資訊錯誤。把發音問題記錄成可重複檢查的清單,能減少每次改稿後重新發現相同錯誤的成本。
同一個聲音跨語言,仍需要各語言的內容審查
官方模型卡描述二十三種語言與二十六個地區設定,並強調可在支援語言之間保持聲音身份一致。對跨市場內容而言,這有助於維持品牌聽覺風格,但語音一致不等於翻譯正確。配音模型處理的是提供的文字,原稿翻譯是否符合當地表達,仍需要另一個檢查步驟。
官方支援列表包含簡體中文,不能據此保證臺灣口音、繁體中文專有詞與中英混讀都達到同樣品質。臺灣內容團隊可以用自己的學校名稱、地名與品牌詞做小規模試聽,記錄哪些寫法比較穩定。若特定發音必須準確,應確認可用的發音控制方法,再決定是否擴大生成。
同一份稿件轉成不同語言時,還要觀察長度變化。字幕、畫面與配音同步可能受到句子長短影響,原本十秒的段落在另一個語言裏可能需要更久。保留完整意思與清楚表達,通常比強行塞進原時長更重要。模型支持多語言,提供的是製作能力,真正交付仍需要語言與畫面共同檢查。
聲音複製需要覈准與同意,不是任意模仿入口
官方模型卡提到,可使用五到六十秒的參考聲音建立匹配,而且不必另外微調模型。微調是針對特定資料再訓練。這項能力降低技術準備量,但模型卡也明確說明,個人聲音存取需要微軟覈准,並需提供聲音本人錄製的同意聲明。短音檔足以提供技術參考,不代表取得音檔就取得使用權。
對企業而言,授權應涵蓋具體用途與使用範圍。員工同意錄製一段示範,不必然表示願意讓公司無限期用同一聲音製作其他內容。實務上可以先明確約定聲音將用在哪些產品、是否可跨語言、何時停止使用,以及離職或撤回時如何處理。這是組織管理建議,不是本文對任何地區法律作出的判斷。
授權過程也需要與聲音文件分開保存。製作團隊應該知道使用的是授權聲線還是臨時測試聲音,避免在正式內容裏混用。對於不能獲得適當授權的情況,使用官方提供的許可聲線通常更容易管理。聲音複製的新聞熱度很高,落地的關鍵卻是技術能力與同意流程能否一起完成。
官方頁面另展示五千零三十二次成對評判的偏好圖,Voice-2.1 為百分之五十八點九。圖表比較同時使用不同版本與提示,因此不能把差異全部歸於模型版本。另一項四千名聽眾的測試合併兩個版本結果,也需要保留合併口徑。這些圖適合觀察官方評估方向,自己的稿件仍應重新試聽。

每百萬字元的價格,應與重做次數一起估算
官方公佈一般版每百萬字元二十二美元,Flash 每百萬字元十五美元。假設輸入二十萬字元,只計算該費率,一般版約四點四美元,Flash 約三美元。這裡的計費單位是字元,因此需要統計輸入文字量,再依費率估算。實際計費與適用條件仍應查看所使用的服務。
成本也會受到生成次數影響。一段稿件若反覆調整語氣、改發音與換版本,輸入總量可能比最終交付稿多出很多。團隊可以分別記錄初稿生成、修稿重生與正式採用的字元量,才能知道費用花在哪裡。單看最後成品的篇幅,容易低估內容製作中的重做。
模型費率之外,還包含聽審與後期整理。若高品質版本可以減少剪接或發音修復,可能比單次便宜的選擇更省時。如果只是短句通知,Flash 的反應與費率可能更符合需求。比較兩者應以同一份稿件與相同驗收標準進行,避免用不同內容得出不公平的結論。

官方詩歌展示,適合觀察表達而不是替代產品驗證
Microsoft AI 頁面展示了 Ode 與 William Sieghart 的合作內容,也提供不同朗讀風格的音檔。詩歌特別適合觀察停頓、情緒與句子節奏,因為同一段文字的意思會受到朗讀方式影響。讀者可以通過官方影片理解模型為何把自然表達作為重點,同時記得展示來自經過選擇的內容。
企業要驗證自己的用途,應用真實代表性稿件重新試聽。例如課程旁白需要清楚講解,客服需要簡短可靠,有聲書則要求較長時間保持一致。三個用途的驗收標準不同,不能憑同一個詩歌樣本決定全部採用。官方合作展示提供了感受聲音的入口,自己的任務纔是最終選擇依據。
MAI-Voice-2.1 的重要變化,是把聲音品質、速度與授權流程放進同一套產品選擇。需要即時回應的團隊可以先評估 Flash,需要長篇表達的創作者則可以比較一般版。無論選擇哪一個,稿件品質、發音檢查與聲音同意都應成為交付流程的一部分,才能把模型能力轉成可信的內容。
能力與個人聲音存取條件可對照 MAI-Voice-2.1 官方模型卡。
常見問題
15 美元代表一百萬個中文字的最終影片成本嗎?
這是 Flash 的文字輸入計價,成品還可能需要重試、剪輯或其他服務。不能把模型單價當成整支影片的製作費。
參考音訊可以直接用任何人的聲音嗎?
技術上能匹配聲線,使用上仍需要聲音權利與同意。官方也提到內建同意保護機制,實際專案應保留可證明授權的資料。
把模型用在合適的場景
MAI-Voice-2.1 與 Flash 提供的是音質、等待時間與單價的不同組合。先確定是做作品還是做互動服務,再用同一段測試稿比較,會比追逐單一速度數字更有效。