MAI-Voice-2.1 與 Flash 更新:微軟語音 AI 把高音質與低延遲分成兩條路

Microsoft AI 這次把語音生成的需求分成兩條路:重視音質的 MAI-Voice-2.1,以及重視反應速度與大量使用的 MAI-Voice-2.1-Flash。對做有聲內容與客服對話的團隊而言,同一個「AI 配音」需求,其實可能需要很不同的模型。

Share
Microsoft MAI 語音代理更新官方主視覺
Microsoft AI 同時公布語音辨識與語音生成模型的官方主視覺。 圖片來源:https://microsoft.ai/news/our-first-streaming-transcription-model/

Microsoft AI 這次把語音生成的需求分成兩條路:重視音質的 MAI-Voice-2.1,以及重視反應速度與大量使用的 MAI-Voice-2.1-Flash。對做有聲內容與客服對話的團隊而言,同一個「AI 配音」需求,其實可能需要很不同的模型。

本文會進一步說明自然聲音與快速回應,並分析實際使用條件與評估方法。

2026 年 10 月 1 日的更新同時包含多語言與短音訊聲音匹配。本文整理價格與速度口徑,並說明如何依作品或對話情境選擇,避免把聲音好聽當成每個場合的唯一標準。

Microsoft MAI 語音代理更新官方主視覺
Microsoft AI 同時公布語音辨識與語音生成模型的官方主視覺。 圖片來源:Microsoft AI。

兩種語音模型的用途不同

依 Microsoft AI 官方模型頁,MAI-Voice-2.1 把文字轉為自然語音,每百萬字元 22 美元,模型推論延遲約 550 毫秒。Flash 版本每百萬字元 15 美元,模型推論延遲約 45 毫秒。字元是計費單位,和錄音分鐘數不能直接互換。

官方 同日公告 另以端到端延遲約 150 毫秒描述 Flash 的生成示範。45 與 150 毫秒衡量不同階段,使用者真正聽到聲音的時間還包含連線、排程與播放處理,不能混成一個數字比較。

同一個聲音可以跨語言

官方公告說明支援 23 種語言與 26 個地區語系設定,可讓同一個聲音以不同語言說話,也可用幾秒參考音訊匹配聲線。對多語言品牌或教學內容,這能減少每換一種語言就改變角色聲音的問題。

聲線一致仍要與發音正確分開驗收。臺灣用語、人物名字、專業術語與中英混讀,需要逐項聽過。短音訊能建立相似聲線,也不等於取得對方聲音的使用同意。

有聲內容和即時客服,選擇標準不同

有聲書、長篇旁白與品牌影片,可以先比較段落情緒與穩定性。客服或即時助理則必須把等待時間、打斷處理與多輪對話放在一起測,聲音品質只是一部分。

我會先選一段包含中文、英文品牌與數字的固定稿,讓兩個版本讀相同內容。長篇作品看修稿與重配的時間,即時產品看使用者是否能順暢接話。這能讓較低單價與較高音質的取捨變得具體。

自然聲音與快速回應,對應不同的產品需求

有聲書的聽眾可以接受開始前稍等片刻,卻會在意長時間聆聽是否自然。客服使用者則可能只想迅速得到一句清楚的回答。Microsoft AI 把 MAI-Voice-2.1 與 Flash 分成兩個方向,讓開發者依音質與反應需求取捨。這種產品分工比單純宣佈「更像人」更有用,因為它直接對應不同工作情境。

官方模型頁把一般版本定位在保真度優先的用途,例如有聲內容與旁白。Flash 則偏向對延遲敏感的客服與助理。保真度在這裡指聲音細節與表達品質能否保持。實際選擇仍需要聆聽代表性稿件,不能只因 Flash 名稱較快,就推論它適合所有內容,也不能因為一般版價格較高,就假設每句話都更好。

一個產品甚至可能同時需要兩者。互動課程的即時問答重視快速回應,固定課程旁白則重視長句、停頓與情緒一致。這是產品設計的假設例子,是否能在同一套架構中切換,仍要看整合方式與聲音配置。模型分工提供的是選擇空間,實際體驗需要產品團隊建立一致的聲音標準。

四十五毫秒的推論,不等於使用者四十五毫秒就聽到

官方頁面列出一般版約五百五十毫秒、Flash 約四十五毫秒的模型推論延遲。推論延遲是模型處理輸入所需的一部分時間,使用者聽到聲音之前,還有網路傳輸、聲音封裝與播放準備。若前面還要等待語言模型寫好回答,整個流程會更長。因此,數字比較應保留相同時間口徑。

對語音助理而言,從使用者說完到第一段聲音播放的等待,往往更接近實際感受。團隊應測量這段端到端時間,並觀察不同長度的回答。短回答可以很快開始,長回答則需要保持後續聲音供應,避免說到一半突然停住。最初反應很快但持續播放不穩,仍會讓對話顯得不自然。

客服產品還要考慮使用者打斷。助理開始說話後,使用者可能補充或更正需求。播放控制、收音與對話管理需要協調,不能由語音生成模型單獨完成。官方音檔展示可以幫助比較聲線與表現,但不能據此推論整套產品已自動支持所有打斷情境。這也是模型能力與對話體驗之間的差距。

情緒與停頓控制,應服從內容的意思

模型卡說明,MAI-Voice-2.1 可以在句子或回合層級控制語氣,並利用語音合成標記語言設定部分表達。這類標記是寫在文本週圍、指導朗讀方式的結構,不是另一個語言模型。對內容製作而言,它可以幫助安排停頓與說話風格,但過多控制也可能讓聲音失去自然的節奏。

假設一段課程旁白先解釋概念,再提醒常見錯誤,創作者可以針對兩種段落安排不同語氣,卻不必為每個字加上情緒標籤。更重要的是先把稿件寫得適合聽:短而完整的句子、明確的主詞,以及容易理解的數字念法。原稿如果充滿縮寫與括號,再好的聲音也可能讓聽衆難以跟上。

檢查時可以同時聽完整段落與容易出錯的局部。品牌名稱、人名、日期、金額與外文縮寫,需要特別確認。聲音自然並不表示念法正確,情緒豐富也不能彌補關鍵資訊錯誤。把發音問題記錄成可重複檢查的清單,能減少每次改稿後重新發現相同錯誤的成本。

同一個聲音跨語言,仍需要各語言的內容審查

官方模型卡描述二十三種語言與二十六個地區設定,並強調可在支援語言之間保持聲音身份一致。對跨市場內容而言,這有助於維持品牌聽覺風格,但語音一致不等於翻譯正確。配音模型處理的是提供的文字,原稿翻譯是否符合當地表達,仍需要另一個檢查步驟。

官方支援列表包含簡體中文,不能據此保證臺灣口音、繁體中文專有詞與中英混讀都達到同樣品質。臺灣內容團隊可以用自己的學校名稱、地名與品牌詞做小規模試聽,記錄哪些寫法比較穩定。若特定發音必須準確,應確認可用的發音控制方法,再決定是否擴大生成。

同一份稿件轉成不同語言時,還要觀察長度變化。字幕、畫面與配音同步可能受到句子長短影響,原本十秒的段落在另一個語言裏可能需要更久。保留完整意思與清楚表達,通常比強行塞進原時長更重要。模型支持多語言,提供的是製作能力,真正交付仍需要語言與畫面共同檢查。

聲音複製需要覈准與同意,不是任意模仿入口

官方模型卡提到,可使用五到六十秒的參考聲音建立匹配,而且不必另外微調模型。微調是針對特定資料再訓練。這項能力降低技術準備量,但模型卡也明確說明,個人聲音存取需要微軟覈准,並需提供聲音本人錄製的同意聲明。短音檔足以提供技術參考,不代表取得音檔就取得使用權。

對企業而言,授權應涵蓋具體用途與使用範圍。員工同意錄製一段示範,不必然表示願意讓公司無限期用同一聲音製作其他內容。實務上可以先明確約定聲音將用在哪些產品、是否可跨語言、何時停止使用,以及離職或撤回時如何處理。這是組織管理建議,不是本文對任何地區法律作出的判斷。

授權過程也需要與聲音文件分開保存。製作團隊應該知道使用的是授權聲線還是臨時測試聲音,避免在正式內容裏混用。對於不能獲得適當授權的情況,使用官方提供的許可聲線通常更容易管理。聲音複製的新聞熱度很高,落地的關鍵卻是技術能力與同意流程能否一起完成。

官方頁面另展示五千零三十二次成對評判的偏好圖,Voice-2.1 為百分之五十八點九。圖表比較同時使用不同版本與提示,因此不能把差異全部歸於模型版本。另一項四千名聽眾的測試合併兩個版本結果,也需要保留合併口徑。這些圖適合觀察官方評估方向,自己的稿件仍應重新試聽。

Microsoft AI 官方偏好評估:上圖同時比較不同版本與提示,下圖合併 Voice-2.1 和 Flash 的聽眾結果。
Microsoft AI 官方偏好評估:上圖同時比較不同版本與提示,下圖合併 Voice-2.1 和 Flash 的聽眾結果。 圖片來源:Microsoft AI。

每百萬字元的價格,應與重做次數一起估算

官方公佈一般版每百萬字元二十二美元,Flash 每百萬字元十五美元。假設輸入二十萬字元,只計算該費率,一般版約四點四美元,Flash 約三美元。這裡的計費單位是字元,因此需要統計輸入文字量,再依費率估算。實際計費與適用條件仍應查看所使用的服務。

成本也會受到生成次數影響。一段稿件若反覆調整語氣、改發音與換版本,輸入總量可能比最終交付稿多出很多。團隊可以分別記錄初稿生成、修稿重生與正式採用的字元量,才能知道費用花在哪裡。單看最後成品的篇幅,容易低估內容製作中的重做。

模型費率之外,還包含聽審與後期整理。若高品質版本可以減少剪接或發音修復,可能比單次便宜的選擇更省時。如果只是短句通知,Flash 的反應與費率可能更符合需求。比較兩者應以同一份稿件與相同驗收標準進行,避免用不同內容得出不公平的結論。

Microsoft AI 官方頁面展示 Ode 詩歌配音合作,人物為 William Sieghart。
Microsoft AI 官方頁面展示 Ode 詩歌配音合作,人物為 William Sieghart。 圖片來源:Microsoft AI。
官方產品頁提供的展示影片,請搭配本文所述推出範圍與條件閱讀。 影片來源:Microsoft AI/Ode。

官方詩歌展示,適合觀察表達而不是替代產品驗證

Microsoft AI 頁面展示了 Ode 與 William Sieghart 的合作內容,也提供不同朗讀風格的音檔。詩歌特別適合觀察停頓、情緒與句子節奏,因為同一段文字的意思會受到朗讀方式影響。讀者可以通過官方影片理解模型為何把自然表達作為重點,同時記得展示來自經過選擇的內容。

企業要驗證自己的用途,應用真實代表性稿件重新試聽。例如課程旁白需要清楚講解,客服需要簡短可靠,有聲書則要求較長時間保持一致。三個用途的驗收標準不同,不能憑同一個詩歌樣本決定全部採用。官方合作展示提供了感受聲音的入口,自己的任務纔是最終選擇依據。

MAI-Voice-2.1 的重要變化,是把聲音品質、速度與授權流程放進同一套產品選擇。需要即時回應的團隊可以先評估 Flash,需要長篇表達的創作者則可以比較一般版。無論選擇哪一個,稿件品質、發音檢查與聲音同意都應成為交付流程的一部分,才能把模型能力轉成可信的內容。

能力與個人聲音存取條件可對照 MAI-Voice-2.1 官方模型卡。

常見問題

15 美元代表一百萬個中文字的最終影片成本嗎?

這是 Flash 的文字輸入計價,成品還可能需要重試、剪輯或其他服務。不能把模型單價當成整支影片的製作費。

參考音訊可以直接用任何人的聲音嗎?

技術上能匹配聲線,使用上仍需要聲音權利與同意。官方也提到內建同意保護機制,實際專案應保留可證明授權的資料。

把模型用在合適的場景

MAI-Voice-2.1 與 Flash 提供的是音質、等待時間與單價的不同組合。先確定是做作品還是做互動服務,再用同一段測試稿比較,會比追逐單一速度數字更有效。

資料來源

延伸閱讀

Read more

【Future Circle 共筆】AI 總是生成一樣的圖片?從理解同質化到如何保留差異

【Future Circle 共筆】AI 總是生成一樣的圖片?從理解同質化到如何保留差異

當 AI 已經能快速產出夠好的答案,同質化的關鍵或許不只是 AI 能產出什麼 生成式AI已經成為我們日常生活中習慣的工具,你是否發現生成的圖片或文章往往透著一股難以言喻的相似感?這並非錯覺,而是「AI 同質化」的現象。本文將以圖片生成為例,討論 AI 模型本身的限制,以及使用者過度依賴「生成公式」如何加劇審美收斂。在追求產出效率的時代,打破同質化的關鍵在保留批判性思維、專業經驗積累與跨界連結的能力。AI 或許能快速提供及格的答案,但我們應該珍視並保留人類獨有的主體性與經驗;只要反客為主善用這項工具,AI 同樣能幫助我們探索更多意想不到的可能。