MAI-Transcribe-2 是什麼?Microsoft 語音轉文字模型,速度、價格、中文支援與限制解析
Microsoft MAI-Transcribe-2 主打高速、低價與多人轉錄,本文拆解 Benchmark、中文支援與導入限制。
一小時的會議錄音,如果十幾秒就能變成有說話者標記、逐字時間碼的文字,客服、Podcast、課程字幕與訪談整理的工作方式都會改變。
Microsoft AI 在 2026 年 9 月 3 日推出 MAI-Transcribe-2。這是一套語音轉文字模型,可以把錄音中的人聲辨識成文字,並處理多人對話、專業名詞、語言切換與背景雜音。Microsoft 宣稱,它比 OpenAI 的 GPT-Transcribe 快 10 倍,而且品質更高、價格更低。
這個說法有測試數據支持,但不能只看廣告標題。MAI-Transcribe-2 在 FLEURS 多語言測試中排名第 1,在 Artificial Analysis 英文語音測試則是準確度第 2、速度第 2。它並非每個項目的絕對冠軍,真正的優勢是把高準確度、快速批次處理與低價放在同一個模型裡。
我對 MAI-Transcribe-2 的產品方向持正面看法。大量處理會議、客服或影音內容的團隊,很值得把它放進 MVP 測試。不過,這項服務仍是 Public Preview,沒有正式服務等級保證,Microsoft 也不建議直接用於正式生產工作。台灣使用者還要注意,官方雖支援中文語音,文件只明列簡體中文與粵語,沒有承諾直接輸出繁體中文。
Microsoft AI 以官方短片宣布 MAI-Transcribe-2,並主張其速度約為 GPT-Transcribe 的 10 倍。完整比較條件請搭配正文 Benchmark 章節閱讀。 影片來源:Microsoft AI 官方 X 貼文。
MAI-Transcribe-2 是什麼?
MAI-Transcribe-2 是 Microsoft AI 自行開發的第二代語音轉文字模型。語音轉文字又稱 Automatic Speech Recognition,簡稱 ASR,工作是把錄音或影片中的語音辨識成可以搜尋、編輯與分析的文字。
這不是 Microsoft 既有 Azure Speech 模型的改名版本。它屬於 Microsoft AI 的 MAI 模型家族,和 MAI-Voice、MAI-Image、MAI-Thinking 等模型並列,再透過 Microsoft Foundry 與 Azure Speech 提供給開發者使用。
Microsoft Foundry 是整合模型、AI Agent、權限與監控工具的企業 AI 平台。開發者可以在 Playground 上傳錄音測試,也能透過 API 把轉錄功能接進客服系統、影音平台或內部工作流程。API 是讓不同軟體以程式互相傳送資料的介面。
MAI-Transcribe-2 支援 60 種語言,能自動判斷錄音中的語言。輸入檔案支援 WAV、MP3 與 FLAC,單一檔案需小於 300 MB,官方 Model Card 列出的最長音訊為 2 小時。
MAI-Transcribe-2 有哪些新功能?
MAI-Transcribe-2 的進步不只在於少打幾個錯字。它把原本需要多個工具處理的工作,整合進同一個轉錄流程。
自動區分不同說話者
說話者分離(speaker diarization)會判斷錄音中何時換人講話,再把不同段落標成 Speaker 0、Speaker 1 等角色。對會議、客服通話與訪談來說,只有逐字稿還不夠,知道每一句是誰說的,才能整理責任、分析對話與製作會議紀錄。
不過,模型辨識的是「不同聲音」,不一定知道真實姓名。產品仍要讓使用者確認 Speaker 0 是誰,避免把錯誤身分帶進正式紀錄。
提供逐字時間碼
逐字時間碼會記錄每個詞在音訊中開始與持續的時間。影片平台可以用它對齊字幕,Podcast 編輯器能讓使用者點文字跳到原音,客服系統也能精確定位敏感字詞出現的位置。
這項功能會讓逐字稿從一份靜態文件,變成可搜尋、可定位的音訊索引。對長時間錄音來說,實際價值往往比單純降低少量錯字更高。
用關鍵字提示專業名詞
Keyword biasing 可以先提供藥名、品牌、產品名稱、縮寫或人名,讓模型遇到發音相近的詞時,優先考慮這些指定用語。Microsoft 文件也提醒,關鍵字只是提示,不會強迫模型一定輸出該詞。
這對醫療、法律、財務與科技訪談很重要。一般模型即使聽得懂整句,也可能把公司名稱或專有名詞換成較常見的同音字。先提供名詞表,通常比轉錄完成後逐筆尋找錯字更有效率。
選擇原音逐字稿或乾淨版
verbatim 模式會保留「嗯、呃」、重複、說到一半重來等原始口語,適合稽核、研究與需要忠實記錄的場景。clean 模式則會移除部分贅詞,整理成較容易閱讀的字幕或筆記。
兩種模式不能混為一談。若是法律、醫療或客訴證據,應優先保留原音與 verbatim 版本。若目的是文章草稿或影片字幕,clean 版本才比較省後製時間。
支援語言切換與自動語言辨識
MAI-Transcribe-2 能處理同一段對話中切換語言的情況,例如英文與西班牙文混用,也不需要使用者每次都事先指定語言。
對跨國客服與國際會議來說,這能減少先判斷語言、再把音訊送往不同模型的流程。但支援 60 種語言不代表每種語言的準確度完全相同,仍要使用自己的口音、環境與專業用語測試。

MAI-Transcribe-2 真的比 GPT-Transcribe 快 10 倍嗎?
在 Artificial Analysis 的非串流語音測試中,答案接近是。這個平台以 Speed Factor 表示速度,也就是模型每秒可以處理多少秒的音訊。數字越高,代表批次轉錄越快。
截至 2026 年 9 月 4 日,Artificial Analysis 公布的中位數結果如下:
| 模型 | AA-WER | 速度倍數 | 每 1,000 分鐘價格 |
|---|---|---|---|
| MAI-Transcribe-2 | 2.0% | 410.7 倍 | 1.67 美元 |
| Scribe v2 | 2.2% | 53.2 倍 | 3.67 美元 |
| Gemini 3.5 Transcribe | 2.6% | 89.8 倍 | 5.00 美元 |
| GPT-Transcribe | 3.3% | 40.0 倍 | 4.50 美元 |
| Nova-3 | 5.2% | 607.7 倍 | 4.30 美元 |
AA-WER 是 Artificial Analysis 使用多組英文語音資料計算的字詞錯誤率,數字越低越準。MAI-Transcribe-2 的 410.7 倍速度除以 GPT-Transcribe 的 40 倍,約為 10.3 倍,因此 Microsoft 的「快 10 倍」說法和這份測試相符。
但它並非排行榜上速度最快的模型。Nova-3 達到 607.7 倍,速度更高,代價是字詞錯誤率也較高。MAI-Transcribe-2 的價值在於:AA-WER 只有 2.0% 的同時,仍維持很高的速度與較低價格。
速度也會隨情境改變。Artificial Analysis 使用 10 分鐘音訊計算最近 7 天測試的中位數,短於 1 分鐘或長時間檔案可能得到不同結果。Microsoft Model Card 所稱「1 小時音訊約 10 秒完成」,也應視為模型推論範例,不能直接等同包含上傳、排隊與網路傳輸的完整使用者等待時間。
「全球最準、最快、最便宜」是真的嗎?
Microsoft 的發布標題把 MAI-Transcribe-2 稱為全球最準、最快、最便宜的語音辨識模型,但目前的公開排行榜不支持把三個單項都解讀成絕對第 1。
Artificial Analysis 顯示,MAI-Transcribe-2 的 AA-WER 為 2.0%,排名第 2,第一名為 1.7%。速度方面,它同樣排名第 2。價格方面,也有較便宜甚至標示為免費的服務。
Microsoft 所說的領先,比較接近「Pareto Frontier」。這個概念是:如果要找到另一個模型同時更準、更快又更便宜,目前很難找到全面勝出的選項。某些模型可以在單一指標超越它,但通常要在另外一項付出代價。
FLEURS 則提供另一種角度。FLEURS 是用來比較多語言語音辨識的公開資料集,完整資料涵蓋 102 種語言。Microsoft 選擇其中 60 種支援語言測試,公布的平均 WER 為 5.2%,並表示在這個比較範圍內排名第 1。
官方模型頁另外列出「前 25 種語言平均 WER 3.4%」。這和 60 種語言平均 5.2% 並不衝突,因為計算範圍不同。語言數增加後,會納入更多資料較少或辨識較困難的語言,平均錯誤率自然可能提高。
因此,不應把它解讀成「在所有錄音上都是全球第一」。較可靠的結論是,MAI-Transcribe-2 已成為目前少數能同時兼顧多語言品質、批次速度與價格的商用模型。
MAI-Transcribe-2 支援繁體中文嗎?
這是台灣使用者最需要注意的限制。Microsoft Model Card 把 Chinese 列入 60 種支援語言,也另外支援 Cantonese。Azure 文件進一步把語言代碼寫成 zh Chinese(simplified)與 yue Cantonese。
換句話說,官方確認它可以辨識中文與粵語,但目前沒有明確列出繁體中文語系,也沒有承諾直接輸出台灣常用的繁體字與標點格式。即使中文語音辨識正確,輸出的字形、專有名詞與台灣用語仍可能不符合需求。
若要做台灣市場的產品,我會把流程拆成兩層:先保留 MAI-Transcribe-2 的原始輸出,再建立簡體轉繁體、台灣詞彙替換與人名校對程序。醫療、法律、財務與正式字幕不能只做自動字形轉換,因為「軟體/软件」這類用語差異和姓名同音字仍需要獨立驗證。
我的評價會在 Microsoft 明確提供 zh-TW 或繁體中文測試數據後提高。在那之前,MAI-Transcribe-2 對台灣團隊是值得測試的辨識引擎,還不是可以省略在地化處理的完整逐字稿產品。
MAI-Transcribe-2 的價格是多少?
Microsoft 公布的上市限時價為每小時音訊 0.10 美元。換算 1,000 分鐘約為 1.67 美元,和 Artificial Analysis 顯示的價格一致。
這個價格只保證到 2026 年底,Microsoft 尚未在發布文章中公布活動結束後的正式價格。需要估算長期成本的企業,不應直接把 0.10 美元寫進明年的固定預算。
轉錄費也不一定是完整成本。音訊儲存、資料傳輸、後續摘要、繁體中文轉換、人工抽查與權限稽核都可能增加支出。對大量內容團隊來說,模型費用可能很低,真正昂貴的是錯誤逐字稿進入下游系統後的修正成本。
哪些人適合使用 MAI-Transcribe-2?
客服與銷售團隊
說話者分離能區分客服與顧客,逐字時間碼可以定位爭議片段,關鍵字提示則適合產品名稱、方案與專業術語。後續還能把逐字稿交給分析模型整理客訴原因、銷售異議與待辦事項。
這類場景除了把每通電話變成文字,更要保留原音連結、說話者與時間位置,讓分析結果可以回頭查證。
Podcast、影片與課程製作
一小時音訊約 10 秒的模型推論速度,能大幅縮短批次字幕與內容索引時間。逐字時間碼也適合製作字幕、搜尋片段與文字式剪輯。
內容團隊可以使用 clean 模式取得較易讀的版本,但引用來賓原話時仍應回聽音訊。模型自動刪除贅詞後,句子可能更順,卻不一定仍是逐字引用。
會議與內部知識管理
多人會議可先產生分角色逐字稿,再進一步整理摘要、決策與負責人。若公司已有 Microsoft Foundry 與 Azure 權限管理,接入成本通常比自行部署語音模型低。
但會議錄音可能包含個資、商業機密與客戶資料。產品設計不能只看模型準確度,也要確認資料會被路由到哪些 Azure 區域、保存多久、誰能讀取,以及刪除政策是否符合公司要求。
醫療、法律與金融紀錄
關鍵字提示與 verbatim 模式適合專業紀錄,但這些領域的錯字代價很高。藥名、金額、否定詞、日期與責任歸屬只要錯一個,就可能改變整段意思。
MAI-Transcribe-2 可以降低初稿成本,不能直接取代專業人員確認。尤其服務仍是 Public Preview,沒有正式服務等級協議,更不應把未驗證輸出直接寫回病歷、法律文件或交易紀錄。
MAI-Transcribe-2 有哪些限制?
第一,目前是 Public Preview。Microsoft 文件明確表示,預覽功能沒有服務等級協議,也不建議用於正式生產工作。若轉錄中斷、功能改動或區域供應變化,企業得到的保障有限。
第二,它目前主要處理檔案式與非串流轉錄。Model Card 雖把即時字幕列為用途之一,但做法是把音訊切成片段送入模型,不能直接把批次速度等同於即時對話延遲。語音助理還要另外評估分段、網路與整條回應鏈的速度。
第三,單一檔案限制為小於 300 MB,官方 Model Card 列出的最長音訊為 2 小時。更長的課程、會議或直播存檔需要切割,切割位置還可能影響上下文、說話者編號與句子完整性。
第四,繁體中文沒有獨立支援承諾。台灣用語、姓名與中英混用需要自己的測試集,不能用 FLEURS 的全球平均分數代替。
第五,Benchmark 不等於企業錄音。FLEURS 偏向朗讀語音,Artificial Analysis 雖加入口音、專業內容與較困難的音訊條件,總測試長度仍約 8 小時。客服雙講、遠端會議回音、低品質手機錄音和自家術語,仍可能得到不同結果。
如何評估 MAI-Transcribe-2?
最實際的做法,是先進行小型並排測試,再決定是否替換現有系統:
- 從真實業務中選 30 至 50 段錄音,包含安靜、吵雜、多人重疊與中英混用情境。
- 建立人工確認過的標準逐字稿,特別標記姓名、數字、否定詞與專業名詞。
- 用相同音訊比較 MAI-Transcribe-2、現有模型與一個主要競品。
- 除了 WER,也記錄說話者標記、時間碼、繁體中文、等待時間與實際費用。
- 把錯誤分級。會改變意思的錯字,權重應高於標點或贅詞差異。
- 先讓結果進入人工可確認的草稿流程,不直接寫回高風險正式系統。
這種 MVP 能在幾天內回答真正的產品問題:它是否更適合你的錄音,而不是只重複供應商在公開資料集上的平均成績。
MAI-Transcribe-2 常見問題
MAI-Transcribe-2 是免費的嗎?
不是。Microsoft 公布的限時價格是每小時音訊 0.10 美元,活動到 2026 年底。使用 Microsoft Foundry、儲存與其他下游 AI 服務時,也可能另外產生費用。
MAI-Transcribe-2 可以辨識多人會議嗎?
可以。它支援說話者分離,能將不同聲音標成不同 speaker,並提供段落或逐字時間碼。但模型不一定知道每位說話者的真實姓名,仍需由產品或使用者對應。
MAI-Transcribe-2 可以直接輸出繁體中文嗎?
官方目前列出簡體中文與粵語,沒有獨立列出繁體中文語系。台灣團隊應實際測試輸出字形與用語,並準備繁簡轉換、台灣詞彙處理和重要名詞校對流程。
MAI-Transcribe-2 比 Whisper 更準嗎?
在 Microsoft 公布的 60 語言 FLEURS 測試中,它優於 Whisper Large v3。這不代表所有錄音都會勝出,自行部署的 Whisper 仍可能在資料控制、離線使用或特定語言調整方面更合適。
MAI-Transcribe-2 可以做即時字幕嗎?
官方把即時字幕列為應用場景,但現階段的核心優勢是高速檔案轉錄。若要做低延遲直播字幕,仍需測試音訊切片、上傳、回傳與畫面顯示的端到端延遲。
要在哪裡使用 MAI-Transcribe-2?
可以透過 MAI Playground 試用,也能在 Microsoft Foundry 的 Azure Speech Fast API 中串接。Model Card 同時列出 OpenRouter,但標示為 coming soon,因此實際供應狀態應以平台頁面為準。
結論:MAI-Transcribe-2 的優勢在於三個條件同時成立
MAI-Transcribe-2 沒有在每一張排行榜都同時拿下最準、最快、最便宜。它真正難得的地方,是在 Artificial Analysis 維持 2.0% 的低字詞錯誤率時,仍能以約 410 倍即時速度處理音訊,上市限時價也只有每小時 0.10 美元。
說話者分離、逐字時間碼、關鍵字提示與 clean/verbatim 模式,讓它不只是把聲音變成字,而是開始涵蓋逐字稿進入工作流程前需要的整理能力。對客服、影音、會議與內容團隊來說,這比單純追求 Benchmark 第一更有商業價值。
目前最大的阻礙也很明確:Public Preview 沒有正式服務保證,繁體中文沒有獨立支援承諾,限時價格只到 2026 年底。我的建議是立即進行小型真實資料測試,但先不要把正式系統與成本預算完全綁在這個版本上。
如果 MAI-Transcribe-2 後續進入正式商用階段、公布長期價格,並補上繁體中文與各語言的細分結果,它很可能成為大量批次轉錄最有競爭力的選項之一。在那之前,最合理的定位是高潛力、低測試成本,但仍需人工驗證與備援流程的新模型。