Meta Muse Voice Transcribe 是什麼?即時轉錄 20+ 人、3.1% 錯字率,真正亮點不只是速度
Muse Voice Transcribe 把即時轉錄、發言者分離與語音端點判斷整合進同一模型。本文解析榜單、中文支援、價格與導入限制。
Mark Zuckerberg 在 2026 年 9 月 1 日公布 Muse Voice Transcribe,這是 Meta Superintelligence Labs(MSL)推出的第一個即時音訊感知模型。
它不只會把聲音轉成文字,還能在對話進行時分辨不同發言者,並判斷一個人何時真的說完。過去常要由多套服務依序完成的工作,現在被放進同一個串流模型。
我的判斷是中性偏多。對會議紀錄、即時字幕與 Voice Agent 來說,少接幾段處理流程,確實可能換來更低延遲與更簡單的系統。不過,Meta 強調的 3.1% 錯字率來自特定英文串流測試,不能直接解讀成繁體中文、台灣口音與真實多人會議也有相同表現。
這篇文章會拆解 Muse Voice Transcribe 的三項核心能力、榜單成績與測試限制,也會說明台灣使用者和產品團隊現在是否值得嘗試。
Muse Voice Transcribe 是什麼?
Muse Voice Transcribe 是 Meta Muse Spark 模型家族中的即時語音辨識模型。它會一邊接收聲音,一邊輸出文字,不必等整段錄音結束後才開始處理。
這類技術通常稱為自動語音辨識(Automatic Speech Recognition,ASR),白話來說,就是把人說的話自動轉成文字。Muse Voice Transcribe 的差別在於,它把另外兩項即時對話需要的能力也整合進來。
| 能力 | 白話解釋 | 實際用途 |
|---|---|---|
| Streaming ASR | 邊說邊產生文字 | 即時字幕、語音輸入、會議逐字稿 |
| Speaker diarization | 判斷每一段話由哪位發言者說出 | 多人會議、訪談、Podcast |
| Endpointing | 判斷使用者只是停頓,還是真的說完 | Voice Agent 決定何時開始回答 |
這三件事少了任何一件,對話體驗都可能出問題。只有轉錄,會議記錄會分不出誰在說話。沒有 endpointing,Voice Agent 可能在你停頓時搶話,也可能等太久才回答。
真正重要的不是功能清單變長,而是三項判斷共享同一段即時音訊與模型狀態。產品團隊不必先把聲音交給轉錄服務,再把結果送去分辨發言者,最後另外判斷一句話是否結束。流程縮短後,延遲、整合成本與錯誤傳遞都有機會下降。
Mark Zuckerberg 公布的官方示範影片,畫面顯示模型即時處理 8 位發言者與中英混用內容。 影片來源:Mark Zuckerberg 官方 X 貼文。
一個模型如何同時兼顧速度與準確度?
即時語音辨識一直有一個兩難:太早輸出,模型可能因為沒聽完而猜錯;等更多上下文,文字會比較準,使用者卻會感覺它反應很慢。
Meta 的做法是把音訊切成每段 80 毫秒的小區塊。模型每收到一段,就決定要繼續聽,還是先輸出文字。這種機制稱為 adaptive delay,也就是「自適應延遲」。容易判斷的詞可以較快送出,遇到人名、口音或語意仍不完整的片段,模型可以多等一點上下文。
Meta 表示,這套決策使用強化學習訓練。強化學習可以理解成模型反覆嘗試後,依照獎勵訊號調整策略。Muse Voice Transcribe 的獎勵同時考慮錯字率與等待時間,不只要求答對,也要求在合理時間內交出最終文字。
這個設計比單純追求「第一個字多快出現」更接近真實體驗。即時字幕很早跳出一串文字,卻不斷改寫前文,使用者仍然會覺得不穩。產品真正要看的,是句子結束後多久能得到不再變動的最終版本。

3.1% 錯字率與 0.16 秒延遲,真的代表世界第一嗎?
依照 Artificial Analysis 的串流語音轉文字榜單,Muse Voice Transcribe 在 2026 年 9 月 2 日的 AA-WER Streaming 成績為 3.0623%,一句話結束後產生最終逐字稿的平均延遲約為 0.163 秒。

WER 是 Word Error Rate,也就是「字詞錯誤率」。數字越低,代表插入、刪除或辨識錯誤的字詞越少。3.1% 可以粗略理解成每 100 個英文單字約有 3 個出錯,但實際錯誤分布會受到口音、音質、專有名詞與說話情境影響。
Artificial Analysis 的串流測試包含約 8 小時音訊,由 AA-AgentTalk、VoxPopuli 與 Earnings22 三組資料組成,權重分別為 50%、25% 與 25%。它們涵蓋 Voice Agent 對話、不同口音及財報電話會議等情境,因此比單一乾淨錄音更有參考價值。
不過,榜單第一仍要限定在同一套測試與同一個日期。它證明 Muse Voice Transcribe 在這組英文串流評估中,同時把錯字率與最終延遲壓得很低,不等於所有語言、所有麥克風與所有環境都領先。
Meta 另外公布發言者分離測試。Muse Voice Transcribe 在 AMI-IHM、AMI-SDM 與 VoxConverse 三個公開資料集的平均 diarization error rate 為 17.5%,其他五套比較系統介於 21.1% 至 28.6%。這項錯誤率衡量系統有多少時間把聲音分錯人、漏掉發言或誤判為有人說話。

17.5% 雖然在 Meta 列出的比較中最低,卻也提醒我們「能分辨 20 多人」不等於每一句都能正確標記。多人同時說話、遠距離收音與會議室回音,仍可能是實際導入時最容易出錯的地方。
中文、中英夾雜與長會議支援到什麼程度?
Meta 表示,Muse Voice Transcribe 的訓練資料涵蓋 70 多種語言,其中 25 種經過較完整驗證。官方展示了中文、法文、印地文、日文、西班牙文與越南文,也示範一句話內混用中文與英文。
這種 code-switching 指的是說話者在同一句或相鄰句子中切換語言。台灣工作場合經常把應用程式介面(API)、deadline、產品名稱與中文混在一起,因此它比「支援幾種語言」更貼近實際需求。API 是讓不同軟體互相交換資料的介面,開發者可透過它把語音能力接進自己的產品。模型還能加入語言、關鍵字與上下文偏置,事先提示人名、品牌或專業術語,降低它把陌生詞彙聽錯的機率。
但 Meta 的發布文章沒有完整列出 25 種已驗證語言,中文示範輸出的也是簡體字。現有資料只能證明模型能辨識中文,不能證明它已針對台灣繁體中文輸出、台灣口音或台語夾雜完成同等程度的驗證。
如果產品需要繁體逐字稿,測試時不能只看內容有沒有聽懂,還要檢查輸出字形、標點、數字格式、英文大小寫與人名。否則語音辨識雖然正確,後續仍要增加繁簡轉換與格式清理。
在長內容方面,Meta 宣稱模型原生支援超過一小時的音訊與 20 位以上發言者,不需要另外跑後處理。這對 Podcast、焦點團體與長會議有吸引力,但官方 Demo 仍不能取代團隊自己的連續壓力測試,尤其要觀察說話者標籤在一小時後是否仍保持一致。
Muse Voice Transcribe 可以在哪裡使用?價格多少?
Meta 目前提供三個入口:
Meta AI for Mac:按住Fn鍵,可以在其他 Mac 應用程式中使用語音輸入。Muse Code:開發者可以用語音對 coding agent 下指令。Meta Model API:產品團隊可把即時語音轉錄整合進自己的服務。
Artificial Analysis 在 2026 年 9 月 2 日列出的 Meta Model API 價格為每 1,000 分鐘 3 美元,換算每小時約 0.18 美元。這個數字在串流語音服務中有競爭力,但 API 單價不是完整導入成本。
團隊還要計算網路傳輸、錯誤重試、逐字稿儲存、後續摘要,以及人工修正的成本。如果模型在自己的語料上常把人名或發言者標錯,便宜的每分鐘價格可能會被後處理工時吃掉。
哪些產品最適合導入?
Muse Voice Transcribe 最適合需要「一邊聽、一邊理解對話結構」的產品。若工作只需要在錄音結束後產生文字,它的即時能力未必是最重要的選擇條件。
Voice Agent 與語音客服
Endpointing 能幫助 Agent 判斷使用者是否說完,降低搶話與尷尬等待。發言者標記也能讓多人共同對話的 Agent 知道目前是誰在問問題。對這類產品來說,0.1 秒的差距有時比離線逐字稿再少幾個錯字更重要。
會議、訪談與 Podcast
即時分辨發言者可以減少會後整理時間,長音訊支援也適合訪談與 Podcast。不過,若用途是正式新聞引用、法律紀錄或研究逐字稿,仍應保留人工核對,不能把 speaker label 當成身分證明。
即時字幕與跨語言對話
中英 code-switching 對國際團隊、技術簡報與線上課程很實用。宣稱支援 70 多種語言只是起點,真正決定能否採用的,是你的主要語言、口音與術語能否在測試中穩定辨識。
正式導入前,還有 4 個限制不能跳過
第一,英文榜單不能代表繁體中文。中文輸出格式、台灣口音、台語夾雜與本地人名,都需要另外建立測試集。
第二,多人數不等於多人準確度。官方支援 20 位以上發言者,但重疊說話、環境噪音與遠場收音會直接影響 diarization。產品規格應該寫明可接受的錯誤率,不要只寫「支援 20+ 人」。
第三,模型標記的是不同聲音,不一定知道真實姓名。產品仍要設計發言者確認、重新命名與合併標籤的介面,讓使用者能修正結果。
第四,錄音牽涉同意與資料治理。Meta 官方網頁 Demo 明確表示測試音訊不會被儲存,但這段說明不能直接外推到所有 API 與產品入口。處理會議、客服或受訪者錄音前,團隊仍要檢查實際服務條款、資料保留、傳輸地區與刪除機制。
最實際的做法:先跑一個 30 至 50 段音檔的 MVP
如果正在評估 Muse Voice Transcribe,我不建議一開始就搬移整套語音服務。最快也最容易維護的方法,是先準備 30 至 50 段取得同意的代表性音檔,讓新舊方案在相同資料上比較。
測試集至少要包含單人安靜錄音、多人會議、重疊說話、台灣中文、中英夾雜、專有名詞與較差麥克風。每一段固定記錄四個指標:逐字稿錯誤率、發言者錯誤率、一句話結束到最終文字的延遲,以及每小時實際成本。
產品面還要多看兩件事。第一是模型修正前文時,字幕會不會跳動得太嚴重。第二是使用者能不能快速修正人名、標點與發言者標籤。語音模型成績再高,如果修正介面難用,最後仍會把成本丟回使用者身上。
Muse Voice Transcribe 值得優先進入候選名單,但是否取代現有方案,應由自己的音訊資料決定。只要繁體中文、多人分離或資料政策其中一項不符合需求,就先維持小規模測試。
常見問題
Muse Voice Transcribe 是開源模型嗎?
Meta 目前提供 Meta Model API、Meta AI for Mac 與 Muse Code 等使用入口,官方發布文章沒有宣布公開模型權重。需要離線執行、內網部署或自行微調的團隊,不能把它當成可直接下載的開源模型。
Muse Voice Transcribe 支援繁體中文嗎?
官方表示支援中文,也展示中文與中英混用的轉錄,但沒有在發布文章中明確區分繁體中文與簡體中文。台灣使用者應實測輸出字形、標點、口音與本地專有名詞,再決定是否導入。
3.1% 錯字率代表什麼?
它是 Artificial Analysis 串流測試中的字詞錯誤率,數字越低越好。這項成績顯示模型在該組約 8 小時的英文資料上表現領先,不代表中文、吵雜環境與每一種錄音設備也只有 3.1% 錯誤。
Muse Voice Transcribe 適合做會議逐字稿嗎?
適合測試,因為它能處理長音訊並即時標記不同發言者。若逐字稿會用於正式引用、法律、醫療或人事決策,仍要保留人工核對與原始音檔,不能只依賴 AI 產生的文字。
結語:Meta 正在替 Voice Agent 裝上一雙更完整的「耳朵」
Muse Voice Transcribe 最有價值的地方,不是又把語音轉文字的榜單往前推一名,而是把聽懂內容、分辨誰在說話,以及判斷何時該回應,放進同一個即時模型。
這讓 Meta 有機會把同一套語音能力放進桌面輸入、coding agent、會議工具與未來的個人 AI 助理。對開發者而言,三合一架構與每 1,000 分鐘 3 美元的價格都值得測試。
但對台灣使用者來說,Mark Zuckerberg 的 Demo 只能證明產品方向。繁體中文、真實會議與資料政策能不能通過自己的驗收,才會決定是否採用。先用小型測試集取得證據,再決定要不要遷移,會比追著榜單換服務更實際。