Inworld Realtime TTS-2 正式上線:會聽語氣的 AI 聲音,真的成為世界第一?
Realtime TTS-2 能參考前文語音與情緒調整說話方式。本文查核世界第一與最快宣稱,並整理價格、繁體中文限制及 PoC 方法。
過去的文字轉語音,主要工作是把一句文字「唸得像真人」。但在客服、語言學習或 AI 陪伴產品裡,聲音自然只是起點。真正影響體驗的是:AI 有沒有聽出使用者正在生氣、疲倦或猶豫,下一句能不能用合適的節奏與語氣回答。
Inworld AI 在 2026 年 9 月宣布 Realtime TTS-2 正式進入一般可用階段。TTS 是 Text-to-Speech 的縮寫,也就是把文字合成為語音的技術。這個版本不只接收要唸出的文字,也能參考前幾輪對話的聲音,根據使用者的語氣與情緒改變說話方式。
官方同時宣稱,Realtime TTS-2 已登上 Artificial Analysis 排行榜第 1,並成為同級產品中速度最快的模型。這兩句話都不是完全錯誤,但適用範圍比宣傳文案窄。它在相同複製聲線的盲測榜確實排名第 1,換成各家原生聲線後則排名第 2。不同的速度測量方法也會得到不同名次。
我的判斷是:Realtime TTS-2 值得即時語音產品進入 PoC,也就是小規模概念驗證,但理由不是一個「世界第一」標籤。它真正有價值的地方,是把對話脈絡、聲音指導、多語言與聲線一致性放進同一套即時模型。至於繁體中文品質、尖峰延遲與長時間穩定性,仍要用自己的真實情境驗證。
Inworld 團隊介紹 Realtime TTS-2 如何利用對話音訊、自然語言聲音指導與跨語言能力調整回應。 影片來源:Inworld AI 官方 X 發布貼文。
Inworld Realtime TTS-2 是什麼?
Realtime TTS-2 是 Inworld AI 為即時對話設計的新一代文字轉語音模型。研究預覽版在 2026 年 5 月推出,這次更新代表模型已走出預覽階段,可以透過 Inworld API 與 Realtime API 正式使用。API 是讓不同軟體交換資料與呼叫功能的介面。

一般 TTS 收到文字後,主要決定發音、停頓與音色。Realtime TTS-2 多了一層對話脈絡:在 Realtime API 工作階段中,它可以接收前幾輪的實際音訊,而不只是逐字稿。換句話說,使用者說出同一句「我沒事」,平靜、遲疑或帶著怒氣時,模型取得的資訊不再完全相同。
不過,這不表示 TTS-2 自己會思考答案。完整語音 Agent 通常仍由三個部分組成:STT 把聲音轉成文字,LLM 理解需求並產生回答,TTS 再把答案說出來。LLM 是大型語言模型,負責對話中的理解與推理。TTS-2 改善的是最後的「怎麼說」,不是取代前面的「說什麼」。
這個分工很重要。若客服 AI 查錯訂單或承諾了不能做的事,聲音再有感情也無法補救。即使答案正確,語氣與情境完全不合時,使用者仍會覺得它很像機器。TTS-2 要解決的是後一種問題。
Realtime TTS-2 和上一代差在哪裡?
Realtime TTS-2 的變化可以濃縮成四件事:聽前文、用文字控制表演、跨語言維持同一聲線,以及讓團隊自行設計聲音角色。這四項功能會一起決定一段語音是否符合當下情境,不能只當成四個獨立規格來看。
1. 聽見前幾輪對話,不只讀逐字稿
Inworld 表示,TTS-2 能在 Realtime API 中參考前幾輪對話的音訊,讓語速、音高與能量延續使用者當下的狀態。相同的一句回答,接在笑話後面可以更輕快,接在壞消息後面則可以放慢並降低音調。

這比替每種情緒手動寫條件更有彈性。過去團隊可能先用另一個模型判斷「憤怒」或「悲傷」,再把固定參數送給 TTS。現在模型可以直接利用聲音訊號,但也因此增加測試難度。情緒判斷錯誤時,回應可能變得刻意,甚至讓使用者覺得被敷衍。
2. 用自然語言指導聲音演出
開發者可以在文字中加入像舞台指示的內容,例如要求聲音「壓低音量,像在避免吵醒旁人」,而不是只能從開心、難過或生氣幾個預設選項中挑選。模型也支援 [laugh]、[sigh]、[breathe] 等標記,在指定位置加入笑聲、嘆氣或呼吸。
這項能力對遊戲角色、AI 陪伴、互動故事與廣告素材特別有用,因為產品團隊能描述角色當下的表演目的,而不是反覆調整一排抽象數值。反過來說,金融通知、醫療說明與客服條款更重視一致性,不一定需要最大情緒幅度。Inworld 因此提供 Expressive、Balanced 與 Stable 三種模式,讓團隊在表現力與穩定度之間取捨。
3. 跨語言切換時保留同一個聲音角色
官方介紹頁表示,TTS-2 能支援超過 100 種語言,並在一句話中途切換語言時盡量維持相同聲線。這對語言學習、旅遊服務及跨國客服很實用,因為使用者不必每換一種語言,就像換了一位說話者。
但「支援」不等於每種語言品質相同。Inworld 的技術文件曾把 15 種語言列為正式品質,另外 90 多種列為實驗支援。文件也提醒,聲音樣本與輸出文字使用同一語言時,發音與自然度通常較好。台灣團隊不應只看到「100+ 語言」就假設繁體中文、台灣口音、姓名與中英混讀已達到相同水準。
4. 用文字設計聲線,也能複製既有聲音
Advanced Voice Design 允許使用者用文字描述年齡、口音、音色與能量,再產生可保存的聲音角色。若已有合法取得的錄音,也能用 5 到 15 秒的單人乾淨音訊建立即時聲音複製。
技術門檻降低後,權利確認反而更重要。產品若要複製真人聲音,仍應取得明確同意,約定使用範圍、保存時間與撤回方式。API 能完成複製,不代表團隊自動擁有該聲音的商業使用權。
Realtime TTS-2 真的是世界第一嗎?
要回答這個問題,必須先分清楚 Artificial Analysis 的兩張榜。
Controlled Voice Arena 會要求所有模型使用相同的 8 組複製聲線,再讓真人進行匿名成對比較。這樣能減少「某家公司原本挑的聲音比較討喜」造成的影響。截至 2026 年 9 月 3 日,Realtime TTS-2 的 Elo 為 1,123 分、排名第 1,Cartesia Sonic 3.6 為 1,119 分、排名第 2。Elo 是依照模型互相比較的勝負動態計算的相對分數。
但兩者的 95% 信賴區間重疊,而且榜單給 TTS-2 的名次範圍是第 1 至第 2。白話來說,目前資料支持它位於第一梯隊,卻不足以證明它已明顯甩開 Sonic 3.6。
若改看各家使用原生聲線的 Provider Voice Arena,Sonic 3.6 以 1,282 分排名第 1,Realtime TTS-2 以 1,252 分排名第 2。Inworld 的「第 1」說法因此只適用於控制聲線變因的榜單,不是所有語音排行榜都排名第一。
這不會抹去 TTS-2 的成績,反而讓它的優勢更具體:當所有模型被要求複製同樣的聲音時,使用者偏好 TTS-2 的生成結果。至於你的使用者是否喜歡某個語言、角色與情境中的聲音,公開英文盲測仍不能代替產品自己的測試。
「同級最快」為什麼也要保留條件?
語音延遲有好幾種算法。官方文件曾公布,TTS-2 在不包含網路傳輸的伺服器端測試中,P90 首段音訊時間約為 100 毫秒,速度優先的 TTS-2 Flash 則約為 20 毫秒。P90 代表 90% 的測試請求都能在該時間內開始回傳音訊。
這個數字適合比較 Inworld 自家模型,卻不等於使用者按下按鈕後 100 毫秒就一定聽到聲音。真實等待時間還會受到網路、連線建立、音訊緩衝、前置靜音、STT 與 LLM 思考時間影響。
持續量測語音 API 的 Coval 使用「從送出請求到第一段可聽聲音」作為指標。在截至 2026 年 9 月初的 30 天資料中,TTS-2 平均為 177 毫秒,在 28 個受測模型中排名第 4。TTS-2 Flash 為 127 毫秒,排名第 3。它們都很快,但並不是這套測量方法下的第 1。
所以更穩妥的結論是:TTS-2 屬於目前延遲很低的第一梯隊,TTS-2 Flash 則是 Inworld 家族中更快的選項。「世界最快」必須先說清楚比較對象、地區、音訊格式,以及計時從伺服器內部還是使用者端開始。
Realtime TTS-2 價格多少?
Inworld 依每 100 萬個輸入字元計費。官方價格頁在 2026 年 9 月 3 日列出的費率如下:
| 方案 | 每月方案費 | TTS-2/100 萬字元 | TTS-2 Flash/100 萬字元 |
|---|---|---|---|
| On-Demand | US$0 | US$25 | US$15 |
| Creator | US$25 | US$20 | US$10 |
| Builder | US$100 | US$17.50 | US$9 |
| Developer | US$300 | US$15 | US$8 |
| Growth | US$1,500 | US$12.50 | US$7 |
| Enterprise | 客製 | 最低 US$5 | 低於 US$5 |
付費方案的月費會轉成同額使用額度,而不是在月費之外再付一次完整用量費。On-Demand 方案提供最高約 70 分鐘的 TTS 試用額度,官方換算假設一分鐘語音約使用 1,000 個字元。
若只是做內容旁白,單價通常容易估算。即時語音 Agent 還要把 STT、LLM、電話線路、同時連線數與失敗重試算進去。TTS 每百萬字元便宜,不代表整通對話的成本就一定低。
TTS-2 與 TTS-2 Flash 也不是只差價格。完整版支援自然語言聲音指導與更完整的情境表現,Flash 主打延遲和大量使用。需要角色感、情緒與精細演出的產品,我會先測 TTS-2。固定通知、簡短客服與高流量即時回覆,才優先比較 Flash。
哪些產品最適合導入 Realtime TTS-2?
TTS-2 最適合「回應方式會影響任務成敗」的語音產品,而不只是把長文章轉成音檔。
- 客服 Agent:偵測使用者語氣後調整節奏,避免在抱怨或壞消息後仍用過度活潑的聲音。
- AI 陪伴與教練:讓同一個角色在多輪對話中維持聲線與情緒連續性。
- 語言學習:用同一位虛擬老師切換多種語言,示範不同語速、語氣與口音。
- 遊戲與互動故事:依劇情、玩家行為和角色狀態即時改變台詞演出。
- 跨國服務:減少每種語言都建立一套聲音素材與角色設定的維護成本。
相較之下,一般新聞朗讀、批次有聲書或固定通知不一定需要對話感知。這些工作通常更在意長文穩定、發音一致與後製效率,較便宜的 TTS 或 Stable 模式可能已經足夠。功能用得到才有價值,多一層情緒變化也可能多一層不可預測性。
台灣團隊怎麼做最實際的 PoC?
PoC 一開始不用串接完整客服系統。先挑一個情緒差異明顯、答案內容又能固定的情境,例如「訂單延遲說明」或「語言課程糾音」,準備 30 至 50 段繁體中文測試對話,再比較 TTS-2、TTS-2 Flash 與現有供應商。
測試至少要看五個指標:
- 任務合適度:語氣是否符合抱怨、疑問、興奮或疲倦等情境。
- 中文正確性:台灣人名、地址、日期、數字與中英混讀是否自然。
- 端到端延遲:從使用者說完到第一段可聽回應,而不是只看供應商的伺服器數字。
- 穩定性:同一段內容重複生成時,是否出現語調漂移、漏字或多餘聲音。
- 完整成本:把 STT、LLM、TTS、重試與尖峰同時連線一起計算。
語音品質不適合只交給團隊內部投票。若產品面向台灣使用者,測試者應包含不同年齡、性別與常見口音,並採匿名比較,避免品牌名稱影響判斷。高風險流程還要檢查模型是否把同理語氣做成未經授權的承諾。
如果 TTS-2 在中文任務合適度與完成率上明顯較好,即使單價稍高,仍可能值得使用。若主要差異只在展示影片裡比較有戲劇性,實際客服完成率沒有改善,就不必為情緒功能增加供應商與維護成本。
Realtime TTS-2 目前有哪些限制?
第一,排行榜主要反映英語盲測偏好,不能直接代表繁體中文品質。超過 100 種語言的涵蓋範圍很廣,但官方早期文件把大部分新增語言列為實驗支援。台灣使用者最在意的姓名、地名與中英混讀,仍需要獨立驗收。
第二,對話感知目前依賴 Realtime API。只呼叫一般單次 TTS API,不會自動取得前幾輪實際音訊。團隊若只替換模型名稱,可能得到更好的聲音,卻用不到這次最核心的上下文能力。
第三,情緒更豐富不一定更可信。醫療、金融、公共服務與未成年人產品需要保守的聲音策略,也要避免 AI 用親密語氣讓使用者誤以為對方是真人。
第四,Inworld 是雲端專有模型。需要完全自架、特殊資料落地地區,或希望掌握模型權重的團隊,必須另外確認 Enterprise 部署條件,不能把一般 API 方案當成開源模型。
最後,官方網站不同頁面目前仍可看到「100+」與「200+」語言兩種說法,部分技術頁也保留 Research Preview 字樣。這顯示文件正在隨正式版更新。本文採用正式發布文章較保守的「超過 100 種語言」,實際導入時仍應以 API 可選語言與實測結果為準。
常見問題
Realtime TTS-2 可以直接和人對話嗎?
不能單獨完成整段對話。它負責把答案轉成聲音,完整語音 Agent 還需要 STT、LLM、工具與對話流程。使用 Inworld Realtime API 時,可以把這些環節放在同一個持續連線中運作。
Realtime TTS-2 與 TTS-2 Flash 該選哪一個?
重視情緒、角色表演與自然語言聲音指導,先測 TTS-2。重視速度、成本與大量簡短回覆,先測 TTS-2 Flash。最終仍應使用相同腳本、聲線與網路環境比較。
Inworld TTS-2 支援繁體中文嗎?
官方把中文列入語言支援範圍,TTS-2 也主打超過 100 種語言。不過公開排行榜以英語為主,支援不代表已針對台灣口音、姓名與中英混讀完成驗證,因此正式導入前仍需自行測試。
Realtime TTS-2 真的是排行榜第 1 嗎?
截至 2026 年 9 月 3 日,它在 Artificial Analysis 的 Controlled Voice Arena 排名第 1,但在 Provider Voice Arena 排名第 2。比較榜單時要先確認是否控制聲線,以及分數的信賴區間是否重疊。
可以用 Realtime TTS-2 複製任何人的聲音嗎?
技術上可以用短音訊建立聲音複製,但實際使用仍要取得錄音者同意,確認個資、肖像人格權、商業授權與撤回機制。能透過 API 生成,不等於擁有合法使用權。
結語:它值得測試,但不要為「世界第一」直接換供應商
Realtime TTS-2 的進步,不只是聲音更像真人,而是開始把「對方剛才怎麼說」納入「下一句該怎麼說」。對客服、遊戲角色、語言學習與 AI 陪伴產品來說,這比單句音質再提高一點更接近真實需求。
它也確實站上第一梯隊:相同複製聲線的盲測排名第 1,原生聲線榜排名第 2,獨立延遲量測則位於前四名。不過,這些數據共同支持的是「值得認真測試」,不是「所有場景都已經最好」。
如果團隊正在開發即時語音產品,我會把 TTS-2 放進下一輪 PoC,特別測試情緒承接、繁體中文與中英混讀。若只是製作固定旁白,或現有 TTS 已經穩定滿足需求,這次更新還不足以構成全面遷移的理由。
官方貼文中的名次不能替你決定供應商。真正的標準,是使用者能否更快聽到正確、合適,而且不令人出戲的回答。