ElevenLabs Eleven v4 是什麼?v4 Turbo、100ms 延遲、價格與語音複製完整解析

Eleven v4 主打高品質情緒語音,v4 Turbo 把同代能力壓到約 100ms。本文比較 90 多種語言、價格、聲音複製、Flash 與導入風險。

Share
ElevenLabs Eleven v4 官方發布主視覺
ElevenLabs 以彩色聲波質感主視覺發布 Eleven v4 與 v4 Turbo。 圖片來源:https://elevenlabs.io/v4

ElevenLabs 在 2026 年 9 月 28 日推出 Eleven v4 與 Eleven v4 Turbo。兩者都是文字轉語音(Text to Speech,TTS)模型,也就是把文字內容合成為人聲。v4 優先追求音質、情緒與長內容一致性,v4 Turbo 則把同一代的表現力壓到約 100 毫秒的中位推論延遲,主打即時對話。

這次升級真正重要的地方,在於創作者與語音 Agent 不必再完全分開選模型。v4 適合廣告、角色、Podcast 與有聲書,v4 Turbo 適合客服、預約與 AI 助理。不過,如果唯一目標是最低延遲或便宜大量生成,官方文件中的 Flash v2.5 仍可能更合適。

我的判斷是:v4 是 ElevenLabs 目前最值得內容團隊測試的品質模型,v4 Turbo 則是需要情緒表達的即時應用新首選,但它們不是所有情境的無條件升級。本文會比較模型差異、第三方評測、限時價格、聲音複製與導入風險。

0:00
/0:00

ElevenLabs 官方影片介紹 v4 的聲音表現、多人對話、語言、聲音複製與即時應用。 影片來源:ElevenLabs 官方 X。

Eleven v4 與 v4 Turbo 是什麼?

Eleven v4 是 ElevenLabs 新一代高品質語音合成模型。官方把它定位在情緒、聲音一致性與表演控制,支援 90 多種語言、自然多人對話與最多 10,000 個字元的單次輸入。對內容製作者來說,它不只把字念出來,還能讓同一段腳本依角色、節奏與情緒做出不同演出。

Eleven v4 Turbo 使用同一代能力,但優先縮短等待時間。官方文件列出的中位推論延遲約 100ms。推論延遲指模型開始把文字轉成聲音所需的運算時間,不包含使用者網路、應用程式處理、文字模型思考與音訊播放的額外時間。

這個差別決定了使用場景。預先製作廣告、有聲書或角色對白,可以多等一點時間換取表現細節。客服與語音助理卻需要在對方說完後迅速回應,延遲過長會讓對話像輪流播放錄音。

v4、v4 Turbo、v3 與 Flash v2.5 怎麼選?

最容易誤解的是「Turbo 就一定最快」。ElevenLabs 的官方定價頁把 v4 Turbo 稱為即時與 Agent 的最佳模型,延遲約 100ms。同一頁卻列出 Flash / Turbo 舊系列約 75ms。換句話說,v4 Turbo 的優勢是用接近即時的速度保留更多情緒與控制,不是拿下最低延遲數字。表中的 API(讓應用程式呼叫 ElevenLabs 模型的介面)價格,則是開發團隊實際串接服務時的用量費。

模型 官方定位 語言 官方延遲 目前 API 價格 適合情境
Eleven v4 最高品質、情緒與控制 90+ 未列即時延遲 US$0.022/1,000 字元 廣告、角色、有聲書、影片旁白
Eleven v4 Turbo 表現力優先的即時模型 90+ 約 100ms US$0.011/1,000 字元 客服、預約、AI 助理、互動角色
Eleven v3 Conversational 上一代即時情緒模型 70+ 約 280ms US$0.04/1,000 字元 既有 v3 即時應用
Flash / Turbo 速度與成本優先 32 約 75ms US$0.04/1,000 字元 大量生成、延遲極敏感流程

表中的 v4 價格是截至 2026 年 10 月 12 日的 72% 上市優惠。官方列出的原價分別是 v4 每 1,000 字元 US$0.08、v4 Turbo US$0.04,稅金另計。若產品要長期營運,成本試算應使用原價,再把優惠當成測試期折扣。

因此,我不會只看新舊版本名稱決定升級。創作內容先測 v4,語音 Agent 先測 v4 Turbo。若流程只要求快速把大量固定文字念完,Flash v2.5 的 75ms 與既有成本結構仍有價值。

情緒標籤、多人對話與 IPA,改變了什麼?

Eleven v4 允許在文字中加入 inline tags,也就是直接寫在腳本裡的表演指令。創作者可以指定語氣、情緒、速度、停頓、反應、音效與風格,不必只靠標點符號猜模型會怎麼念。

這讓工作流程更接近導演排戲。廣告可要求同一句話先平靜、再提高急迫感。遊戲對白能區分角色與反應,Podcast 或有聲書則能在長內容中維持聲音身分。官方也加入自然多人對話,減少逐句生成再手動拼接的工作。

另一項實用功能是 IPA 支援。IPA 是國際音標,用一套符號指定字詞應該如何發音。品牌名、人名、藥名或跨語言專有詞經常被 TTS 念錯,能指定發音比反覆改拼字更可靠。

這些控制功能讓我對 v4 的內容製作用途偏多,因為它改善的是可重複修改的製作流程,而不只是一次 demo 聽起來自然。若同一組標籤在不同段落、聲音與語言下仍無法保持一致,這個優勢才需要下修。

Eleven v4 真的拿下語音模型第一名嗎?

截至 2026 年 9 月 29 日,Artificial Analysis 的 Provider Voice Arena 把 Eleven v4 排在第一,Elo 分數為 1,319。第二名 Cartesia Sonic 3.6 為 1,276,第三名 Google Gemini 3.8 Flash TTS 為 1,267。

Elo 是由兩兩比較結果算出的相對分數。測試者會聽兩段使用相同文字、相同性別與口音類別生成的聲音,再選出偏好的一段。模型名稱在投票時被隱藏,Provider Voice Arena 會使用各家公開提供的代表聲音。

這項成績支持 v4 的聲音品質競爭力,但不能證明它在每種語言、每個角色與每段長文都最好。排行榜會隨新增投票與模型更新變動,而且英文供應商聲音的偏好,不能直接代替台灣中文、粵語或特定品牌聲線測試。

我的解讀是,1,319 分足以讓 v4 進入採購或升級候選名單,卻不該取代自己的盲測。真正上線前,應用相同腳本、相同聲音與相同音量比較自然度、錯音率、長文一致性與人工重錄比例。

10 秒就能複製聲音,代表什麼?

ElevenLabs 的官方發布貼文表示,Eleven v4 的 Instant Voice Clone 可以從 10 秒音訊捕捉聲音特徵。Instant Voice Cloning 是即時聲音複製:系統不為每個人重新訓練完整模型,而是用短音訊作為條件,生成接近該說話者的新內容。

「10 秒可用」只說明最低條件,不代表 10 秒就是最佳做法。ElevenLabs 的聲音複製指南仍建議準備約 1 至 2 分鐘乾淨、單一說話者、沒有回音與背景噪音的錄音。樣本太短或錄音不一致,容易把雜音、說話速度與偶發語氣一起複製,長內容的穩定度也可能下降。

聲音複製還有權利問題。建立 Instant Voice Clone 時,使用者必須確認自己有權利與同意使用該聲音。能從短片段建立相似聲線,只代表技術門檻下降,不代表可以擷取名人、客戶、員工或配音員的公開錄音任意使用。

對品牌與媒體團隊,我會把 10 秒功能視為快速原型工具。正式商用仍應取得書面授權、保存原始錄音與用途範圍,並讓真人確認最終台詞。若產品無法證明同意來源,再像真的聲音也不值得上線。

ElevenLabs Eleven v4 聲音複製官方產品視覺
Eleven v4 強調從短音訊保留說話者聲線,但正式使用仍應準備乾淨錄音並取得聲音授權。 圖片來源:ElevenLabs 官方。

價格降到每百萬字元 US$11,真的比較便宜嗎?

ElevenLabs API 在上市期間把 v4 降為每 1,000 字元 US$0.022,換算每 100 萬字元 US$22。v4 Turbo 為 US$0.011,換算每 100 萬字元 US$11。官方定價頁標示優惠到 2026 年 10 月 12 日,約為原價的 28%。

這個價格對試用很有吸引力,尤其 v4 Turbo 的優惠價低於 Flash / Turbo 目前每 1,000 字元 US$0.04 的標價。不過,v4 與 v4 Turbo 的原價仍分別是每 100 萬字元 US$80 與 US$40。若把限時價直接放進全年財務模型,優惠結束後成本可能突然增加。

官方另為 Creator 以上方案提供兩週 v4 點數優惠,最多有相當於每月 TTS 額度兩倍的 v4 使用量不扣點數,但只適用網頁與手機 App。這和 API 的美元計價不是同一活動,團隊不應把 App 點數當成正式服務的 API 成本。

對開發者而言,正確做法是同時記錄每段輸入字元、生成失敗重試、實際音訊分鐘數與人工修正時間。單價變便宜,若錯音或情緒不穩定造成多次重生,整體製作成本仍可能上升。

哪些人適合升級,哪些人先不要換?

內容創作者、廣告團隊與遊戲工作室最適合先測 Eleven v4。它的價值來自情緒標籤、多人對話、發音控制與長內容聲音一致性。這些功能若能減少導演溝通、剪接與重錄次數,效益會比單看每千字價格更大。

客服、預約、銷售與互動角色可優先測 v4 Turbo。約 100ms 的模型推論延遲,比 v3 Conversational 的約 280ms 明顯縮短,又保留 v4 的語氣控制。不過,完整語音 Agent 還包含語音辨識、語言模型、工具呼叫與網路時間,不能把 100ms 當成使用者說完後 0.1 秒就聽到完整回答。

大量固定旁白、無須豐富情緒或對延遲極敏感的流程,不必急著離開 Flash v2.5。已經穩定運作的 v2 或 v3 系統也應先做並排測試,確認聲音、標籤、API、字數限制與成本,再決定是否切換模型 ID。

我的選擇很直接:高品質內容選 v4,需要自然即時對話選 v4 Turbo,只求低延遲與大量生成則保留 Flash。這個結論會在 v4 Turbo 的實際端到端延遲高於既有模型,或中文錯音與長文一致性沒有改善時改變。

FAQ

ElevenLabs Eleven v4 什麼時候推出?

ElevenLabs 在 2026 年 9 月 28 日發布 Eleven v4 與 Eleven v4 Turbo,兩者已透過 ElevenCreative、ElevenAgents 與 ElevenAPI 提供。

Eleven v4 與 v4 Turbo 最大差別是什麼?

Eleven v4 優先追求最高品質、情緒表達與內容控制,適合預先製作的語音內容。v4 Turbo 把同一代能力調整為約 100ms 的中位推論延遲,更適合客服、AI 助理與互動角色。

v4 Turbo 是 ElevenLabs 最快模型嗎?

若只看官方標示的模型延遲,不是。v4 Turbo 約 100ms,Flash / Turbo 舊系列約 75ms。v4 Turbo 的賣點是即時速度加上更高表現力,而不是最低延遲數字。

Eleven v4 支援中文嗎?

支援。官方語言清單包含 Mandarin Chinese 與 Cantonese,整個 v4 家族支援 90 多種語言。實際中文口音、專有名詞與台灣用語仍應用自己的腳本測試。

Eleven v4 API 價格是多少?

到 2026 年 10 月 12 日,v4 為每 1,000 字元 US$0.022,v4 Turbo 為 US$0.011。官方列出的原價分別是 US$0.08 與 US$0.04,價格不含稅。

只要 10 秒就能複製聲音嗎?

官方發布資料表示 Instant Voice Clone 可從 10 秒音訊建立聲音特徵,但官方指南仍建議使用約 1 至 2 分鐘乾淨、單一說話者的錄音,品質與一致性通常更可靠。使用他人聲音前也必須取得權利與同意。

結語:v4 的重點是更容易控制聲音

Eleven v4 把高品質語音、90 多種語言、情緒標籤、多人對話、發音控制與聲音複製放進同一套內容模型。v4 Turbo 再把這些能力推向即時應用。這使 ElevenLabs 不再只用「自然度」競爭,也開始處理創作流程與語音 Agent 最在意的可控性。

我對 v4 的內容製作價值偏多,也認為 v4 Turbo 值得即時產品測試,但不會把官方的 100ms、10 秒複製與排行榜第一名直接當成上線證明。最有用的評估方式,是拿真實中文腳本做盲測,記錄端到端延遲、錯音、重生次數、長文一致性與授權流程。

如果 v4 能在這些實際指標上減少重錄與等待,它就是工作流程升級。若只有 demo 更有情緒,卻增加修正成本,那仍只是漂亮的新模型。

資料來源