Freya Adam、Eve AI 語音是什麼?Adam 登上真實感榜首,但「跨越恐怖谷」還少幾張成績單
Freya 發表 Adam 與 Eve AI 語音,Adam 登上英文語音真實感榜首。本文拆解榜單能證明什麼、不能證明什麼,以及是否值得導入。
很多 AI 語音單獨聽很自然,一進入對話卻會露出破綻。停頓太整齊、情緒像預先套好的濾鏡,或每句話都像廣告旁白,都是常見的「機器味」。
語音 AI 新創 Freya Voice 在 2026 年 9 月 21 日發表 Adam 與 Eve,稱它們是公司做過最接近真人的 AI 聲音。共同創辦人 Tunga Bayrak 還進一步表示,Adam 已在 Design Arena 的 Audio Realism Benchmark 排名所有 AI 模型第一,Freya 相信自己跨越了 AI 語音的恐怖谷。
這項成績不是空口宣傳。公開榜單確實把 Adam 排在 AI 模型第一名,只落後真人錄音。然而,這張榜單回答的是「固定英文句子聽起來像不像真人」,不會告訴我們模型回話有多快、內容是否正確、繁體中文是否自然,也不能替尚未上榜的 Eve 證明品質。
我的判斷是:Adam 已經拿出足以進入產品測試名單的證據,但還不足以宣告所有語音場景都跨越恐怖谷。對英文客服、教學或 Podcast 類產品來說,它值得做一輪小規模概念驗證。要全面更換供應商,則應等價格、延遲、多語言與真實任務數據更完整。
Today we’re releasing Adam and Eve, the most human-like AI voices ever built.
— Tunga Bayrak (@TungaBayrak) September 21, 2026
Adam ranks #1 among AI models on @DesignArena’s AudioRealismBench.
We believe we’ve crossed the uncanny valley. API access on our Website!
Listen: freyavoice.ai
Leaderboard: designarena.ai/leaderboard/audiorealismbench
Freya 共同創辦人 Tunga Bayrak 發表 Adam 與 Eve 的官方示範影片。影片來源:官方 X 原貼文;採平台原貼文嵌入,不重新託管影片。
Freya Adam、Eve 是什麼?
Adam 與 Eve 是 Freya 新推出的兩款英文文字轉語音聲音。文字轉語音的英文縮寫是 TTS,作用是把一段文字合成為可播放的聲音。開發者可以透過 API,也就是讓自己的軟體呼叫外部模型的介面,把 AI 回答、客服腳本或教學內容轉成語音。
Freya 的新品頁面顯示,Adam 與 Eve 目前共用一套 API,存取資格採分批開放,使用者要先填表申請。官網尚未列出這兩款聲音的公開單價,也沒有公布首段音訊延遲、支援地區、同時連線數或服務等級承諾。換句話說,這次比較像正式亮相與早期開放,不是所有人都能立刻刷卡、取得金鑰並完成部署的自助式產品。

Freya 本身也不只做聲音生成。這家入選 Y Combinator 2025 年夏季梯次的新創,原本主打銀行、保險、金融科技與企業客服使用的 Voice Agent。Voice Agent 是能聽懂來電、產生回答,再把回答說出來的語音代理。完整系統通常還需要語音辨識、語言模型、企業資料與工作流程,TTS 只負責最後的「怎麼說」。
這個分工很重要。聲音像真人,不代表 AI 查到正確帳單,也不代表它會遵守退費規則。Adam 與 Eve 改善的是語音呈現層,不能單獨取代一套完整客服系統。
另外,Adam、Eve 不應與 Freya 先前公開的 FreyaTTS-small 混為一談。FreyaTTS-small 是針對土耳其語、採 Apache 2.0 授權的開源研究模型。這次新品則是透過申請制 API 提供的英文聲音。兩者用途、語言與開放方式都不同。
Adam 的第一名怎麼來的?
Adam 的榜首來自 Design Arena 的 Audio Realism Benchmark。這套評測不要求聽眾替聲音打 1 到 5 分,而是每次播放兩段念同一句話的音檔,請聽眾選出哪一段更像真人。模型名稱會被隱藏,左右順序也會隨機,減少品牌印象與位置造成的偏差。
所有勝負再透過 Bradley-Terry 模型換算成 Elo 分數。白話來說,Elo 是根據多次兩兩對決算出的相對排名,分數較高代表它在這批比較中更常被選為「比較像真人」,不是聲音品質的絕對百分比。
截至 2026 年 9 月 22 日查詢,Design Arena 公開 API顯示榜單資料最後更新於 9 月 18 日。當時的前幾名如下:
| 名次 | 聲音/模型 | Elo | 勝率欄位 | 比較次數 |
|---|---|---|---|---|
| 1 | 真人錄音 | 1463 | 84.9% | 943 |
| 2 | Freya TTS Adam V1 | 1418 | 77.7% | 314 |
| 3 | Bland Speech v3 | 1369 | 77.7% | 573 |
| 4 | Kalpa TTS Beta V0.1 | 1343 | 71.8% | 471 |
| 5 | Cartesia Sonic 3.6 | 1306 | 64.5% | 152 |
表中的 77.7% 是榜單 API 提供的整體勝率欄位,不能解讀成「Adam 有 77.7% 的機率騙過真人」。Design Arena 另外設計了真人錄音作為基準,但要回答模型與真人直接對決的勝率,仍需要相應的分項資料,不能拿總勝率代替。

就現有數據來看,最合理的結論是 Adam 位於這套英文盲聽測試的 AI 第一名,而且與真人仍有 45 分差距。Freya 官網在 9 月 16 日量測時列出 Adam 1419 分、真人 1462 分,與之後公開 API 的 1418、1463 略有差異。這不是矛盾,而是 Elo 會隨新增比較結果變動,也提醒讀者不要把當日名次視為永久頭銜。
Audio Realism Benchmark 實際測了什麼?
這套評測比只用一段精心挑選的官方展示更可靠,因為它使用 500 段不公開的英文測試句,並加入真人錄音一起比較。聽眾是經過篩選的英語母語者,每個模型固定選一個男性與一個女性的美式英語聲音,同性別配對,避免聲線性別成為主要差異。
測試內容分成三類:客服或預約電話、Podcast 與訪談式對談,以及教學或解說。句子會保留猶豫、重說與填充詞,難度也不完全相同。這些設計比「請念一段乾淨旁白」更接近日常說話。
但 Design Arena 的方法文件也清楚畫出邊界。表演性強的遊戲角色、戲劇台詞與陪伴型角色不在這版評測範圍內。測試集中在美式英語,也沒有衡量回應速度、長文一致性、打斷後恢復、價格或服務穩定性。
公開分項榜還暴露了另一個限制。Adam 目前可在總榜與 Explainers 解說類別中看到,但 Phone Agents 與 Conversations 分項沒有列出 Adam。這可能只是評測覆蓋尚未完成,卻也表示我們不能因總榜第一,就直接宣稱它已在電話客服與自然對談都打敗所有對手。
因此,榜單強力支持「Adam 的英文聲音真實感很有競爭力」。它不支持「Adam 是功能最完整的語音模型」,更不支持「Freya 的整套 Voice Agent 已經第一」。
為什麼「跨越恐怖谷」仍然是有條件的宣稱?
恐怖谷原本用來描述人形角色的外觀與動作:當它越來越像人,卻仍留下一些不自然細節時,觀眾反而會更不舒服。放到 AI 語音,這些破綻可能是過度乾淨的呼吸、情緒突然切換、重音位置奇怪,或在長對話中逐漸失去原本聲線。
Adam 在盲聽中接近真人,表示它已經大幅減少單段英文語音的機器感。可是「跨越恐怖谷」若要成為完整產品結論,至少還缺四張成績單。
第一是 Eve。Freya 同時發表 Adam 與 Eve,但公開榜單只有 Adam 條目。Adam 的分數不能自動延伸到 Eve。
第二是不同語言與口音。現有測試鎖定美式英語,無法回答繁體中文、台灣口音、中英混讀、人名與地址是否自然。本次新品頁也只把 Adam、Eve 標為英文聲音。
第三是完整對話。使用者感受到的不是一段孤立音檔,而是「我說完後多久收到正確回答、能不能插話、AI 是否接得住情緒」。這些都不在真實感榜單裡。
第四是長時間穩定性。15 秒內聽起來像真人,不代表 30 分鐘 Podcast、有聲書或客服通話都不會出現音色漂移、錯讀與不合理停頓。
所以我的立場是中性偏多。Adam 已經越過「只靠官方精選範例」的門檻,拿到第三方盲聽榜首,值得認真對待。Freya 把這項成績寫成「最像真人」可以理解,但要擴張成所有場景都跨越恐怖谷就太早。
哪些團隊值得測試 Adam、Eve?
目前最適合申請的是「聲音自然度會直接影響任務完成」的英文產品團隊。只想找便宜旁白的使用者,反而不一定需要它。
- 英文客服與預約系統:自然的停頓與語氣能降低使用者一聽就掛斷的機會,但仍要另外驗證來電延遲與打斷處理。
- AI 教師與解說產品:Adam 在 Explainers 分項有公開成績,這是現有證據最直接支持的用途。
- Podcast、訪談與內容旁白:可以測試長段落是否仍維持自然節奏,不過公開榜單尚未提供 Adam 的對談分項成績。
- 遊戲與 AI 陪伴:自然度有吸引力,但現行基準明確排除重表演場景,不能只憑榜單決定。
相較之下,繁體中文產品、需要立即自助開通的個人創作者,以及必須先確定固定單價的團隊,現在不必急著遷移。Freya 的企業方案採客製報價,價格會受通話量、部署方式、整合工作與工程支援影響。Adam、Eve 的新品頁也尚未公布獨立費率。
對金融、保險與其他受監管產業,Freya 提供在地雲端與客戶機房部署的選項。客戶機房部署也稱為 on-prem,意思是模型與通話資料在企業自己的伺服器上運作。這可能比單純追求榜首更重要,因為錄音、逐字稿與個資放在哪裡,會直接影響採購與合規決策。
導入前,應該怎麼做一輪公平的 PoC?
PoC 是概念驗證,也就是先用小範圍測試判斷產品是否值得正式導入。語音模型不適合只播放三段官方示範,再由內部同事投票。比較公平的做法,是準備 50 至 100 段來自真實產品情境、已移除個資的英文腳本,讓 Adam、Eve 與現有供應商念同一批內容。
測試時至少要分開看六個指標:
- 真人感:採匿名成對比較,確認使用者覺得哪一段更自然。
- 任務合適度:聲音是否符合道歉、提醒、解說與確認等不同目的。
- 正確性:姓名、金額、日期、網址與縮寫有沒有讀錯。
- 端到端延遲:從系統收到文字到使用者實際聽見第一段聲音要多久。
- 穩定性:重複生成、尖峰流量與長對話時是否出現漏字、音色漂移或中斷。
- 完整成本:把 TTS、語音辨識、語言模型、電話線路與失敗重試一起計算。
若要做繁體中文產品,還應加入台灣人名、路名、日期、金額與中英夾雜。Adam、Eve 目前標示為英文聲音,若產品需要中文,測試目標應先改成確認「是否可用」,而不是直接比較「是否第一」。
我會把通過條件定得很務實:只有當自然度提高的同時,任務完成率沒有下降,延遲與成本也落在可接受範圍,才進入下一階段。若差異只在精選音檔中聽得出來,卻沒有改善真實通話結果,就不值得為了榜首更換供應商。
聲音越像真人,產品越需要清楚揭露
擬真語音可以讓客服、無障礙工具與教育產品更好用,也會降低冒充他人的門檻。美國聯邦貿易委員會提醒,詐騙者能從公開內容取得短音檔,再用聲音複製工具冒充親友。對產品團隊來說,風險不只來自模型能不能複製特定人物,也來自使用者是否誤以為電話另一端是真人。
因此,語音產品至少應做到三件事:在適當時機揭露是 AI、禁止未經授權的聲音模仿,並保留生成與通話紀錄供稽核。涉及匯款、身份驗證、醫療或法律決定時,還要加上人工覆核與第二種身份確認方式。
這不是替創新踩煞車。當聲音自然度已高到能與真人競爭,建立信任機制本來就是產品能力的一部分。只追求「聽不出來」,卻沒有回答「使用者有沒有權利知道」,會把技術優勢變成品牌風險。
常見問題
Freya Adam、Eve 可以直接使用嗎?
目前可以申請 API 存取,但 Freya 採分批開放,不是立即自助開通。申請頁要求姓名、電子郵件,公司名稱則可選填。
Adam 真的是目前最像真人的 AI 語音嗎?
在 Design Arena Audio Realism Benchmark 於 2026 年 9 月 18 日更新的總榜中,Adam 是排名最高的 AI 模型,只落後真人錄音。這個結論只適用於該榜單的美式英語盲聽條件,不代表所有語言、速度、價格與應用場景都第一。
Eve 也有排名第一嗎?
目前公開榜單沒有 Eve 的獨立條目,因此不能說 Eve 也排名第一。Freya 發表了兩款聲音,但公開評測證據只直接支持 Adam。
Audio Realism Benchmark 的 77.7% 代表 Adam 騙過真人的機率嗎?
不是。77.7% 是公開 API 顯示的整體勝率欄位,包含模型在多次兩兩比較中的結果,不能直接當作對真人的勝率。要回答真人與 Adam 的直接比較,需要相同口徑的對戰資料。
Adam、Eve 支援繁體中文嗎?
新品頁把兩款聲音標為英文聲音,沒有公布繁體中文品質。需要中文的團隊應等待官方支援資訊,或在取得存取資格後用台灣情境自行驗證,不能從英文榜單外推。
Freya Adam、Eve 價格多少?
截至 2026 年 9 月 22 日,新品頁沒有公開獨立費率。Freya 的企業方案依通話量、雲端或客戶機房部署、整合工作與工程支援客製報價。
結語:Adam 值得進入測試名單,但一張榜單還不是終點
Freya 這次最有價值的成果,是 Adam 已在有真人基準、採匿名兩兩比較的英文測試中,站上所有 AI 模型前面。這比「史上最像真人」的口號更有說服力。對一家 2025 年成立的語音 AI 新創來說,這足以讓市場重新檢查競爭名單。
可是產品採購不能只看一條總榜。Eve 沒有獨立排名,Adam 的電話客服與對談分項資料仍不完整,價格、延遲、多語言與長時間穩定性也尚未公開到足以比較。現有證據能支持的結論是:Freya 已證明 Adam 很會「把一段英文說得像人」,還沒證明 Adam 與 Eve 能在每一種真實產品裡都「像人一樣可靠地完成工作」。
如果正在開發英文語音客服、教學或內容產品,我會申請 Adam、Eve,拿自家腳本做匿名 PoC。若主要服務繁體中文使用者,或團隊需要透明價格與立即開通,現在更合理的選擇是先觀察,而不是為了榜首全面遷移。
AI 聲音真正跨越恐怖谷的標準,不只是使用者一時聽不出來。它還要在長對話裡說對內容、維持聲線、及時回應,並讓人清楚知道自己正在和 AI 互動。