PhoneLLM 是什麼?語音 AI 專用開源模型,效能接近 GPT-5.6 Terra、延遲更低
PhoneLLM Alpha 1 專為電話客服與即時語音 Agent 訓練,在 PhoneBench 任務中接近 GPT-5.6 Terra,同時縮短延遲並降低模型推論成本。
打電話給客服時,最讓人出戲的通常不是聲音不夠自然,而是每說完一句話,都要等 AI 停頓兩三秒才回答。
這也是語音 AI 比文字聊天更難做的地方。聊天視窗慢一點,使用者可能願意等;電話裡只要出現一段不自然的空白,多數人就會以為系統沒聽見,開始重複說話,甚至直接掛斷。
Pipecat 團隊在 2026 年 8 月 27 日推出 PhoneLLM Alpha 1,試圖解決這個問題。它不是追求回答所有問題的通用模型,而是專門處理電話客服、預約、查詢與工具操作等語音 Agent 任務。
官方公布的 PhoneBench 測試顯示,PhoneLLM 的任務分數接近 GPT-5.6 Terra,但回應速度更快,推論成本也更低。真正重要的訊號,不是小模型已經全面追上頂尖模型,而是企業開始能用「針對單一工作訓練的模型」,取代部分昂貴的通用 AI。
PhoneLLM 是什麼?
PhoneLLM Alpha 1 是 Daily/Pipecat 團隊開發的開放權重語言模型,主要服務即時語音 Agent。所謂開放權重,是開發者可以取得模型參數,部署在自己的雲端或伺服器,不必把所有對話送到第三方模型的 API。API 是讓不同軟體互相傳送請求與結果的介面,許多企業目前都是透過這種方式使用外部 AI 模型。
它以 NVIDIA 的 Nemotron 3 Nano 30B-A3B 為基礎,進行完整參數微調。模型總共有約 300 億個參數,但每次推論只會啟用其中約 35 億個。這種混合專家模型(Mixture of Experts,MoE)會依照任務選擇部分參數運算,目的就是在保留能力的同時,提高速度並降低成本。
PhoneLLM 目前以英文為主,建議關閉 thinking、把 temperature 設為 0。換句話說,它不是靠較長的思考過程解題,而是被訓練成在收到語音內容後,快速做出適合客服情境的回覆或工具操作。
Pipecat 創作者 Kwindla Hultman Kramer 介紹 PhoneLLM Alpha 1 的訓練目標、工具呼叫與延遲測試。 影片來源:PhoneLLM 官方 X 發布貼文。
為什麼語音 Agent 不一定需要最強的通用模型?
文字 AI 常把「多想一下」當成優點,但在電話裡,思考時間會直接變成沉默。
一套語音 Agent 通常要先把語音轉成文字,再交給 LLM 判斷,最後用文字轉語音模型說出答案。網路傳輸、語音辨識、商業邏輯與語音合成都會占用時間,留給 LLM 的延遲空間其實不多。Pipecat 將理想的 LLM 首字回應目標設在約 650 毫秒,整段語音來回則希望控制在約 1.5 秒內。
但速度快還不夠。客服 AI 經常要呼叫外部工具,例如查詢訂單、驗證身分、修改預約或轉接真人。工具呼叫(tool calling)就是模型依照對話內容,選擇正確系統功能並填入正確參數。
如果模型只回答「已經替你完成預約」,實際上卻沒有呼叫訂位系統,這不是語氣不自然,而是流程直接出錯。因此,PhoneLLM 的產品定位很清楚:犧牲不必要的通用推理能力,換取語音客服最需要的低延遲、簡短回覆與可靠工具操作。
PhoneBench 測試結果:接近 GPT-5.6 Terra,但不能解讀成全面超越
Pipecat 同步發布 PhoneBench Alpha 1,測試 15 款模型在多輪電話客服情境中的表現。評分項目不只包含答案正確性,也涵蓋電話用語、工具呼叫、說法與實際動作是否一致、事實依據、身分驗證、轉接規則與最終問題是否解決。
| 模型 | PhoneBench 分數 | P95 首個答案 token 延遲 | 官方估算 LLM 成本/分鐘 |
|---|---|---|---|
| Gemini 3.6 Flash | 78.6% | 1,468 ms | US$0.0751 |
| GPT-5.6 Terra | 72.4% | 1,957 ms | US$0.0347 |
| PhoneLLM Alpha 1 | 72.3% | 約 600 ms | US$0.0025 |
| GPT-5.6 Luna | 70.7% | 1,736 ms | US$0.0035 |
| Nemotron 3 Nano 30B 基礎模型 | 28.6% | 約 600 ms | US$0.0025 |
PhoneLLM 與 GPT-5.6 Terra 的分數只差 0.1 個百分點,而 P95 首個答案 token 約快 1.3 秒。P95 代表 95% 的測試請求都能在該時間內開始產生答案,比平均值更能反映使用者遇到慢回應的機率。

另一個值得注意的比較,是 PhoneLLM 與原始 Nemotron 3 Nano 使用相同架構與推論成本,分數卻從 28.6% 提升到 72.3%。這說明這次進步主要來自針對任務的資料與訓練,而不是單純把模型做得更大。

不過,這些結果只適用於 PhoneBench 所設計的電話客服工作,不能延伸成 PhoneLLM 在寫程式、研究、數學或一般知識上也等同 GPT-5.6 Terra。PhoneBench 由 PhoneLLM 的開發團隊推出,主要採用經人工標籤校準的 LLM 評審,而且完整測試工具與方法仍未公開。現階段比較合理的解讀是:PhoneLLM 已經展現很強的產品潛力,但仍需要企業用自己的通話資料重新驗證。
每分鐘成本很低,但官方數字目前有一處矛盾
PhoneBench 表格與原始 X 貼文都把 PhoneLLM 的 LLM 成本列為每分鐘約 US$0.0025,大約是 GPT-5.6 Terra 的十八分之一。這個估算建立在 NVIDIA B200、特定併發量、約 70% 使用率與 Modal 最佳化環境上,不等於每家公司實際支付的帳單。
而且官方資料本身出現一處需要修正的落差:Daily 公告內文以每分鐘 US$0.2232 的 GPU 成本除以 88 個 Agent,計算結果是 US$0.00025;PhoneBench 表格與發布貼文則寫成 US$0.0025,兩者相差 10 倍。因此,在官方釐清前,較保守的做法是引用表格的 US$0.0025,同時把它視為特定負載條件下的模型推論估算,而不是已確認的固定價格。
實際建置語音客服時,還要加上語音轉文字(STT)、文字轉語音(TTS)、電話線路、雲端服務、監控與低使用率造成的閒置成本。若通話量不夠穩定,自行部署即使單位推論便宜,總成本也未必會比直接使用 API 更低。
PhoneLLM 適合哪些產品?
PhoneLLM 最適合目標明確、流程可定義,而且需要大量即時回應的電話任務,例如:
- 餐廳、飯店與診所的預約或改期。
- 零售、電商與金融服務的訂單或帳務查詢。
- 客服中心的身分驗證、資料蒐集與真人轉接。
- 外撥提醒、滿意度調查或固定流程通知。
這些任務的共同點,是成功標準可以被明確定義。模型不必寫一篇深度報告,只要正確理解需求、取得必要資料、呼叫工具並給出簡短答案。
對企業來說,開放權重也帶來資料治理上的彈性。團隊可以把模型部署在自己的環境,控制對話資料流向,並針對內部流程持續微調。但這同時代表企業必須自行處理 GPU、模型服務、監控、更新與資安,維護成本不會憑空消失。
現階段有哪些限制?
第一,PhoneLLM 仍是 Alpha 1,不宜直接把官方測試分數當成正式上線保證。企業需要用自己的口音、雜訊、產品名稱、工具格式與例外流程測試,尤其是金融與醫療等高風險場景。
第二,模型卡目前列出的主要語言是英文。對繁體中文客服來說,能否正確理解台灣口音、中文姓名、地址、日期與中英混用內容,仍缺乏公開證據。若產品服務台灣市場,這會是上線前最重要的驗收項目之一。
第三,PhoneLLM 是語言模型,不是完整的語音模型。它仍需要搭配 STT、TTS、通話傳輸與 Agent 框架。任何一層延遲或辨識錯誤,都可能讓最終體驗達不到官方數據。
第四,模型可以自行部署,不代表一般電腦就能輕鬆運行。官方效能數據來自 NVIDIA B200 與特別調校的推論環境。團隊若改用其他 GPU 或較低併發量,延遲與單位成本都會改變。
PhoneLLM 怎麼開始使用?
模型權重已放上 Hugging Face,官方建議用 vLLM 或 SGLang 提供模型服務,也能透過 Modal Auto Endpoints 建立部署。Modal CLI 的啟動指令如下:
modal endpoint create --model pipecat-ai/phonellm-alpha-1
推論時要把 temperature 設為 0,並關閉 thinking,因為這才符合模型的訓練方式。開發者也可以透過 Pipecat,把 PhoneLLM 接上語音辨識、語音合成、WebRTC、SIP 或一般電話網路。
若要做 MVP,最實際的方式不是立刻取代整間客服中心,而是先挑一個高頻、低風險、成功條件清楚的流程。例如先做「查詢預約+修改時間」,用真實但去識別化的對話建立測試集,再比較完成率、工具呼叫正確率、P95 延遲、轉真人比例與每通成本。
常見問題
PhoneLLM 是語音生成模型嗎?
不是。PhoneLLM 負責理解對話、決定回覆與呼叫工具,本身不直接把聲音轉成文字,也不負責合成語音。完整系統仍要搭配 STT 與 TTS。
PhoneLLM 真的和 GPT-5.6 Terra 一樣強嗎?
只能說兩者在 PhoneBench 的特定電話客服任務中分數接近。這不代表 PhoneLLM 在一般問答、程式開發、長篇研究或複雜推理上也有相同能力。
PhoneLLM 可以商用嗎?
官方將 PhoneLLM 的修改部分以 BSD 2-Clause 授權釋出,並表示可商用。不過它衍生自 NVIDIA Nemotron,重新散布模型或衍生版本時,仍要保留 NVIDIA 授權與著作權聲明。
台灣團隊現在值得導入嗎?
適合進入 PoC,不適合只看榜單就直接全面上線。台灣團隊應先驗證繁體中文、台灣口音、電話雜訊與內部工具呼叫,再決定是否投入自架基礎設施。
結語:PhoneLLM 的價值,不是取代所有大模型
PhoneLLM 最值得關注的地方,是它把語音 AI 的競爭標準拉回真實產品:回答夠不夠快、工具有沒有真的執行、每分鐘成本能不能支撐大量通話。
它目前還不能證明小模型已經全面取代大型通用模型,官方成本資料也有待統一。但在任務明確的電話客服場景中,PhoneLLM 已經示範一條更實際的路線:不要求一個模型什麼都會,而是讓它把一件高頻工作做得更快、更便宜,也更容易部署在企業自己的環境。
對正在開發語音 Agent 的團隊而言,這值得測試;對一般企業而言,現在最合理的決策仍是小範圍 PoC,而不是因為一張排行榜就更換整套客服系統。