字節跳動 SeedRealtime 推出 Seeduplex:AI 能邊聽邊說,全雙工語音模型有何不同?

Seeduplex 讓 AI 在說話時繼續聽,判斷該等待、接話或停止。一次看懂 SeedRealtime 的全雙工語音能力、官方數據與現階段限制。

Share
字節跳動 Seeduplex 在英文面試中等待使用者思考的官方示範畫面
Seeduplex 會綜合語音與語意判斷使用者是在思考,還是已經說完。圖片截自字節跳動 Seed 官方示範影片。

AI 語音通話最讓人出戲的,通常不是聲音不夠像真人,而是它不知道什麼時候該閉嘴。

你稍微停頓,它以為你說完了,立刻搶話。你想中途補充,它還在繼續播報;旁邊有人說話,系統甚至可能把那段對話當成新指令。這些問題背後都指向同一件事:模型不只要聽懂內容,還要即時判斷一段對話現在輪到誰說。

字節跳動 Seed 在 2026 年 4 月 9 日發布原生全雙工語音大模型 Seeduplex,目前官方把它列在 SeedRealtime 產品線下,並已全量導入豆包 App。它最重要的進展,不是增加另一種 AI 音色,而是讓模型在說話時繼續聽,根據聲音、語意與前後文決定要等待、接話,還是被使用者打斷後立即停下。

不過,這不是一個已經能「邊看、邊聽、邊說」的音視頻模型。官方目前描述的是語音與文字模態,視覺輸入仍被列為後續發展方向。若把它寫成原生音視頻全雙工模型,會超出這次發布的實際範圍。

Seeduplex 是什麼?SeedRealtime、Seeduplex 名稱有何關係?

Seeduplex 是字節跳動 Seed 團隊推出的原生全雙工語音大模型,也是先前「豆包即時語音大模型」的升級版本。官方網站目前使用 SeedRealtime 作為產品入口,模型發布文章與豆包功能則使用 Seeduplex 這個名稱。

「全雙工(Full-Duplex)」指的是兩端可以同時傳送與接收聲音。人類講電話就是全雙工:即使對方正在說話,我們仍能聽見內容,也可以用「嗯」、「等一下」或直接插話改變對話方向。

傳統半雙工 AI 比較像輪流使用同一支麥克風。系統先收完使用者的聲音,再開始生成回答;一旦進入播報階段,持續理解新聲音的能力通常有限。這種設計比較容易控制,卻也讓語音互動變成僵硬的一問一答。

Seeduplex 改變的是對話控制權。模型在回答時仍持續接收音訊,並根據目前的聲學環境與對話內容,在三種狀態之間切換:繼續聽、開始回答,或停止回答並回到聆聽。這才是「邊聽邊說」對使用者體驗真正有意義的地方。

為什麼全雙工不只是「同時開著麥克風」?

讓麥克風一直收音並不困難,難的是模型要知道哪些聲音值得回應。

假設你在車內詢問路線,導航也正在播報,乘客又在聊天。系統如果只看音量或有沒有人聲,就可能被導航聲打斷,或把乘客的對話誤認為指令。Seeduplex 的做法是把聲音特徵、語意與對話上下文一起處理,判斷誰正在對 AI 說話,以及背景內容是否與目前話題有關。

在導航與車內播報混雜時,Seeduplex 嘗試辨識主要使用者的需求。影片來源:字節跳動 Seed 官方。

官方資料顯示,在複雜聲學環境中,Seeduplex 相較豆包先前的半雙工模型,誤回覆率與誤打斷率降低一半。這項數字的價值不只是模型「聽得更準」,而是使用者不必為了配合 AI,刻意跑到安靜空間或把每句話說得像語音指令。

動態判停:AI 終於比較知道你是在思考,還是已經說完

即時語音最難處理的時刻,往往是沉默。

「我覺得這個方案……可能要先看預算。」中間那一段停頓,可能只是使用者在組織語句,也可能代表發言結束。傳統系統常依賴語音活動檢測(Voice Activity Detection,VAD),也就是根據一段時間內有沒有聲音來切割句子。只靠靜音長度,很容易在使用者猶豫時過早接話。

Seeduplex 加入語意與上下文判斷。當使用者在面試練習中卡住、修正前面的說法,模型可以繼續等待;當問題已經完整,它則縮短空白時間並開始回答。字節跳動把這種能力稱為「動態判停」。

官方示範使用者卡住或停頓時,模型如何繼續等待,不急著搶話。影片來源:字節跳動 Seed 官方。

依官方評測,相較先前半雙工版本,Seeduplex 的 AI 搶話比例相對下降 40%,判停延遲縮短約 250 ms。兩個指標必須一起看:只追求低延遲,模型容易搶話;只追求不打斷,回覆又會慢半拍。動態判停要解決的,就是在「耐心」與「反應速度」之間做即時選擇。

從接話到停話:使用者打斷 AI 後,模型能否真的收聲?

自然對話不只需要判斷何時開始回答,也要知道何時停止。

當 AI 正在說明一個步驟,使用者突然說「等一下,我拿筆記一下」,理想狀態不是系統辨識到這句話後,仍把原本回答播完,而是立即停止輸出並保留前面的對話進度。Seeduplex 會持續接收使用者端音訊,識別打斷意圖後平滑停下,再回到聆聽狀態。

使用者說「等一下」後,模型停止輸出並返回聆聽狀態。影片來源:字節跳動 Seed 官方。

字節跳動表示,Seeduplex 的打斷回應延遲比先前模型縮短約 300 ms。幾百毫秒看似不多,但語音互動對時間差很敏感。按鈕慢半秒,使用者可能只覺得介面卡了一下;對話慢半秒,卻會直接變成搶話、重複說明或兩邊同時開口。

Seeduplex 怎麼做到邊聽邊說?

Seeduplex 採用原生端到端架構。白話來說,它不是把「語音轉文字、文字模型回答、文字轉語音」三套完全分離的系統接在一起,而是讓語音、語意與輸出節奏在共同的模型流程中學習。

官方沒有公開完整架構圖或模型參數量,但透露了幾個方向:先用大量語音資料預訓練,再透過多任務後訓練,同時優化對話能力、低延遲、節奏、抗干擾與指向性理解。推論階段則使用投機採樣與量化降低運算成本。投機採樣會先快速猜測一段可能的輸出,再由主模型驗證;量化則以較低精度表示部分數值,換取更快、更省資源的運算。

真正困難的還有服務端工程。全雙工代表模型要長時間維持音訊輸入與輸出,任何收音中斷、播放卡頓或延遲突然上升,都會破壞對話節奏。字節跳動強調已針對高流量下的穩定性做優化,而 Seeduplex 全量上線豆包 App,也讓這次發布比只在實驗室展示的 Demo 多了一層產品驗證。

官方評測提升多少?數字漂亮,但要看比較基準

字節跳動公布的內部評測顯示,Seeduplex 相較豆包先前的半雙工模型,判停 MOS 提高 8%,對話流暢度 MOS 提高 12%。MOS(Mean Opinion Score)是讓受測者對體驗品質評分後取得的平均結果,適合反映「聽起來是否自然」,但會受到測試題目、受測者與評分設計影響。

Seeduplex 與匿名主流 App 在判停、打斷回應及對話流暢度的官方評測圖
字節跳動以匿名代號呈現競品。這張圖適合說明官方測得的相對表現,不能當成可獨立重現的公開 benchmark。圖片來源:字節跳動 Seed 官方。

字節跳動也公布豆包 App 的大規模 A/B 實驗結果:新舊模型分配給不同使用者後,Seeduplex 組的整體通話滿意度絕對值增加 8.34%,通話時長與留存等指標也有正向提升。相較單純的實驗室分數,這組資料更能說明使用者是否願意繼續通話。

但這些結果仍有兩個限制。第一,資料來自開發者自己的內部評測,尚不是第三方獨立驗證。第二,官方橫向比較中的主流 App 只以字母代稱,沒有公布完整版本、測試樣本數與所有條件,因此不能據此斷言 Seeduplex 已全面勝過某個具名競品。

已經像真人了嗎?官方自己的圖給了更保守的答案

全雙工讓 AI 更會掌握輪流說話的時機,但不代表整段對話已經和真人一樣自然。

Seeduplex、半雙工模型與真人對話的官方評測比較圖
官方資料顯示 Seeduplex 的判停與打斷表現接近真人,但整體對話流暢度仍有明顯差距。圖片來源:字節跳動 Seed 官方。

在官方的人類對話比較中,Seeduplex 的打斷回應分數略高於真人平均,判停也比半雙工模型進步;可是整體對話流暢度仍明顯落後真人。這個落差提醒我們,對話自然度不只取決於延遲與打斷,還包含內容是否貼合、語氣是否連貫、回應長度、情緒理解,以及模型會不會在不適合的時機主動說話。

因此,我對 Seeduplex 的判斷是中性偏正面。它證明全雙工語音可以從 Demo 走進上億使用者規模的 App,也直接改善了語音 AI 最惱人的搶話與誤打斷問題;但官方尚未公開技術報告、可重現評測或外部開發介面細節,現階段更像豆包的一項重要體驗升級,而不是所有開發者都能立刻採用的通用基礎設施。

Seeduplex 現在怎麼用?有開放 API 或模型下載嗎?

一般使用者可把豆包 App 更新到最新版本,在對話框選擇「打電話」,進入語音通話介面體驗 Seeduplex。

這次官方公告沒有提供可下載的模型權重,也沒有列出獨立開發者 API 的接入方式與價格。因此,若你是產品團隊,現階段可以研究它的互動設計,例如允許插話、區分思考停頓與句尾、處理背景人聲;但不能只根據發布文章,就把 Seeduplex 當成已能直接整合的公開 API。

另一個容易混淆的地方是視覺能力。字節跳動把加入視覺模態、實現「邊聽、邊看、邊說」列在未來計畫中,代表 Seeduplex 的方向確實可能走向即時多模態互動,但本次已上線的核心仍是語音全雙工。

結論:語音 AI 的下一步,不是更會講,而是更懂得何時講

過去兩年,AI 語音模型多半把重點放在音色、情緒與回答速度。Seeduplex 把焦點移到更細微、卻更影響日常體驗的問題:當使用者猶豫時別搶話,遇到背景人聲別亂答,被打斷時要立即停下。

這條路值得持續關注,因為客服、車載助理、語言練習與智慧硬體真正需要的,不是多一個會朗讀答案的聊天機器人,而是一個能在混亂環境裡維持對話節奏的系統。Seeduplex 已證明這種能力可以大規模落地;下一個驗證點,則是字節跳動能否公開更完整的技術與接入方式,並縮小整體流暢度與真人對話之間的差距。

FAQ

SeedRealtime 和 Seeduplex 是同一個模型嗎?

官方目前使用 SeedRealtime 作為模型產品入口,而 2026 年 4 月發布的原生全雙工語音模型名稱是 Seeduplex。舊版豆包即時語音模型頁也標示已升級至 Seeduplex,因此可以把它理解為 SeedRealtime 產品線目前的全雙工升級版本。

什麼是全雙工語音模型?

全雙工代表模型可以在輸出語音時繼續接收並理解使用者聲音。它不只支援插話,還要判斷停頓、背景音與真正的打斷意圖,才能讓對話不再是僵硬的一問一答。

Seeduplex 是音視頻模型嗎?

不是這次發布的準確描述。官方目前強調的是語音與文字模態,視覺能力仍列在後續計畫中。它可以稱為原生全雙工語音大模型,但不應寫成已經能同步處理影音的全雙工模型。

Seeduplex 已經開源或提供 API 嗎?

官方發布文章沒有提供開源權重,也沒有公布獨立開發者 API 的接入與定價資訊。目前已確認的使用入口是豆包 App 的語音通話功能。

Seeduplex 已經超越真人對話嗎?

不能這樣下結論。官方評測中,Seeduplex 的打斷回應表現接近或略高於真人平均,但整體對話流暢度仍明顯落後真人,且數據尚未經第三方獨立驗證。

資料來源

Read more

Gemini Notebook 迎來大更新,每個筆記本搭一台雲端電腦?

Gemini Notebook 迎來大更新,每個筆記本搭一台雲端電腦?

上週我們開始今年的讀者調查,雖然離結束還有兩週的時間,但我們真的很好奇大家的答案,所以就偷看了一下 XD 有位在製造業擔任工程師的讀者分享,我覺得他的比喻很妙: 主管們都認為用 AI 可以減少開發時間,其實不然,反而增加了開發時間,因為很多事一直冒出來,而時間沒有被增加,原因是你被認定有 AI 助手,這跟人月神話有異曲同工之妙。聽過一句最寫實的話,再怎麼會生小孩,也是需要 10 個月才能誕生阿。 我非常認同,對於需要精密打磨的任務,十個 AI 助手也沒辦法改變「磨」這件事,就跟十個女人沒辦法一個月生出小孩一樣。而這也呼應目前的調查上,目前有 44.3% 的讀者用了 AI 之後工作量不減反增,真正省下的時間,很少變成「輕鬆」,而是被重新排進更多任務裡。管理者把 AI 當成人力乘數,但乘出來的常常不是產出,而是期待。 目前已經有 300+ 位讀者留下了自己的答案,

lock-1
Nuuly 用 AI 重新定義服裝租賃!包裹被快遞掃描的那一秒,解鎖下一輪穿搭

Nuuly 用 AI 重新定義服裝租賃!包裹被快遞掃描的那一秒,解鎖下一輪穿搭

Nuuly 是 URBN 集團(旗下擁有 Urban Outfitters、Anthropologie)旗下的訂閱制服裝租賃平台,月費 98 美元可租借六件衣服,目前已成長為北美最大的訂閱制時尚租賃服務之一。 Nuuly 透過即時物流數據和 AI 驅動的跨通路行銷系統,把每一個實體物流節點——包裹送達、歸還掃描——轉化成個人化的數位互動觸發點,並用 AI 預測訂閱者的流失風險,在取消訂閱行為發生前主動介入。