Tavus Griffin 是什麼?48% 受試者以為是真人,視訊 AI 跨過了哪一道門檻?

Tavus Griffin 主打即時視訊互動,48% 受試者在一分鐘通話後以為對方是真人。解析測試條件、全雙工能力、NVIDIA 評測,以及研究預覽的開放限制。

Share
Tavus Griffin 官方研究封面,左側為模型名稱、右側為獅鷲插畫。
Tavus 的 Griffin 官方研究封面。 圖片來源:Tavus 官方 Griffin 研究頁。

Tavus Griffin 是一套能與人即時視訊對話的 AI,目標是讓聲音、表情與回應時機配合眼前的互動。Tavus 在 2026 年 10 月 1 日宣布這項研究,將它稱為人類互動模型(Human Interaction Model,HIM),也就是專門處理面對面交流的模型。官方介紹說明了這個定位。

最吸引目光的是 Tavus 的一項測試結果:48% 的受試者在與它即時交談後,以為對方是真人。公司因此在發布貼文中,宣稱 Griffin 通過了視訊圖靈測試,也就是以人能否辨識 AI 對話對象,評估交流的擬真程度。

這個結果讓視訊 AI 的競爭往前走了一步。當數位人物可以在你說話時點頭、接話,又能在你猶豫時等待,人機互動就有機會減少一種熟悉的負擔:為了讓機器聽懂,刻意改變自己的說話方式。

但自然對話與可靠服務,仍然是兩道不同的門檻。理解 Griffin 的價值,需要先看 48% 怎麼測出來,再看它改善了哪些互動,以及這些進展距離實際應用還有多遠。

48% 以為是真人:一分鐘測試的結果與限制

依照 Tavus 公開的研究方法與結果,Griffin-Lite 組共有 54 人,其中 26 人認為對方是真人,比例約為 48%。使用 Tavus 前一代組合系統的對照組共有 41 人,只有 1 人如此判斷,比例約為 2.4%。

參與者被告知會與另一位參與者視訊一分鐘,聊聊今年期待的事情。實際對話對象由 AI 驅動,問卷最後才詢問他們是否懷疑對方並非真人,之後告知其 AI 身分。

這項安排影響了結果的解讀。參與者帶著「對面是另一個人」的預期進入通話,任務是短暫閒聊。研究沒有要求他們從頭積極辨識 AI,也沒有在這組結果中驗證長時間、反覆追問下的表現。

因此,48% 比較能支持的判斷是:在這種短時、帶有真人預期的互動裡,Griffin-Lite 的自然度已足以讓不少人接受對方是真人。要把它推廣成「任何人都分不出來」,還需要其他測試。

本文沿用 Tavus 的「視訊圖靈測試」稱呼,但「通過」是公司的研究結論。這一分鐘的身分判斷,無法證明 AI 具有人的意識,也無法直接回答它的知識是否正確。

我會把這項結果視為值得重視的互動進展。相較於單看一張逼真的臉,讓人接受持續回應的對話對象,需要聲音、畫面與節奏共同配合。然而,商業使用的判斷仍要加入長對話、不同語言,以及使用者知道對方是 AI 後的測試。

0:00
/0:00

Tavus 的 Griffin 官方發布影片,包含即時視訊互動展示。 影片來源:Tavus 官方 X 發布貼文。

Griffin 的重點,在於邊說邊聽與看

視訊 AI 的難題包含「什麼時候回應」。假設你正在找詞,停頓一下又繼續說,系統若立即開始長篇回答,就會打斷思路。反過來說,你已經講完,它卻一直等待,也會讓人懷疑是否收到了訊息。

Tavus 的對話示範貼文強調全雙工(full-duplex):AI 說話的同時,仍持續聽與看,能在對方尚未說完時給出適當反應。這讓回應的時機成為模型要處理的事情。

其中一個關鍵是簡短的聆聽回應,例如「嗯」或點頭。這些反應通常是在告訴對方「我有跟上」,不一定代表要接管對話。如果系統把每個聲音都視為新問題,或把每次沉默都當成發言結束,使用者就得不斷配合它的規則。

Tavus 先前的研究已沿著這條路線發展。依照Phoenix-4.5 的介紹,它負責生成數位人物的畫面與動作。Raven-1處理聲音、表情與情境線索,而Sparrow-2則判斷何時聽、等待、說話,以及如何理解插話。

這些角色有助於理解 Tavus 的研究方向。AI 的「人味」有一部分來自協調:嘴巴與聲音要一致,聆聽時的反應要合宜,對方想說話時也要讓出空間。即使一句答案寫得很好,若出現時間不對,對話仍然可能令人不舒服。

從產品角度看,我更在意使用者能否自在地停頓、修正句子與插話。這些能力若能穩定運作,比一段事先挑選的流暢示範更接近日常需求。

Griffin 官方 Simon Says 示範影片縮圖,一位參與者坐在筆電前。
Tavus 的 Simon Says 示範影片縮圖,呈現參與者與 Griffin 互動的場景。 圖片來源:Tavus 官方 Griffin 研究頁。

視訊輸入的價值,是讓畫面改變回應

Griffin 的官方示範也嘗試讓畫面參與對話。在Simon Says 遊戲裡,模型要同時聽指令、看手勢,再生成自己的動作。另一則故事示範則呈現對方拿出物品後,Griffin 把看見的內容加入正在進行的故事。

這類互動指出一個實用方向:使用者可以展示眼前的東西,讓系統據此回應。若每次都必須先把物品、姿勢或操作步驟完整描述成文字,視訊就失去了部分用途。

不過,看得到與看得準也需要分開。一次示範能呈現模型的能力,產品測試則要確認它遇到遮擋、光線變化或相似物件時如何處理。尤其在教學情境裡,錯誤指認可能讓後續解說一路偏離。

我的判斷是,視訊 AI 值得投入的地方,在於減少使用者解釋情境的成本。要證明這種效益,就應測量完成任務所需的時間與錯誤,而不只詢問畫面是否像真人。

NVIDIA 排行榜支持互動進展,但仍有真人差距

除了 Tavus 自己的測試,還能從NVIDIA 的 VideoFDB 官方排行榜交叉檢視 Griffin-Lite 的表現。VideoFDB 是針對即時影音對話設計的評測,區分模型理解對方的「感知」,以及產生自身聲音與畫面反應的「生成」。

截至 2026 年 10 月 3 日查詢,排行榜列出的總分如下,分數愈高代表在該評測中表現愈好。

評測項目 Griffin-Lite 真人參考值
感知總分 3.73 4.20
生成總分 3.83 3.92

Griffin-Lite 的兩項總分都領先榜上其他模型。這些分數由語言模型依評分規則判定,評測重點包括流暢度、對話銜接,以及非語言反應是否符合情境。

生成總分接近真人參考值,是有意義的訊號,但不能換算成「已具備真人能力的某個百分比」。總分也可能掩蓋不同能力的落差:一套系統可以表情自然,卻仍在某些停頓或插話情境失誤。

這份排行榜增加了 Griffin 值得關注的理由,也把論點範圍限定得更清楚。它支持的是特定影音互動能力,不能據此宣稱 Griffin 在推理、知識問答或所有任務上全面領先其他 AI。

Griffin 官方魔術方塊示範縮圖,男子展示方塊、左上角顯示視訊對話對象。
Tavus 以魔術方塊示範視覺情境如何參與對話。 圖片來源:Tavus 官方 Griffin 研究頁。

教學與情境練習,是值得驗證的應用

以下是根據上述互動能力推導的應用方向,並非 Griffin 已經證實的成效。

我會優先關注語言練習與角色扮演。這類任務需要連續交流,學習者也經常停頓、重說或臨時改變話題。如果 AI 能配合節奏,練習時就不必一直擔心機器是否把句子截斷。

但教育產品要證明的,應該是學習者是否獲得準確回饋、是否更願意開口,以及能力有沒有改善。即使學生喜歡與數位人物聊天,也不能直接推論教學效果更好。

客服演練同樣具有測試價值。面對質疑、猶豫或情緒變化時,回應的時間與語氣都會影響練習。測試可以觀察學員能否完成情境、是否得到一致的評估,而不是只計算對話持續多久。

這也是我的採用立場:先在任務清楚、錯誤可被發現的練習場景驗證,再考慮擴大。若較自然的視訊介面沒有改善成果,或反而讓使用者更容易相信錯誤答案,就必須調整對它的評價。

AI 愈像人,身分揭露就愈重要

Griffin 的 48% 結果,也帶出一個直接的產品問題:當使用者可能誤認對方是真人,服務必須清楚交代 AI 身分。

Tavus 的可接受使用政策要求顯著揭露 AI 互動,也要求使用他人肖像、聲音等素材時取得必要同意,並禁止詐騙與有害冒充。這是平台對使用者提出的規範,不能單憑條文就認定所有濫用風險都已解決。

從使用者角度看,清楚揭露身分反而有助於建立合理期待。知道對方是 AI,仍然可以享受自然的交流,同時理解它的回答需要核對。若服務把「讓人誤認是真人」當成日常目標,使用者就很難判斷自己正在與誰分享資訊。

我認為值得追蹤的下一項證據,是在持續標示 AI 身分的情況下,使用者是否仍願意使用,以及是否能更有效完成任務。這比重複提高誤認比例,更接近可長期運作的產品價值。

Griffin 現在能用嗎?

截至 2026 年 10 月 3 日,Tavus 的官方公告將 Griffin-Lite 定位為提供給選定測試者的研究預覽,尚未開放一般客戶使用,也還沒有加入 Tavus 現有平台。

因此,有需求的團隊應先把 Griffin 當成研究方向追蹤。評估既有 Tavus 產品時,則要依那些產品實際提供的能力做決定,不能把 Griffin 的測試結果直接移用成現有服務的保證。

Griffin 可以取代真人老師嗎?

本文提到的測試並未評估完整教學能力。若用於學習,還要驗證知識正確性、回饋品質與學習成果,並決定哪些情況需要真人介入。

Griffin 和預先製作的數位人影片差在哪裡?

Griffin 主打現場互動,對方的話語與畫面可以影響當下回應。預先製作的影片則通常已有固定內容,適合播放資訊,兩者要解決的需求不同。

48% 代表大多數人都分不出 AI 嗎?

48% 未超過半數,而且是特定一分鐘測試的結果。它呈現了短暫對話中的擬真進展,無法直接推廣到所有人與所有情境。

Griffin 提出了一個值得認真測試的方向:讓 AI 配合人的交流節奏。後續能否成為實用服務,取決於這份自然感能否在明確揭露 AI 身分後,仍帶來準確回應與更好的任務成果。