Google 推出 SL2T 手語 AI:Pixel 11 可用 ASL 輸入文字,但不能取代真人翻譯
Google 把 ASL 手語輸入帶進 Pixel 11,但 SL2T 仍是需要使用者校對的輔助工具,不能取代醫療、法律或教育現場的真人翻譯。
Google DeepMind 在 2026 年 8 月 12 日發表手語轉文字模型 SL2T,並首次把相關技術帶進一般消費性產品。Pixel 11 使用者可在 Gboard 與 Live Transcribe 對著手機打美國手語,系統會將內容轉成英文文字。
這次更新真正重要的地方,不只是模型在測試中拿到更高分,而是手語使用者終於能像聽人使用語音輸入一樣,用自己熟悉的語言搜尋、傳訊息、寫文件或操作 AI 助理。
不過,SL2T 目前仍是需要使用者逐句確認的輔助輸入工具。Google 與參與評估的聽障團體都明確表示,它不能取代醫療、法律或教育現場的合格手語翻譯員。
SL2T 是什麼?手語不再需要先拆成單字

SL2T 是 sign-language-to-text 的縮寫,也就是「手語轉文字」。首波功能支援美國手語(American Sign Language,ASL)轉英文,使用者可在任何能叫出 Gboard 的地方打手語,再把模型產生的文字送進搜尋引擎、通訊軟體、文件或 Gemini。
Live Transcribe 則把它用在面對面溝通。畫面上方顯示對方說話的即時字幕,下方讓手語使用者把回應轉成文字。產生的內容不會自動播放或傳送,使用者可以先閱讀、修改,再決定何時顯示給對方。
這項技術不能簡化成「辨認手勢」。手語是具有自身文法與詞彙的自然語言,意思同時來自手部、手臂、身體、頭部與臉部動作。因此,SL2T 做的是跨語言翻譯,而不是把每個手勢依序換成一個英文單字。
訓練資料涵蓋 50 多種手語,先從 ASL 走進 Pixel 11
官方示範使用者在 Gboard 與 Gemini 中以 ASL 直接輸入英文文字。 影片來源:Google DeepMind 官方發布頁。
Google 表示,SL2T 使用超過 10 萬小時、涵蓋 50 多種手語的資料訓練,其中約四分之一為 ASL。把不同手語、地區變體與熟練程度的資料放在一起訓練,目的是讓模型學到可跨語言共用的視覺與語言結構。
在 FLEURS-ASL 的 ASL 轉英文測試中,SL2T 的零樣本 BLEURT 分數為 70。BLEURT 是用來比較機器翻譯結果與參考答案在語意上有多接近的評估方式。「零樣本」則表示模型沒有先用該測試集的範例進行專門調整。
但 70 分不等於現實使用時有 70% 正確率。Google 公布的案例仍出現把「prey」辨識成「grey」、漏掉爪子描述,以及誤判時態等問題。這也是為什麼產品要求手語使用者先檢查文字,而不是把結果直接當成完成的翻譯。
首波功能先在 Pixel 11 上的 Gboard 與 Live Transcribe 提供,Google 表示之後會擴大到更多裝置與語言,且不另外收費。官方影響報告同時把這次版本界定為美國市場的 ASL 轉英文服務,沒有宣布台灣手語或繁體中文的上線時間。
延伸閱讀:Made by Google 2026 懶人包:Pixel 11、Pixel Watch 5、Pixel Tag 新品與台灣售價一次看
手機不直接上傳影像,但文字仍在伺服器產生
官方示範 SL2T 如何把手語動作轉成臉部、身體與雙手的位置點,再輸出文字。 影片來源:Google DeepMind 官方發布頁。
SL2T 的隱私設計,是先在手機上以 MediaPipe Holistic 找出臉部、身體與雙手共 130 個位置點,再將這些二維座標傳送到 Google 伺服器翻譯。原始相機影像在位置點擷取完成後就會立即丟棄。
共同影響報告指出,Google 端不保留使用者的輸入與系統輸出紀錄,除非使用者在模型評估研究中明確授權。這種做法降低了直接上傳臉部影像與周遭環境畫面的風險,但也帶來取捨:只留下幾何座標後,模型看不到舌頭、物體與空間深度等可能影響語意的資訊。
因此,這不是完全在手機離線完成的功能。手機負責把影像轉成位置點,實際的文字翻譯仍由 Google 伺服器處理。
它適合搜尋與聊天,不適合醫療、法律等高風險情境
Google 與 AI Sign Language Advisory Committee(AISLAC,手語 AI 顧問委員會)將 SL2T 1.0 定位為低風險日常溝通工具。適合的情境包括搜尋地址、輸入簡短指令、傳訊息、寫筆記、詢問 Gemini,以及在餐廳或商店進行簡短的一對一溝通。
它目前不應用於醫療診斷與知情同意、警察偵訊與法院程序、正式教學與測驗、求職面試與人事處分,以及政府福利資格認定。原因不只是偶爾翻錯字,而是模型不會反向把口語轉成手語、無法主動追問澄清,也缺少真人翻譯員具備的情境判斷、文化理解與法律責任。
共同影響報告還列出多項尚未解決的問題。模型有時會在使用者停下來思考,或第二個人進入鏡頭時產生沒有被打出的「幽靈文字」。臉部表情、眉毛與點頭等非手部訊號也可能被漏掉,進而改變疑問、否定或語氣。低光、強烈背光、地區手語差異、專有名詞與多人對話,同樣會降低可靠度。
這代表 SL2T 最適合讓使用者掌握最後決定權的短句輸入。只要錯誤會影響醫療、法律、工作或受教權,就不應以節省成本為理由拿它取代真人翻譯服務。
對台灣使用者有什麼影響?
台灣使用者目前還不能把 SL2T 當成台灣手語輸入法。首波產品只處理 ASL 轉英文,台灣手語並不是 ASL 的地方版本,而是具有不同詞彙與文法的自然語言。
這次發布更實際的意義,是證明手語 AI 已從實驗室評測走進手機鍵盤與即時溝通工具。接下來是否真的能擴大使用,關鍵不只在模型分數,還包括 Google 能否取得足夠的在地語料、與各地聽障社群共同評估,並針對不同手語建立清楚的安全界線。
延伸閱讀:【科技新聞】Google 最新 AI「SignGemma」能看懂手語、即時翻譯成口語文字!
FAQ
SL2T 可以把所有手語翻成文字嗎?
不行。首波產品只支援 ASL 轉英文。模型雖然使用 50 多種手語的資料共同訓練,但這不等於所有語言都已經成為可用功能,Google 也尚未公布台灣手語的支援時間。
哪些手機可以使用 SL2T?
Google 表示,SL2T 首先整合在 Pixel 11 的 Gboard 與 Live Transcribe,之後才會擴大到更多裝置。功能不另外收費,但實際可用地區與語言仍受首波美國市場、ASL 轉英文的範圍限制。
SL2T 可以取代手語翻譯員嗎?
不可以。它是讓手語使用者校對與編輯的文字草稿工具,並非完整的雙向口譯服務。醫療、法律、教育、就業與政府服務等高風險場合,仍應由合格真人翻譯員提供協助。
結論:真正的突破是把選擇權交給手語使用者
SL2T 的價值,不是宣稱 AI 已經「解決」手語翻譯,而是讓部分 ASL 使用者多一種日常輸入方式。搜尋、傳訊息與簡短面對面溝通,不必每次都先改用英文鍵盤。
它目前仍會誤解文法、地區用語與非手部訊號,也可能產生沒有被打出的文字。把它放在可預覽、可修改、由使用者決定是否送出的介面中,才是較合理的產品設計。Google 能否把這套做法延伸到更多手語,並持續讓當地社群參與評估,將比單一測試分數更值得觀察。