Gemini Robotics 2 是什麼?Google DeepMind 讓機器人學會全身控制、多步驟推理與團隊協作

Google DeepMind 發布 Gemini Robotics 2,讓人形機器人能走路、蹲下、抓取與完成多步驟任務,並支援多機器人協作與本機運行。

Share
Gemini Robotics 2 控制 Apollo 2 人形機器人執行全身動作
Gemini Robotics 2 將機器人的控制範圍從上半身操作擴展到走路、彎腰、抓取與放置。圖片來源:Google DeepMind 官方影片。

很多人看到人形機器人影片,第一個問題通常是「它到底是不是 AI 在控制?」但真正困難的地方,不是讓機器人完成一個固定動作,而是讓它在雜亂環境中理解指令、移動身體、拿起物品,並在中途發現問題後調整做法。

Google DeepMind 在 2026 年 7 月 30 日發布 Gemini Robotics 2,正是要處理這個問題。新模型把控制範圍從上半身與桌面操作,擴展到人形機器人的腳部、身體與雙手,也加入長流程任務推理、多機器人協作,以及直接在機器人本機運行的版本。

這代表 Gemini 不再只是「看懂畫面後告訴你答案」,而是開始成為機器人在物理世界中理解、規劃與行動的中間層。不過,官方展示的成功率仍依任務而異,並且明確表示動作速度與多指精細操作還有進步空間。因此,Gemini Robotics 2 是 Physical AI 的重要模型更新,但距離能在家庭或工廠普遍自主工作的機器人,仍有一段距離。

Gemini Robotics 2 的 3 款模型,分別負責什麼?

Google DeepMind 這次不是只發布一個模型,而是把機器人的「大腦」拆成 3 個互相配合的部分:

模型 白話功能 主要用途 目前開放方式
Gemini Robotics 2 把影像與語言轉成動作 控制完整人形機器人、雙臂機器人、手與夾爪 提供給早期合作夥伴
Gemini Robotics ER 2 規劃與協調工作的高階推理模型 理解環境、拆解任務、追蹤進度、協調多台機器人 可透過 Gemini API(讓程式呼叫 Gemini 的介面)、Google AI Studio 使用,企業平台為 Private Preview
Gemini Robotics On-Device 2 在機器人本機執行的高效率模型 降低網路延遲,在離線或低連線環境行動 提供給早期合作夥伴

其中,VLA 是 Vision-Language-Action 的縮寫,意思是模型不只理解影像與文字,還能把理解結果轉成機器人的動作。ER 則是 Embodied Reasoning,也就是讓 AI 根據真實環境進行推理,而非只在聊天視窗中生成文字。

這樣的分工很重要。高階模型可以負責理解「把澆水壺放到架子底層的綠色垃圾桶」,低階 VLA 再把這句話拆成走路、彎腰、伸手、抓取與放置。機器人不必每一個關節都依賴同一個模型直接控制,系統也比較容易換成不同硬體。

人形機器人開始控制全身,不只會動手臂

過去的機器人 AI,常見做法是先把機器人固定在工作站,再讓它重複執行桌面上的抓取或分類。這類系統在環境穩定時很有效,但一旦物品換位置、目標在地板上,或機器人需要跨幾步移動,原本的控制方式就會遇到限制。

Gemini Robotics 2 的核心更新,是讓人形機器人同時理解移動與操作。Google DeepMind 展示 Apptronik 的 Apollo 2 接收自然語言指令,把澆水壺放進底層架子的綠色垃圾桶。Apollo 2 需要先走到桌邊拿起澆水壺,再移動到架子旁,最後把物品放到指定位置。

Gemini Robotics 2 展示人形機器人執行全身控制。 影片來源:Google DeepMind。

這個例子看似簡單,實際上包含物件辨識、空間定位、路徑規劃、平衡控制、抓取與放置等多個環節。真正值得注意的不是機器人「會走路」,而是走路與手部操作被放進同一個任務裡處理。這是從固定工站走向真實環境的重要一步。

但 Google 也承認,目前機器人的移動速度仍需要提升。換句話說,模型已經能把「下一步該做什麼」轉成一連串身體動作,卻不代表它能像人一樣快速、穩定地完成工作。

Gemini Robotics 2 讓機器人處理更細緻的手部工作

機器人要進入家庭、倉庫或工廠,光是能拿起大型物品還不夠。很多任務需要手指調整角度、控制力量,或在物品容易變形的情況下維持穩定,這也是機器人長期較難處理的部分。

Google DeepMind 表示,Gemini Robotics 2 能控制 Apollo 2 使用 22 個自由度的 SharpaWave 五指手,完成打結、封閉夾鏈袋等動作;它也能控制 Franka Duo 的雙指夾爪,處理工具整理與精密插入任務。

官方公布的結果顯示,Franka Duo 在一般抓取放置的平均成功率為 74.2%,多樣工具整理為 78.9%,精密插入為 89.6%。Apollo 2 使用 Inspire hands 時,從桌面拿取物品為 68.4%,從地面拿取為 45.7%,從架上拿取為 76.3%。

Gemini Robotics 2 展示機器人使用手部與夾爪完成精細操作。 影片來源:Google DeepMind。

這些數字說明,機器人已能在不同高度與動作條件下完成不少任務,但成功率並非每項都接近 100%。多指操作的結果尤其不穩定,例如螺入燈泡為 36%、綁垃圾袋為 44%、使用畚箕為 32%、封夾鏈袋為 40%,只有旋開燈泡達到 92%。

因此,現在比較準確的結論是「機器人開始具備更廣泛的操作能力」,而不是「機器人已經擁有人類手部靈巧度」。對實際部署來說,任務失敗後能否安全重試、是否需要人員介入,可能比單次展示成功更重要。

Gemini Robotics ER 2:讓機器人完成幾分鐘、數百次決策的工作

如果 Gemini Robotics 2 負責把意圖轉成動作,Gemini Robotics ER 2 就像負責任務管理的高階大腦。它可以理解人類指令、觀察房間、安排多個步驟,再把每一步交給 VLA 或其他機器人 API 執行。

這種架構讓機器人不必把所有流程寫死。例如,當某個物品掉落、位置改變,或上一個動作沒有完成,ER 2 可以根據新的畫面重新判斷,而不是從頭執行同一段固定腳本。Google 表示,ER 2 能處理持續數分鐘、涉及數百次決策的任務,也能判斷任務何時開始、何時完成,以及關鍵事件在影片中的發生時間。

Google 的開發者文章公布,ER 2 在任務進度分類的準確率為 57.4%;在精確找出關鍵事件發生時刻的測試中,準確率為 91.3%,平均絕對距離為 0.96 秒。這些能力的實際價值,在於機器人可以知道「現在做到哪裡」,並在失敗時重試特定步驟,而不是整個流程重新開始。

Gemini Robotics 2 展示不同類型的機器人協作完成任務。 影片來源:Google DeepMind。

ER 2 也加入多機器人協作。輪式機器人適合在室內快速移動,人形機器人可能更適合處理階梯、狹窄空間或為人類設計的設備。讓不同類型的機器人共享對環境與任務的理解,才有機會完成單一機器人難以處理的工作流程。

On-Device 2 把模型放進機器人本機,降低延遲

機器人不能永遠依賴雲端。若每個動作都要把影像上傳、等待伺服器回應,再把指令傳回機器人,網路延遲可能影響操作速度與安全性。工廠、倉庫或沒有穩定網路的場景,也可能不適合完全雲端化。

Gemini Robotics On-Device 2 是針對這個問題設計的本機模型。Google DeepMind 表示,它能在機器人裝置上執行,並可透過少於 200 個示例、通常幾小時的適應時間,轉移到新的雙臂機器人形體。這些機器人的外型、感測器與自由度可以不同。

對機器人製造商來說,這項能力的意義比單純追求模型更大。若每換一種機器人硬體,就必須從頭蒐集大量資料與重新訓練,模型很難擴展到不同產品。若能用較少資料快速適應,才有機會建立跨硬體的通用控制層。

不過,「幾小時適應」仍是官方描述的研究成果,不等於所有新機器人都能直接接上模型。實際導入還要考慮感測器品質、馬達控制、安全限制、資料分布與硬體驗證。

Google 如何處理 AI 機器人的安全問題?

當 AI 只在螢幕上回答錯誤,通常可以重新提問;但機器人若在有人靠近時繼續移動,錯誤就可能變成實體傷害。因此,機器人安全不能只靠模型「看起來懂不懂」,還要搭配急停、速度與力量限制、隔離區、冗餘硬體等傳統安全機制。

Google DeepMind 這次推出 ASIMOV-Agentic benchmark,測試模型能否拒絕違反安全條件的指令、判斷任務是否可行、在不確定時請求人類協助,並在人類靠近時觸發安全停止。官方也表示,Gemini Robotics ER 2 在安全指令遵循與人類靠近測試中優於前一代模型。

但這裡要留意一個重要限制。Google 的安全技術報告明確指出,這些測試主要評估高階語意推理與協調能力,並沒有評估完整的功能安全架構,包括認證硬體、冗餘機制與即時系統保證。也就是說,模型的安全評測表現不能直接等同於某一台機器人已經取得可在真實工作場所部署的安全認證。

這個區分很重要。Gemini Robotics 2 可以讓機器人更會理解場景與拒絕危險指令,但實際上線仍需要機器人製造商、系統整合商與監管標準共同驗證。

Gemini Robotics 2 的真正意義:Physical AI 進入系統整合階段

這次更新最值得關注的地方,不是某一段人形機器人影片,而是 Google DeepMind 正在建立一套可拆分的 Physical AI 架構:ER 2 負責理解與規劃,VLA 負責身體控制,On-Device 版本處理低延遲與硬體適應,安全層則負責拒絕、停止與請求人類介入。

這種分工有機會讓機器人從「每台設備各自訓練、各自寫腳本」,逐步走向可以共享模型能力的生態系。對開發者來說,Gemini Robotics ER 2 已能透過 API 與 Google AI Studio 試用,降低建立物理 AI 代理人的門檻;對硬體公司來說,真正的競爭則會落在資料、控制介面、可靠度與安全驗證。

我的判斷是,Gemini Robotics 2 對 AI 機器人產業屬於中性偏正面的模型進展,因為它確實把控制範圍、任務長度與多機器人協作往前推進。但它還不能被解讀成「人形機器人即將全面進入家庭」。官方公布的多指操作成功率、移動速度與安全架構限制,都說明目前仍處於研究與早期合作階段。

對一般讀者來說,最實際的理解方式是:AI 機器人正在從固定動作自動化,走向能看懂環境、拆解任務並調整行動的系統;至於何時能穩定處理家務或工廠工作,還要看真實場景中的失敗率、成本與安全驗證。

常見問題

Gemini Robotics 2 是什麼?

Gemini Robotics 2 是 Google DeepMind 用於機器人的視覺語言行動模型。它能把影像與自然語言指令轉成機器人動作,並控制人形機器人的全身、雙臂與手部操作。

Gemini Robotics 2 和一般 Gemini 有什麼不同?

一般 Gemini 主要在數位環境中理解文字、圖片、聲音或影片並產生回覆;Gemini Robotics 2 則要把理解結果轉成真實機器人的移動與抓取動作,因此需要處理空間、平衡、碰撞、延遲與安全問題。

Gemini Robotics ER 2 可以做什麼?

ER 2 是負責高階規劃與協調的具身推理模型。它能理解環境、拆解多步驟任務、追蹤進度、在失敗後調整流程,也能協調不同類型的機器人合作。

Gemini Robotics 2 已經可以買到嗎?

目前官方公告不是消費型機器人上市。Gemini Robotics 2 與 On-Device 2 主要提供給早期合作夥伴;ER 2 則可透過 Gemini API、Google AI Studio 使用,Gemini Enterprise Agent Platform 為 Private Preview。實際存取資格仍依 Google 的開放政策與平台狀態而定。

Gemini Robotics 2 能讓機器人像人一樣靈活嗎?

還不能這樣下結論。官方展示了打結、封夾鏈袋與精密插入等任務,但多指操作的成功率依任務差異很大,Google 也表示動作速度與人類程度的靈巧度仍需要提升。

Gemini Robotics 2 安全嗎?

模型加入拒絕不安全指令、監測人類靠近與觸發安全停止等能力,但模型評測不等於完整的機器人部署安全認證。實際安全性仍取決於硬體、急停、速度與力量限制、系統整合和現場規範。

結語:機器人真正的競爭,從單一動作轉向整體可靠度

Gemini Robotics 2 把 AI 機器人的能力往前推了一步:它不只讓機器人拿東西,也嘗試讓機器人理解整個任務,協調雙腳、身體與雙手,並在多台機器人之間分工。

但這個領域的下一個關鍵,不會只由 Demo 影片決定。機器人是否能以足夠快的速度完成工作、失敗時能否安全停止、換一種硬體後是否仍可靠,以及每次任務的成本是否可接受,才會決定 Physical AI 能不能真正走進家庭與產業。

Gemini Robotics 2 的價值,在於它開始提供一個可跨機器人硬體使用的智慧層。它距離通用型機器人還很遠,但已經把競爭焦點從「機器人能不能動」推向「機器人能不能理解、協作,並且可靠地完成整件事」。

資料來源