Dyna-2 是什麼?看 100 萬小時人類影片學操作,機器人訓練可能換一條路

Dyna-2 用超過 100 萬小時人類操作影片預訓練機器人模型。真正突破不是單一展示,而是人類影片可能成為機器人可規模化的資料來源。

Share
Dyna-2 由大量人類操作影片組成的官方研究封面
Dyna-2 使用超過 100 萬小時第一視角人類操作影片進行預訓練。圖片來源:Dyna Robotics。 圖片來源:https://www.dyna.co/dyna-2

機器人要學會摺衣服、開瓶蓋或整理物品,過去通常需要人類操作真實機器,逐次收集示範資料。問題是,機器人資料昂貴又難以大量取得,訓練規模很難像大型語言模型一樣快速擴張。

Dyna Robotics 在 2026 年 8 月發表的 Dyna-2,嘗試改用另一條路:先讓模型學習超過 100 萬小時的人類第一視角操作影片,再用少量機器人資料適應實際任務。

這項研究最重要的地方,不是又多了一支會切菜、開瓶蓋的展示影片,而是它提出一個更接近 AI 規模化的方法:人類日常操作影片,可能成為機器人預訓練的新資料來源。

我對 Dyna-2 的判斷是「中性偏正面」。受控制的資料規模實驗與實機結果,確實讓「機器人能從人類影片學到可轉移知識」更有說服力;但目前證據主要來自公司自己的技術報告,距離可廣泛部署的通用機器人仍有一段距離。

Dyna-2 是什麼?

Dyna-2 是一個世界動作模型(World-Action Model,WAM)。簡單來說,這類模型不只學習「看到畫面後要做哪個動作」,還會在訓練過程中學習物體與環境接下來可能如何變化。

例如,當人把手伸向瓶子、握住瓶蓋再旋轉時,影片不只提供畫面,也包含物體接觸、手部移動與場景變化。Dyna-2 會同時學習未來畫面與動作,藉此建立對物理互動的表示。

這和常見的視覺-語言-動作模型(Vision-Language-Action Model,VLA)不太一樣。VLA 通常根據影像與文字指令直接輸出機器人動作;WAM 則把預測世界如何變化納入訓練。兩者不是簡單的「新架構全面取代舊架構」,而是使用不同方式讓模型理解動作與結果的關係。

需要注意的是,Dyna-2 雖然在訓練時學習未來影片與動作,官方報告指出,執行機器人動作時並不會先生成一段未來影片再照著操作。影片預測主要用來塑造模型內部的表示,實際控制仍根據當下情境輸出動作。

100 萬小時影片是怎麼拿來訓練機器人的?

Dyna Robotics 建立的資料庫以頭戴式裝置拍攝的第一視角影片為主,內容包括烹飪、整理、摺衣服與組裝等日常操作。團隊從影片中擷取 3D 手部姿勢,再把手腕路徑與拇指、食指之間的距離轉成近似的動作標註。

換句話說,模型看到的不是單純「有人在做事」的影片,而是帶有手部移動線索的操作資料。這讓人類影片可以提供類似機器人動作軌跡的訓練訊號,又不需要每一小時都由人類遠端操控機器人錄製。

研究團隊把資料分成 1,000、1 萬、10 萬與 100 萬小時四個規模。每一級都保留相同比例的資料來源,較大的資料集只增加內容,不替換原本樣本。這種設計的意義是,研究者能更合理地判斷效能提升是否真的來自資料量,而不是資料類型被換掉。

0:00
/0:00

官方展示預訓練資料中的日常雙手操作片段。影片來源:Dyna Robotics。 查看官方研究

Dyna-2 的 4 個關鍵結果

1. 人類影片越多,模型預測人類動作的表現越好

在固定的 100 小時人類驗證資料上,Dyna-2 從 1,000 小時一路增加到 100 萬小時預訓練資料時,四項評估指標都持續改善。官方將這種可預測的改善趨勢稱為規模定律(scaling law),也就是資料量增加時,模型表現會沿著可觀察的規律提升。

這個結果先證明 Dyna-2 能吸收大量影片資料,但只在人類資料上進步還不夠。真正困難的問題是,人手與機器手的外型、關節及控制方式不同,從人類影片學到的知識能不能跨過這個差距。研究領域把這種將經驗轉移到不同身體結構的能力稱為跨本體轉移(cross-embodiment transfer)。

2. 沒看過機器人資料,離線預測仍隨人類影片增加而改善

研究團隊接著使用 39 項機器人任務的既有資料測試模型,內容涵蓋布料處理、打結、清潔、包裝、餐飲服務與組裝。這一階段沒有把相關機器人軌跡加入預訓練,也沒有先做額外微調。

結果顯示,當人類影片從 1,000 小時增加到 100 萬小時,模型在未見過的機器人資料上,動作誤差與準確率也呈現整體改善。研究中最明顯的變化出現在 1 萬至 10 萬小時之間,顯示跨越人類與機器人外型差異的能力,可能要累積到一定資料量才會出現。

這是 Dyna-2 最有價值的結果。它代表人類影片不只是教模型辨識「人在做什麼」,還可能讓模型學到能轉移至不同機器人本體的物理互動規律。

3. 加入少量機器人資料後,實機平均表現從 20% 升至 53%

離線預測正確,不等於真實機器人能完成任務。因此,團隊再把四個不同預訓練規模的模型,使用相同方式調整到 14 項實機任務。每項任務最多使用 10 小時機器人資料,並在三種不同機器人平台上測試。

研究團隊先把每項任務的成績換算成「相對於該任務最高可能成績的比例」,再計算平均標準化分數。四組模型依序得到 20%、28%、45% 與 53%。使用 100 萬小時人類影片預訓練的版本,在 14 項任務中有 9 項取得最佳結果。

其中,雙手五指機器人開瓶蓋只使用約 10 分鐘遠端操作示範。隨著人類預訓練資料增加,成功率從較小資料規模時的 10%,提升至 100 萬小時版本的 50%。轉動鎖箱鑰匙則在 10 萬小時以前都無法成功,到了 100 萬小時版本才達到 90%。

不過,個別任務並非全部隨資料量穩定上升。例如打繩結任務在 10 萬小時版本達到 90%,到了 100 萬小時版本反而降至 40%。因此,這份報告能支持的是「整體平均表現隨規模提升」,不是「每一種機器人技能都會因資料增加而變好」。

0:00
/0:00

官方展示模型經少量機器人資料後訓練的自主操作結果;個別展示不代表所有任務成功率。 查看官方研究

Dyna-2 機器人切割芹菜後的官方成果照片
Dyna Robotics 以芹菜切割結果展示 Dyna-2 的操作品質;這是官方案例,不等同第三方通用能力評測。 查看官方來源

4. 真正產生跨機器人轉移的關鍵,是預測未來畫面

Dyna Robotics 還比較三種訓練方式:只預測動作、同時預測動作與未來影片,以及加入更多未標註動作的影片共同訓練。

在相同資料規模下,同時預測未來影片與動作的版本,在 39 項離線機器人任務中全部勝過只預測動作的版本。當動作資料量固定、只增加一般人類影片時,模型對未見機器人資料的預測也持續改善。

這個對照實驗比單純把資料放大更重要。它顯示影片的價值不只是增加樣本數,而是讓模型學習「動作發生後,世界會怎麼改變」。如果後續研究能重現這個結果,機器人公司競爭的重點可能會從單純收集機器人操作紀錄,轉向建立更大、更乾淨的人類操作影片與標註管線。

Dyna-2 已經能直接變成通用機器人嗎?

還不能。

首先,報告中的「零樣本」(zero-shot)有不同情境。在 39 項離線測試中,它代表模型預訓練時沒看過機器人資料;在客戶現場測試中,則代表模型已用任務資料調整,但沒有看過該部署地點的資料。這不等於完全不需任何機器人示範,就能直接完成陌生任務。

其次,100 萬小時版本在 14 項實機任務的平均標準化分數仍是 53%,部分任務也會隨資料增加而退步。Dyna Robotics 另外公布,Dyna-2 在未見過的客戶現場通過率為 87%,高於 Dyna-1 的 46%;但這些數據來自公司內部與客戶現場的自有評估,尚不能直接推論到所有產業、機器人硬體與工作環境。

0:00
/0:00

人員反覆把切好的食材放回砧板,Dyna-2 持續執行直到清空。這是 Dyna 官方案例,不是獨立測試。 查看官方研究

最後,官方頁面沒有完整公開 100 萬小時資料集、模型權重(模型訓練完成後保存的核心參數檔)、訓練成本與所有評測細節。資料主要由合作夥伴與公司內部作業取得,外部研究者目前很難用相同條件重現完整實驗。

因此,Dyna-2 比較像是證明了一條值得繼續投資的訓練路線,而不是宣告通用機器人已經完成。若未來第三方能用不同資料、不同硬體重現跨本體規模定律,我會把目前的「中性偏正面」進一步調高;反過來說,如果提升只在 Dyna 自有資料與測試環境成立,這項成果的產業影響就會明顯縮小。

Dyna-2 對機器人產業為什麼重要?

大型語言模型能快速進步,其中一個原因是網路上原本就存在大量文字。機器人沒有同樣的條件,因為高品質動作資料通常要在真實硬體上逐次收集。

Dyna-2 嘗試把既有的人類影片變成機器人的預訓練資料,等於替 Physical AI 找到一個更容易擴張的資料軸。Physical AI 指的是能感知真實環境、理解物理互動並採取動作的 AI 系統,例如工業機器人與人形機器人。

對企業而言,真正有商業價值的不是展示影片有多流暢,而是新任務需要多少示範資料、部署到陌生現場後能維持多少可靠度,以及整體導入成本能否下降。Dyna-2 已經讓「先用大量人類影片預訓練,再用少量機器人資料適應」這條路更可信,但還沒有證明它能在各種現場穩定達到量產要求。

Dyna-2 常見問題

Dyna-2 只靠人類影片就能控制機器人嗎?

不是。Dyna-2 的基礎能力先用人類影片預訓練,但要在真實機器人上執行特定任務,研究仍使用少量機器人示範進行後訓練。只有離線跨本體測試是在沒有機器人預訓練資料與額外調整的情況下進行。

World-Action Model 和 VLA 有什麼差別?

VLA 主要把影像、文字指令映射成動作;World-Action Model 則在訓練中加入對未來場景變化的學習。Dyna-2 的實驗顯示,影片預測有助於把人類操作知識轉移到不同機器人,但這不代表所有 WAM 都一定優於所有 VLA。

100 萬小時資料代表每項任務都會進步嗎?

不代表。Dyna-2 的整體平均分數會隨預訓練資料增加而提升,但部分單項任務出現波動或退步。規模定律描述的是整體趨勢,不是每項能力都保證單調成長。

Dyna-2 有開放模型下載嗎?

截至 2026 年 8 月 11 日,Dyna-2 官方研究頁沒有提供模型權重、完整資料集或程式碼下載連結。目前公開內容以技術報告、評測數據與展示影片為主。

結論:重要的不是機器人學會一招,而是訓練資料可能開始規模化

Dyna-2 最值得關注的成果,是用受控制的實驗顯示:擴大人類操作影片,不只改善人類動作預測,也能提升模型在未見機器人資料與實際機器人任務上的整體表現。

這讓機器人 AI 出現一條更實際的規模化路徑。未來公司不必只靠昂貴的機器人遠端操作資料,也可能先利用大量人類影片學習物體、接觸與動作之間的關係,再用較少的機器人資料完成部署。

但 100 萬小時不是通用機器人已經成熟的證明。現階段比較合理的結論是:Dyna-2 把「人類影片能否成為機器人基礎資料」從概念推進到有規模實驗支持的技術方向。接下來真正要看的,是第三方能否重現、現場可靠度能否持續提升,以及資料與運算成本是否足以支撐商業化。

資料來源