Runway GWM Worlds 2 是什麼?AI 不只算短片,首款支援「任意動作」的即時互動世界模型深度解析

Runway 發表通用世界模型 GWM Worlds 2,支援 720p/24fps 視訊與 48kHz 音訊連續串流,首創 WorldPrompt 架構並泛化至任意動態動作。本文深度解析運作原理、三種互動模式、與遊戲引擎差異及目前瓶頸。

Share
Runway GWM Worlds 2 通用世界模型
GWM Worlds 2 支援 720p/24fps 視訊與 48kHz 音訊即時連續生成。 圖片來源:Runway 官方研究公告(https://runwayml.com/research/introducing-gwm-worlds-2)

過去兩年,生成式 AI 在影片領域的競賽大多集中在「畫質有多高」與「動作有多逼真」。從 Runway Gen-3、OpenAI Sora 到各家旗艦模型,產出的終端成品始終是一段幾秒鐘、固定鏡頭、使用者只能被動觀看的離線短片。

Runway 共同創辦人暨執行長 Cristóbal Valenzuela 於 2026 年 9 月 3 日正式公布 GWM Worlds 2,宣告視訊 AI 正在跨入下一個全新維度——通用世界模型(General World Models)

GWM Worlds 2 不再把生成終點設定為「算完一段影片」,而是輸出每秒 24 幀的 720p 連續視訊與 48,000 Hz 高採樣率音訊串流。更關鍵的是,它是全球第一個能泛化至「任意動態動作(Arbitrary Actions)」的世界模型。使用者不再只是像前代模型那樣在靜止場景中走路或旋轉視角,而是能在虛擬世界中奔跑、攀爬、開燈、射擊、與 NPC 對話,甚至動態呼喚暴風雨改變整個世界的物理環境。

這項進展不僅為未來的沉浸式遊戲打開了「無須傳統遊戲引擎渲染」的可能性,更為具身智慧(Embodied AI)與機器人訓練提供了低成本、可無限生成的數位試煉場。本文將帶你深入剖析 GWM Worlds 2 的底層機制、WorldPrompt 架構、三種互動模式,以及它當前仍面臨的物理漂移與記憶限制。


GWM Worlds 2 是什麼?從「產生短片」到「生成可玩的世界」

GWM Worlds 2 是 Runway 通用世界模型(General World Model)研究的最新成果(Research Preview)。「世界模型」與一般影片生成模型最大的不同在於:它內部必須具備對實體環境、空間幾何、重力光影與因果關係的理解,能夠根據外部輸入推演出「合理的下一個狀態」。

Runway 在 2025 年 12 月曾展示過第一代 GWM Worlds,當時主要證明了神經網路可以維持基本的 3D 空間一致性,讓使用者在場景中漫遊。然而,當時的動作極度受限,幾乎僅相當於「拿著攝影機在靜態模型中走動」。

此次發布的 GWM Worlds 2 帶來了三大質的飛躍:

  1. 即時連續生成,沒有預設時長(No Preset Length):傳統 AI 影片算完 5 秒或 10 秒就結束,GWM Worlds 2 則是以串流方式運作。只要使用者持續給予操作輸入,世界就會一幀接一幀不斷演進,互動時間在理論上沒有上限。
  2. 影音聯合生成(Audio-Visual Co-generation):即時輸出 720p / 24 fps 視訊的同時,同步渲染 48,000 Hz(48 kHz)的高取樣率立體聲環境音、音效與角色對白,解決了過往生成式世界「只有畫面、沒有聲音」的抽離感。
  3. 突破離散動作,泛化至「任意動態動作」:這是執行長 Cristóbal Valenzuela 特別強調的技術分水嶺。過往的模型若要支援動作,必須在訓練時把按鍵綁死在特定動畫模板上;GWM Worlds 2 則能理解自由文字描述的各種動態,從細微的肢體手勢到劇烈的場景突變都能即時模擬。
規格與特點 傳統 AI 影片模型(如 Gen-4.5 / Sora) 前代 GWM Worlds(2025.12) GWM Worlds 2(2026.09)
輸出形式 固定長度預錄短片(5–10 秒) 簡短連續導航視訊 無長度限制的即時影音串流
互動性 無(算完才能觀看) 低(僅支援基礎視角轉動與前進) 極高(即時回應任意動作與相機操作)
畫面與音訊 1080p/4K 離線算圖,部分支援非即時音效 720p 視訊,無即時音訊 720p @ 24 fps 視訊 + 48 kHz 即時音訊
動作範圍 僅依文字 Prompt 離線演繹一次 固定離散導航(WASD 走動) 任意動態動作(跑步、攀爬、互動、對白、天氣)
核心用途 影視廣告、分鏡腳本、行銷短片 空間一致性概念驗證 即時遊戲、具身 AI 模擬、互動敘事

核心靈魂:WorldPrompt 如何定義虛擬世界?

要讓神經網路在幾十毫秒內即時運算「接下來該發生什麼事」,必須有一套極具擴展性、能跨情境通用的世界描述語言。Runway 在 GWM Worlds 2 中正式提出了名為 WorldPrompt 的雙層提示詞架構。

Runway 的核心洞察是:任何一個世界,都可以嚴格拆解為「不變的恆定狀態」與「隨時間改變的動態事件」

                    ┌────────────────────────────────────────────────────────┐
                    │                      WorldPrompt                       │
                    └───────────────────────────┬────────────────────────────┘
                                                │
                 ┌──────────────────────────────┴─────────────────────────────┐
                 ▼                                                           ▼
  ┌─────────────────────────────┐                             ┌─────────────────────────────┐
  │   恆定世界上下文 (Persistent)  │                             │   時間戳記事件流 (Timestamped)  │
  ├─────────────────────────────┤                             ├─────────────────────────────┤
  │ 1. Genesis Prompt (創世提示) │                             │ 1. 自由文字動作 (Actions)    │
  │    - 場景 (Scene) 環境與材質   │                             │    - 指定主體或全場景       │
  │    - 主體 (Subjects) 與外觀屬性│                             │    - 具起止時間、支援疊加   │
  │    - 法則 (Laws) 物理與視角規則│                             │ 2. 相機運動串流 (Camera)    │
  │ 2. First Frame (首幀視覺基準) │                             │    - 每幀平移與旋轉軌跡     │
  └─────────────────────────────┘                             └─────────────────────────────┘

1. 恆定世界上下文(Persistent World Context)

這是世界的「底層物理規格與初始條件」,在整個互動過程中保持恆定:

  • Genesis Prompt(創世提示詞)
    • 場景(Scene):詳細描繪環境佈局、地表材質、光影分佈與環境背景音(例如:鋪著紅磚的潮濕街道、秋季落葉、遠處雨聲)。
    • 主體(Subjects):列出世界中所有可能參與互動的角色或道具實體,精確定義其體型、衣著特徵與基本設定。
    • 法則(Laws):設定世界遵循的不可變規則,例如地球重力、碰撞特性、角色專屬能力上限,以及攝影機的預設視角(第一人稱或第三人稱追隨)。
  • First Frame(首幀錨點):提供一張起始影像,做為整個生成過程的幾何空間與視覺紋理錨點,確保生成不會一開始就憑空走樣。
WorldPrompt 街角交談起始首幀
WorldPrompt 以第一張畫面(First Frame)作為空間幾何與材質的視覺基準錨點。 圖片來源:Runway 官方研究公告

2. 時間戳記事件流(Timestamped Event Stream)

這是隨時間推進注入世界的「變量」,決定每一刻的動態變化:

  • 動作(Actions):採用自由自然語言描述,帶有精確的起始與結束時間戳記(例如 [2.5s - 5.0s]),並明確指向特定主體或場景本身。多個動作可以彼此疊加(例如角色一邊往前奔跑,一邊開槍,同時間場景的光線變暗)。
  • 相機運動(Camera Input):每幀傳送攝影機的平移(Translation)與旋轉(Rotation)數據,控制視角的動態推進。

官方示範案例:街角偶遇的 WorldPrompt 結構

在 Runway 公布的研究範例中,一段「清潔工與風衣女子在雨後街角交談」的場景被寫成如下的 WorldPrompt:

# 1. 恆定上下文 (Persistent Context)
Scene:
  An urban wet pavement lined with brick buildings, stone trim, and potted round bushes on the right. A wet asphalt road with yellow lines runs alongside the pavement. Reflections are visible on the wet ground, scattered with yellow autumn leaves.
Subjects:
  - The street sweeper: A slender male street sweeper with dark short hair, wearing an orange high-visibility vest over a grey sweatshirt, dark trousers, and dark boots. He holds a broom and a dustpan shovel, and speaks with a male voice. Located on the wet pavement to the left.
  - The woman in green trench coat: A slender woman with dark hair tied in a ponytail, wearing a green trench coat, dark pants, and black boots. She speaks with a female voice and walks down the wet pavement.
Law:
  Gravity behaves like Earth, causing leaves to lie flat on the wet pavement. The camera follows the woman in green trench coat in third-person view.

# 2. 時間戳記事件流 (Timestamped Events)
Events:
  - [0.0s - 3.0s] The woman in green trench coat walks forward down the pavement.
  - [2.0s - 4.5s] The street sweeper stops sweeping, looks up, and greets her saying "Good morning, cold day isn't it?".
  - [3.5s - 6.0s] The woman stops, turns her head toward the sweeper, and replies smilingly "Yes, winter is coming."
0:00
/0:00

官方 WorldPrompt 街角交談示範:角色動作、肢體手勢與即時對話口型合成。 影片來源:Runway 官方研究公告

藉由將世界明確拆解成「不變的舞台與規則」與「時間軸上的事件與鏡頭」,GWM Worlds 2 成功將原本難以捉摸的影音生成,轉化為具備嚴密邏輯的即時因果模擬。


技術底層:GWM Worlds 2 如何做到即時神經模擬?

要在使用者按下鍵盤的瞬間,立刻渲染出符合光影物理與動態慣性的下一張 720p 畫面與對應聲音,背後的計算複雜度極其驚人。Runway 在模型架構上結合了三項核心設計:

1. 自回歸擴散架構(Autoregressive Diffusion)

GWM Worlds 2 本質上是一個跨視訊與音訊的聯合自回歸擴散模型。在每一個自回歸步驟(生成當前影格與音訊切片)中,模型會同時受到三種不同層級的上下文約束:

  1. 全域上下文(Global Tokens):包括 Genesis Prompt 與 First Frame。全域 Token 擁有專屬的注意力通道,只關注自己,作為整個宇宙的絕對幾何與物理基準。
  2. 當前幀輸入(Current Frame Inputs):相機在這一幀的平移/旋轉座標,以及當前時間點處於啟動狀態的所有文字動作 Token。
  3. 歷史生成幀(Past Generated Frames):過去已經生成的連續幀,維持畫面的時序連續性與物體運動慣性。

2. 滑動視窗鍵值快取(Sliding KV-cache Window)

如果把過去每一秒算出的所有影格都保留在注意力矩陣中,計算量會隨時間呈幾何級數爆炸,任何伺服器都會在幾十秒內記憶體耗盡(OOM)。

GWM Worlds 2 採用了**滑動視窗鍵值快取(Sliding KV-cache Window)**機制。模型只保留最近一段時間內的畫面與音訊 Token 進行因果注意力(Causal Attention)運算,一旦影格超過視窗上限便自動逐出(Evict)。配合帶有內建快取的因果音畫解碼器(Causal Decoders),成功將生成延遲壓低至可即時互動的門檻。

3. WebRTC 串流與多角色架構(LiveKit 整合)

在傳輸層,Runway 沒有採用傳統影片播放的 HLS/DASH 協議(延遲通常長達 2~6 秒),而是基於開源 WebRTC 框架 LiveKit 搭建了專屬的低延遲串流通道。

這項架構賦予了 GWM Worlds 2 原生的多角色(Multi-role)多人協作能力。因為 WorldPrompt 本身具備獨立的「Subjects」概念,系統可以將不同主體的控制權分別指派給不同連線的使用者:

  • Player 1:控制主角的走位、動作與對白。
  • Player 2:控制同行夥伴或對手的行動。
  • Director(世界導演):由第三位玩家擔任,專門對場景下指令,例如即時將夕陽轉為繁星夜空、召喚沙塵暴、或是讓營火突然暴漲。
0:00
/0:00

荒漠倖存者雙角色協作:玩家以第一人稱探索,導演同時向場景下達天氣指令讓夕陽轉為星夜。 影片來源:Runway 官方研究公告


三種使用模式:AI 影視、互動遊戲與多人世界

Runway 針對不同的應用場景,規劃了三種使用 GWM Worlds 2 的方式:

1. 預先編排模式(Ahead-of-Time):影視製作與虛擬製片

創作者或導演在生成前,先用文字(或請大型語言模型 LLM 協助)撰寫好整段時間戳記事件流,再交由 GWM Worlds 2 一次性渲染完整影片與聲音。

  • 優點品質與細節最完美。因為模型在運算前就知道整個鏡頭的運動軌跡與環境轉變,能為後續即將出現的物體提前做好光影過渡。
  • 適用場景:電影分鏡預演、概念預告片、虛擬製片。

2. 回合決策模式(Turn-Based):分支敘事與互動電影

系統持續生成動態畫面,直到故事推進到玩家需要做出選擇的「決策點」時暫停。玩家挑選分支或輸入下一步行動後,LLM 自動將玩家意圖轉譯為 WorldPrompt 事件流,模型隨即恢復生成,推演相應的劇情後果。

  • 優點:兼顧了自由互動與高水準敘事,不會因為打字速度慢而中斷體驗。
  • 適用場景:生成式視覺小說(Visual Novels)、互動式懸疑冒險遊戲、情境式法律/商業談判培訓。

3. 即時操控模式(Real-Time):無引擎生成的純神經遊戲

這是技術難度最高的模式。伺服器以 24 fps 的速度連續不斷推流,玩家以毫秒級延遲操作角色在世界中探索。

由於人類不可能在一瞬間打完一段描述性文字,Runway 在實測 Demo 中設計了**「鍵盤/滑鼠按鍵綁定預設 Action Prompts」**的方案:

  • 按下 W:觸發底層提示詞「角色邁步向前奔馳」。
  • 點擊滑鼠左鍵:觸發「角色向前揮舞長矛」或「發射雷射手槍」。
  • 移動滑鼠:直接驅動相機視角(Camera stream)的水平與垂直旋轉。
Runway World Authoring 按鍵動作綁定介面
在即時遊戲展示中,自然語言動作提示詞被直接映射綁定至鍵盤與滑鼠按鍵。 圖片來源:Runway 官方研究公告
0:00
/0:00

即時神經遊戲示範:玩家以鍵盤滑鼠直接在暴風雪中操控第三人稱越野車。 影片來源:Runway 官方研究公告

更令人驚艷的是 World Authoring(LLM 世界創世流程)。玩家只要輸入一句白話:「在暴風雪覆蓋的荒山中騎乘越野機車」,內建的 AI 助手會在數秒內自動生成第一張畫面(First frame)、撰寫好完整的 Genesis Prompt,並自動把油門、剎車與轉彎動作綁定到鍵盤上,實現**「一句話生成一個能玩的世界」**。


深度比較:傳統遊戲引擎 vs. 離線 AI 影片 vs. GWM Worlds 2

為了更清晰地看懂 GWM Worlds 2 的產業定位,我們將它與傳統 3D 遊戲引擎(如 Unreal Engine 5 / Unity)以及傳統離線 AI 影片模型(如 Gen-4.5 / Sora)進行維度對比:

評比維度 傳統 3D 遊戲引擎(UE5 / Unity) 離線 AI 影片模型(Gen-4.5 / Sora) GWM Worlds 2
生成本質 幾何管線:多邊形網格(Mesh)、貼圖、光柵化/光線追蹤 像素擴散:從雜訊逐步去噪生成的像素影像 神經模擬:基於因果條件約束的連續自回歸像素與音訊串流
資產製作成本 極高(需 3D 建模師、骨架綁定、物理碰撞體、材質貼圖) 零 3D 資產(僅需文字或參考圖 Prompt) 零 3D 資產(以自然語言 Genesis Prompt + 首幀定義世界)
動作靈活性 受限於事先設計好的動畫骨架與程式狀態機 豐富但不可控,每次隨機生成且無法即時互動 極高,可泛化至任意未預先設定的動態動作與對話
即時互動能力 毫秒級極低延遲,確定性反應 無法互動,需等待數分鐘完成離線渲染 具備即時互動能力(720p @ 24 fps 連續串流)
物理與因果規律 精確數值模擬(剛體、布料、流體),結果可重現 粗糙近似,常出現穿模、物體憑空消失等物理邏輯錯誤 神經物理模擬(透過 Laws 約束),宏觀物理自然但存在微觀漂移
長程一致性 絕對一致(地圖與模型存於硬碟,回頭看永遠不變) 僅限單一鏡頭內的短暫一致 中等(依賴滑動視窗 KV-cache,長時間或大角度轉頭會產生漂移)
運算成本結構 算力消耗於用戶端 GPU(對伺服器頻寬需求低) 算力消耗於雲端叢集(離線計費,單次算圖成本高) 高度依賴雲端推論叢集與低延遲影音串流頻寬

應用前景:不只是做遊戲,更是具身智慧(Embodied AI)的訓練場

如果把 GWM Worlds 2 僅僅當成「低解析度的雲端遊戲原型」,那就嚴重低估了世界模型的戰略價值。Runway 這項突破最深遠的影響,可能發生在以下三個維度:

1. 無限邊界的新型互動娛樂

傳統開放世界遊戲(如《俠盜獵車手》或《薩爾達傳說》)受限於開發成本,再龐大的地圖終究有邊界,NPC 翻來覆去也只有幾十句台詞。

在 GWM Worlds 2 的架構下,玩家面對的是一個能隨對話即時生成反應的生動角色。NPC 的口型、語調與動作完全由對話內容即時驅動;如果玩家突然決定放火燒掉眼前的森林,世界模型不需要工程師事先寫好燃燒物理代碼,就能自然推演出濃煙瀰漫、樹木碳化倒塌的連鎖反應。

2. 機器人與具身智慧(Embodied AI)的離線策略評估

在人工智慧領域,訓練實體機器人(Humanoid Robots)最大的瓶頸是**「真實世界的數據採集太慢、且容易損壞昂貴硬體」**。若在傳統物理引擎(如 Isaac Sim、MuJoCo)中訓練,又往往面臨「模擬到真實的鴻溝(Sim-to-Real Gap)」,因為手工建置的數位世界缺乏真實世界的材質多樣性與光學雜訊。

Runway 在研究報告中明確提及,GWM Worlds 2 可作為**機器人離線策略評估(Offline Robot Policy Evaluation)**的理想環境。世界模型能生成帶有真實世界複雜光影、微小摩擦力與各類突發物理干擾的模擬場景,讓自動駕駛或機器手臂在數百萬個虛擬神經世界中同時試錯,極大加速具身智慧的進化速度。

3. 虛擬製片中的即時導播與共創

導演不需要再面對昂貴的綠幕或耗時數月的後期特效。透過 GWM Worlds 2 的 Ahead-of-Time 與 Director 模式,影視團隊可以在前期策劃階段,像玩遊戲一樣由演員即時走位、導演即時切換天氣與攝影機運動,以極低成本快速驗證複雜分鏡的戲劇張力。


局限性與未解挑戰:現在能取代 Unreal 引擎嗎?

儘管 GWM Worlds 2 展現了令人興奮的未來圖像,但 Runway 在官方論文與公告中表現得相當坦率,主動揭露了多項技術瓶頸。我們絕不能將其視為已經成熟可商用的遊戲引擎替代品:

1. 速度與畫質的殘酷取捨(720p 天花板)

為了保證 24 fps 的即時反應,模型必須犧牲去噪步數與參數量。當前 GWM Worlds 2 的輸出解析度僅達 720p,細節紋理與遠景依然帶有明顯的神經網路模糊感,與當前 AAA 遊戲引擎動輒 4K HDR、奈米級幾何體(Nanite)與全局光照(Lumen)的細膩程度仍有巨大差距。

2. 幾何與材質的漂移現象(Drift)

這是所有自回歸世界模型不可避免的宿命。隨著玩家操控時間拉長,尤其是在相機快速旋轉、視角大範圍晃動時,場景中的物件幾何特徵會逐漸「漂移」——例如原本方形的岩石可能在轉身幾次後變成了圓形,建築物上的窗戶數量可能無聲無息地增減。

3. 缺乏長程記憶錨點(Long-term Consistency)

由於滑動窗口 KV-cache 的容量限制,模型只能保留有限秒數的歷史幀作為因果參考。目前系統除了第一張圖片(First frame)外,無法引入額外的長期圖像記憶庫。這意味著如果玩家離開一座村莊走入森林,三十分鐘後再走回原處,神經網路幾乎無法還原出完全相同的村莊佈局。這對於需要長期存檔、任務推進與精確探索的 RPG 遊戲來說,是致命的硬傷。

4. 即時調度中樞(Real-time Harness)的依賴

自由文字雖然提供了無限的控制彈性,但在即時互動中,人類很難一邊操作一邊輸入 Prompt。要打造真正生動的虛擬世界,背後必須搭配一套高吞吐、毫秒級響應的外部調度系統(Real-time Harness),即時監控世界狀態並代為生成動作指令。這套輔助系統的複雜度與運算成本,絕不亞於世界模型本身。


Runway 的世界模型雙軌戰略:Solaris + GWM Worlds 2

將 GWM Worlds 2 放在更大的時間維度中觀察,會發現這絕非孤立的發布。就在兩天前的 2026 年 9 月 1 日,Runway 才剛剛發布了另一款重磅產品——Solaris(介面世界模型,Interface World Model)

這揭示了 Runway 極具野心的**「世界模型雙軌戰略」**:

  • Solaris(2D 數位介面維度):將電腦螢幕與軟體介面視為世界,使用者透過滑鼠點擊與拖曳與其互動,AI 直接即時生成下一個介面狀態,旨在跳過前端工程代碼(HTML/CSS/JS)
  • GWM Worlds 2(3D 物理空間維度):將自然世界與物理遊戲視為世界,使用者透過按鍵與相機操作與其互動,AI 直接即時生成下一幀空間影音,旨在跳過 3D 遊戲引擎資產管線(Mesh/Texture/Physics)

從「生成一段好看的影片」到「生成一個能點擊的軟體介面」,再到「生成一個能親身走入的動態宇宙」,Runway 正在試圖用神經網路渲染(Neural Rendering)逐步吃掉過去數十年由程式碼、編譯器與渲染引擎所築起的數位高牆。


Runway GWM Worlds 2 常見問題(FAQ)

Q1:GWM Worlds 2 現在開放給所有人使用了嗎?

截至 2026 年 9 月,GWM Worlds 2 仍處於研究預覽(Research Preview)階段。Runway 尚未開放大眾公開註冊或測試,目前主要透過官方技術展示與特定學術、工業合作夥伴進行驗證。有興趣的開發者可密切關注 Runway 官方 Research 專頁的更新。

Q2:GWM Worlds 2 算是一種新型遊戲引擎嗎?

廣義來說,它的終端效果確實實現了遊戲引擎的「即時互動體驗」;但在底層原理上,它與傳統遊戲引擎完全相反。傳統引擎依賴精確的幾何數學、物理模擬器與著色器;GWM Worlds 2 則完全是透過深度學習神經網路對海量影音資料的理解,以「像素預測」的方式模擬出因果關係。

Q3:它和 OpenAI Sora 或 Runway 自己的 Gen-4.5 有何不同?

Gen-4.5 與 Sora 是「離線影片生成模型」,目標是以極高的算力追求單次幾秒鐘的高畫質成品,生成後無法更改;GWM Worlds 2 是「即時世界模型」,優先追求低延遲串流(24 fps)與使用者動作的即時連續反饋,具有沒有長度上限的互動性。

Q4:既然支援自由文字動作,玩遊戲時真的需要邊玩邊打字嗎?

不需要。在官方的 Real-Time 模式示範中,常用的動作指令已被預先綁定在鍵盤與滑鼠上(例如 W 鍵對應前進、滑鼠左鍵對應攻擊或拋擲),相機視角則由滑鼠直接平滑控制。只有在 Ahead-of-Time 導演模式或特定 NPC 對話時,才需要詳細編寫文字事件。

Q5:它最大的商業化挑戰是什麼?

第一是運算成本與延遲:720p @ 24 fps 的連續擴散去噪推論需要極為龐大的雲端 GPU 叢集支撐,商業化推向數百萬大眾玩家時的伺服器成本十分高昂;第二是物理邏輯的嚴密性:遊戲或模擬絕不能接受走一走鑰匙突然消失、或是牆壁突然軟化的漂移瑕疵,長程一致性仍有待技術突破。


資料來源與延伸閱讀