NVIDIA Alpamayo 2 Super 是什麼?自駕開放模型可商用,離 Robotaxi 上路還差什麼?

Alpamayo 2 Super 開放商用,能分析多鏡頭路況、解釋決策並預測軌跡。但它仍不是可直接控制 Robotaxi 的完整系統。

Share
NVIDIA Alpamayo 2 Super 自動駕駛開放模型封面
NVIDIA 在 2026 年 8 月 4 日正式釋出 Alpamayo 2 Super,並採用可商用的 OpenMDW-1.1 授權。 圖片來源:https://blogs.nvidia.com/blog/alpamayo-2-super-open-model-now-available/

NVIDIA 在 2026 年 8 月 4 日正式釋出 Alpamayo 2 Super。這是一款為 Robotaxi 與自動駕駛研發設計的開放模型,能讀取車輛周圍的多鏡頭畫面,解釋路況、預測行車軌跡,還能輸出「讓車、變換車道、停車」等高階意圖。

真正重要的變化不是模型又變大了,而是它開始採用可商用的 OpenMDW-1.1 授權。車廠與自駕供應商可以下載模型、用自有車隊資料微調,甚至散布衍生模型,不必再把 Alpamayo 只當成研究展示。

但「可以商用」不等於「可以直接開車上路」。Alpamayo 2 Super 比較像放在雲端協助訓練、標註與驗證的高階教練,量產車上仍需要更小的車載模型、完整感測器、安全備援、實車測試與法規驗證。這個界線,才是理解這次發布的關鍵。

Alpamayo 2 Super 是什麼?

Alpamayo 2 Super 是一款視覺—語言—動作模型(Vision-Language-Action,VLA)。白話來說,它不只辨識畫面中有沒有行人或車輛,還要理解不同道路參與者的關係,說明下一步應該做什麼,最後產生車輛可採用的候選路徑。

NVIDIA 的 Model Card 將它稱為約 34B 參數模型。其核心由 32B 參數的 Cosmos 3 Super Reasoner 視覺語言骨幹,加上約 2.3B 參數的動作專家組成。因此,官方新聞稿提到的「32B」主要指負責看懂畫面與推理的骨幹,不是整套模型的總規模。

公開使用範例會同時讀取六個鏡頭、每個鏡頭四個歷史影格,再加入文字指令與車輛自身的移動紀錄。模型可以在同一次分析中產生五類結果:

  1. 車輛未來 6.4 秒的候選行駛軌跡,共 64 個路徑點。
  2. 因果鏈(Chain of Causation,CoC)說明,用文字交代模型看到什麼,以及為何選擇這個動作。
  3. 讓車、變換車道或停車等 Meta-Action,也就是供後續規劃系統使用的高階駕駛意圖。
  4. 可加入訓練資料的自動推理標註。
  5. 具備 2D 定位的視覺問答,回答時能指出影像中的對應區域。

這些輸出讓開發者可以把「模型看到的線索、說出的理由與規劃的路徑」放在一起檢查。它比只回傳方向盤角度的黑盒系統更容易除錯,但 CoC 仍是模型生成的解釋,不是模型內部因果過程的數學證明,也不能單靠一段合理文字證明決策安全。

NVIDIA 官方介紹 Alpamayo 2 Super 的多鏡頭推理、軌跡預測與自動駕駛開發用途。影片來源:NVIDIA 官方 YouTube。 前往 YouTube 觀看

為什麼可商用授權比參數增加更重要?

先前 Alpamayo 版本最初以研究與開發用途為主。這次 Alpamayo 2 Super 的模型權重採用 OpenMDW-1.1,NVIDIA 也表示會把這套授權套用到整個 Alpamayo 模型家族。

OpenMDW-1.1 允許使用者免費使用、修改與散布模型材料,也沒有另外限制模型輸出的使用方式。若散布原始或修改後的模型材料,使用者仍須保留授權全文、著作權與來源聲明。授權同時明確表示模型按現況提供,不保證正確、安全或適合特定用途。

對車廠來說,這會直接改變研發選項。團隊可以把模型放進自己的雲端環境,用不便交給外部服務的車隊影片微調,並保留由專有資料累積出的模型與工程經驗。相較每次都呼叫封閉 API,開放權重也更容易控制成本、版本與資料流向。

這也是我對這次發布偏正面的主要原因。模型能力仍需驗證,但商用授權把 Alpamayo 從「可參考的研究成果」推進成「企業可以正式納入技術選型的基礎元件」。不過,授權只解決法律上的使用入口,沒有替任何車輛通過安全認證。

它如何從雲端走進車內?關鍵是模型蒸餾

Alpamayo 2 Super 並不是為了原封不動裝進每輛車。NVIDIA 公開量測使用一張 H100 80GB GPU,在七鏡頭、每鏡頭四個影格的條件下,裝置記憶體峰值約 72,115 MiB。這樣的需求更接近資料中心,不是一般量產車會配置的運算環境。

較實際的做法是讓 Alpamayo 2 Super 擔任「教師模型」。它先在雲端分析大量車隊影片,產生高品質的軌跡、推理說明與標註,再透過模型蒸餾,把大模型學到的行為轉移給較小、反應更快的車載模型。蒸餾的目的,就是讓小模型模仿大模型的重要能力,同時降低推論所需的記憶體與運算量。

這套「雲端大模型訓練、車內小模型執行」的架構,比把 34B 模型直接塞進車內合理得多。對 NVIDIA 而言,它也把資料中心 GPU、自駕開發工具與車載運算平台串成同一條工作流程。這是具戰略意義的平台布局,但 NVIDIA 尚未提供 Alpamayo 2 Super 帶來的獨立營收數字,所以目前較適合視為生態系利多,而不是能立即量化的財務成長來源。

Alpamayo 2 Super 的 benchmark 成績怎麼看?

NVIDIA 公布的成績顯示,Alpamayo 2 Super 在語言推理、模擬駕駛與軌跡預測三類測試中都有進展。不過,每一項分數回答的是不同問題,不能把它們合併解讀成「自駕安全率」。

測試 官方結果 代表什麼
LingoQA/Lingo-Judge 79.2 衡量模型對自駕影片問答的正確程度,偏向場景理解與語言推理。
AlpaSim 閉環測試 1.50 ± 0.13,共 910 個情境 觀察模型在模擬器連續駕駛時,前一步操作如何影響後續路況。
開環軌跡預測 minADE_6 = 0.911 公尺,共 937 個困難樣本 從六條候選軌跡中取最佳一條,計算 6.4 秒內的平均位移誤差。

在 NVIDIA 使用 Lingo-Judge 的測試中,Alpamayo 2 Super 在近 40 個模型裡排名第一,分別領先 Qwen2.5-VL 72B 17.0 分、Gemini 2.5 Pro 15.1 分、GPT-4o 23.2 分。這表示通用多模態模型看得懂圖片與文字,不代表它們已針對駕駛情境做過同等程度的訓練。

Alpamayo 2 Super 多任務自動駕駛 benchmark 結果
NVIDIA 公布的多任務 benchmark 涵蓋推理、閉環駕駛與開環軌跡預測,三者不能直接合併成道路安全率。圖片來源:NVIDIA 官方 Model Card。 查看官方來源

這組數字有參考價值,但仍有兩個限制。第一,主要比較由 NVIDIA 公布,還需要第三方以相同設定重現。第二,LingoQA 測的是問答,AlpaSim 測的是模擬環境,minADE 測的是候選軌跡誤差;它們都不是實際道路的事故率、接管率或法規認證。

因此,我會把 benchmark 解讀為「值得進入車廠評估清單」,而不是「已經證明可以無人上路」。若後續第三方閉環測試或不同城市的實車資料無法重現改善,這個正面判斷就需要下修。

官方示範模型如何整合車輛周圍畫面、說明駕駛決策並產生候選路徑。影片來源:NVIDIA 官方 YouTube。 前往 YouTube 觀看

115,000 小時影片與 370 萬筆推理標註,解決的是長尾情境

一般道路上的直行、跟車與紅燈停車並不是自駕最難的部分。真正棘手的是低頻但高風險的長尾情境,例如行人突然穿越、車輛從視線死角切入、無保護左轉,或多個道路使用者同時互相試探。

根據 Model Card,Alpamayo 2 Super 使用約 115,000 小時的多鏡頭駕駛影片,以及約 370 萬筆 CoC 推理說明進行訓練。模型也從只看前方擴充為能整合車頭、車側與車尾畫面,讓變換車道、匯入車流和複雜路口判斷有更完整的上下文。

它還能在車隊影片上自動產生推理標註,並用 2D grounding 指出答案對應到畫面哪個位置。NVIDIA 表示,這類自動標註可把部分資料整理週期從數月縮短到數天。這是很有吸引力的效率主張,但官方沒有在 Model Card 提供跨團隊、跨資料集的工時對照,因此較合理的看法是:它有機會大幅減少人工初標,最後仍需要人員抽查與安全驗證。

AlpaSim 與 AlpaGym,補上只看錄影資料的盲點

如果模型只用既有影片學習,它看到的是人類駕駛已經做完的結果,無法真正承受自己錯誤操作造成的後果。這叫做開環訓練:模型提出答案後,環境不會因為它的煞車或轉向而改變。

AlpaSim 是 NVIDIA 的開放自駕模擬器,能讓車輛在模擬環境中連續行駛。AlpaGym 則把強化學習接進 AlpaSim,讓模型根據碰撞、偏離道路、行車舒適度與前進進度等結果調整行為。這種閉環訓練會讓每次操作改變下一刻的路況,因此更容易暴露小錯誤連續累積後的失控情形。

AlpaGym 使用 AlpaSim 閉環模擬訓練自駕模型的流程
每次煞車、轉向與導航決策都會改變下一個模擬狀態,讓模型從連續後果中學習。圖片來源:NVIDIA Technical Blog。 查看官方來源

Alpamayo 2 Super、AlpaSim、AlpaGym、Physical AI 資料集與訓練 recipes 合在一起,才構成較完整的開發平台。單一模型負責能力,模擬器負責反覆測試,訓練框架負責把結果轉回模型更新。NVIDIA 公布 Alpamayo 系列在 Hugging Face 的累計下載量已超過 500,000 次,代表開發者關注度高,但下載並不等於已有 500,000 個商用部署。

距離真正的 Robotaxi 上路,還差哪些環節?

Alpamayo 2 Super 最大的誤讀風險,是把「自駕基礎模型」當成「完整自駕車系統」。兩者之間至少還隔著四層工作。

1. 它不是完整的感測器與安全備援系統

公開 Model Card 列出的直接輸入是相機影像、文字與車輛移動紀錄,沒有把 LiDAR 或雷達列為這個模型的直接輸入。真正的量產 Robotaxi 還需要感測器校正、定位、車輛控制、故障偵測、備援煞車與通訊安全等模組。

2. 可解釋輸出不等於安全認證

CoC 能幫助工程師追查模型為何做出某個決定,也能接入 NVIDIA Halos 的安全驗證流程。ISO/PAS 8800:2024 則提供道路車輛 AI 的安全工程框架,關注模型輸出不足、系統性錯誤與硬體隨機錯誤造成的風險。模型輸出符合某種檢查格式,和整輛車通過標準要求,是兩件不同的事。

3. 模擬表現仍要經過實車驗證

模擬器能快速重播危險情境,也能測試現實中不適合反覆製造的事故條件,但它無法完整還原所有天候、道路材質、感測器老化與人類行為。Model Card 也明確要求使用者以特定用途資料做額外測試,並在單元與系統層級反覆驗證。

4. 34B 模型需要轉成車載版本

目前公開測試以 H100 80GB 為主,其他 GPU 架構尚未由 NVIDIA 驗證。車廠必須蒸餾、量化或重新訓練較小模型,再確認它在有限功耗與毫秒級反應時間下仍能維持能力。這段工程如果做不好,雲端 benchmark 再高也無法轉成道路表現。

誰值得關注 Alpamayo 2 Super?

對自駕車廠、Robotaxi 業者、卡車公司與 Tier 1 汽車供應商來說,Alpamayo 2 Super 值得評估。它提供可下載、可修改、可商用的起點,適合用來建立自動標註、場景問答、模型評測與蒸餾流程,尤其適合本來就握有大量車隊資料的團隊。

對大學研究室而言,開放模型、資料、模擬器與訓練 recipes 能降低重建整套研究環境的門檻。不過,H100 80GB 等級的需求仍然不低,實際使用可能需要學校叢集或雲端 GPU 預算。

對一般 AI 開發者與消費者來說,這不是可以安裝在私家車上的 App,也不是個人電腦就能輕鬆執行的模型。它帶來的影響會先出現在車廠研發速度、資料標註成本與供應商選擇,最後才有機會反映在量產車功能上。

結論:這是自駕開發平台的進展,不是 Robotaxi 已完成

Alpamayo 2 Super 最值得注意的地方,是 NVIDIA 把約 34B 參數的多任務自駕模型、可商用授權與完整開發生態系接在一起。車廠不必從零訓練所有基礎能力,也能用自己的資料建立差異化模型,這會加速自駕 AI 從研究走向產品開發。

我的結論是中性偏多。商用授權與多任務能力是真正的進展,NVIDIA 也進一步把資料中心 GPU、模擬訓練與車載平台串成同一套產品路徑。但現有證據主要證明「模型值得測試」,還沒有證明「Robotaxi 已能安全大規模上路」。下一步最重要的不是再看一張榜單,而是第三方能否重現閉環成績,以及車廠能否把大模型的能力穩定蒸餾到量產車上。

Alpamayo 2 Super FAQ

Alpamayo 2 Super 可以免費商用嗎?

模型權重採 OpenMDW-1.1,可免費使用、修改與商業散布。散布模型材料時仍要保留授權、著作權與來源聲明,而且使用者要自行處理資料權利、安全驗證與法規責任。原始碼則採 Apache License 2.0。

Alpamayo 2 Super 是 32B 還是 34B 模型?

兩個數字指的範圍不同。32B 是 Cosmos 3 Super Reasoner 的視覺語言骨幹,另有約 2.3B 的動作專家;Model Card 因此把整體稱為約 34B 模型。

Alpamayo 2 Super 能直接控制 Robotaxi 嗎?

不能把公開模型直接視為完整 Robotaxi 系統。它主要用於雲端的場景理解、軌跡預測、資料標註、評測與模型蒸餾,真正上車還需要小型化、感測器整合、安全備援、封閉場域與實車驗證。

一般電腦可以執行 Alpamayo 2 Super 嗎?

不適合。NVIDIA 公開驗證使用一張 H100 80GB GPU,測得裝置記憶體峰值約 72,115 MiB,其他 GPU 架構尚未由官方驗證。一般使用者較適合觀看示範與研究成果,而不是在消費級電腦上直接部署。

資料來源

Read more

Gemini Notebook 迎來大更新,每個筆記本搭一台雲端電腦?

Gemini Notebook 迎來大更新,每個筆記本搭一台雲端電腦?

上週我們開始今年的讀者調查,雖然離結束還有兩週的時間,但我們真的很好奇大家的答案,所以就偷看了一下 XD 有位在製造業擔任工程師的讀者分享,我覺得他的比喻很妙: 主管們都認為用 AI 可以減少開發時間,其實不然,反而增加了開發時間,因為很多事一直冒出來,而時間沒有被增加,原因是你被認定有 AI 助手,這跟人月神話有異曲同工之妙。聽過一句最寫實的話,再怎麼會生小孩,也是需要 10 個月才能誕生阿。 我非常認同,對於需要精密打磨的任務,十個 AI 助手也沒辦法改變「磨」這件事,就跟十個女人沒辦法一個月生出小孩一樣。而這也呼應目前的調查上,目前有 44.3% 的讀者用了 AI 之後工作量不減反增,真正省下的時間,很少變成「輕鬆」,而是被重新排進更多任務裡。管理者把 AI 當成人力乘數,但乘出來的常常不是產出,而是期待。 目前已經有 300+ 位讀者留下了自己的答案,

lock-1
Nuuly 用 AI 重新定義服裝租賃!包裹被快遞掃描的那一秒,解鎖下一輪穿搭

Nuuly 用 AI 重新定義服裝租賃!包裹被快遞掃描的那一秒,解鎖下一輪穿搭

Nuuly 是 URBN 集團(旗下擁有 Urban Outfitters、Anthropologie)旗下的訂閱制服裝租賃平台,月費 98 美元可租借六件衣服,目前已成長為北美最大的訂閱制時尚租賃服務之一。 Nuuly 透過即時物流數據和 AI 驅動的跨通路行銷系統,把每一個實體物流節點——包裹送達、歸還掃描——轉化成個人化的數位互動觸發點,並用 AI 預測訂閱者的流失風險,在取消訂閱行為發生前主動介入。