NVIDIA Open Agent Safety Platform 是什麼?OpenShell、Sentry 如何防止 AI Agent 越權

NVIDIA 推出 Open Agent Safety Platform,以 OpenShell 限制代理權限,並用 Sentry 與 BlueField-4 增加獨立監控。本文整理原理、限制與投資意義。

Share
NVIDIA OpenShell 以多層安全控制保護多個 AI Agent 的官方示意圖
NVIDIA OpenShell 透過分層控制限制 AI Agent 的執行權限。圖片來源:NVIDIA Technical Blog。

AI Agent 不只會回答問題,還能讀檔案、執行程式、呼叫外部服務,甚至代表使用者修改資料。能力愈完整,代理做錯事時的影響也愈大。

NVIDIA 在 2026 年 9 月 28 日發表 Open Agent Safety Platform,嘗試把安全規則放到 AI 代理碰不到的位置強制執行。平台包含開源執行環境 OpenShell,以及在 BlueField-4 晶片上提供獨立監控的 Sentry 參考系統設計。

「超過 100 家合作夥伴」很吸睛,真正重要的卻是安全思路的改變:除了要求模型聽話,系統也會限制它實際能碰到的檔案、憑證、網路與工具。這個方向有實質價值,但它仍不是防止 AI 失控的萬靈丹。政策寫錯、整合不完整或監控盲區,依然可能留下繞過路徑。

NVIDIA Open Agent Safety Platform 發表了什麼?

NVIDIA 正式公告把這套平台分成兩個核心元件:

元件 白話角色 主要工作 目前狀態
NVIDIA OpenShell AI 代理的安全工作間 把代理放進隔離環境,限制檔案、程序、網路與憑證權限 開源軟體,已可取得
NVIDIA Sentry 工作間外的獨立警衛 從 BlueField-4 上監看代理活動,執行身分與存取政策,必要時隔離代理 參考系統設計,可選的額外安全層

OpenShell 是基礎層。企業可以先在一般支援環境中部署,不必購買 BlueField-4。若需要在主機之外再加一道監控與隔離,才搭配 Sentry 與 BlueField-4。

這個差別很重要。OpenShell 已經可以從 GitHub 與 NVIDIA 文件取得,Sentry 則不能直接等同一套已普及的現成產品。NVIDIA 也在新聞稿中提醒,多項功能仍處於不同開發階段,實際供應內容與時間可能改變。

為什麼只靠模型的安全護欄不夠?

模型護欄主要影響 AI「想做什麼」與「願不願意做」,執行環境的權限則決定它「做不做得到」。兩者解決的問題並不相同。

假設一個程式開發代理收到「找出錯誤並修好」的任務。它可能需要讀取程式碼、搜尋網路、執行測試,還要向 GitHub 提交修改。若只在提示詞寫上「不要碰正式資料」,代理仍然持有可寫入正式系統的憑證,那條規則就只是指示,不是技術邊界。

OpenShell 的做法,是把代理放進沙盒。沙盒可以理解成一間與外部隔離的工作室,代理只能使用被開放的門、工具與資料。即使代理產生新的程式、啟動子程序或改用另一套工具,底層規則仍會繼續執行。

這讓企業能把模糊的「請小心」改成可檢查的限制,例如只准讀取某個資料夾、只准連到指定網站,或允許讀取 GitHub 資料但禁止寫入。

OpenShell 怎麼限制 AI Agent?

OpenShell 把控制拆成三個主要部分。Gateway 管理多個沙盒與政策。Sandbox 執行代理工作,並用作業系統核心限制檔案與程序。Supervisor 位在代理工作負載之外,檢查所有對外連線。

OpenShell Gateway 管理多個 AI Agent 沙盒與安全政策的官方架構圖
OpenShell Gateway 可集中管理多個代理沙盒與政策,代理則在彼此隔離的環境中執行。圖片來源:NVIDIA OpenShell 技術文章。

對一般使用者來說,不必記住所有元件名稱,只要理解四種可控制的權限:

  1. 檔案權限:代理可以讀哪些資料夾,又能修改哪些檔案。
  2. 程序權限:代理以低權限身分運行,不能任意提升系統權限。
  3. 網路權限:每個對外連線都要符合指定的網站、連接埠、程式與操作規則。
  4. 憑證權限:API key 是程式串接外部服務時使用的登入密鑰。OpenShell 把真實密鑰保留在代理工作負載之外,只在請求前往核准的服務時才加入。

最後一項尤其實用。傳統做法常把 API key 放進環境變數,代理或它產生的程式可能直接讀到。OpenShell 會讓代理只看到替代用的識別值,真正的憑證由外部代理層在通過政策後加入。就算代理把替代值送往其他網站,也拿不到可用的真實密鑰。

OpenShell 以替代識別值隱藏真實 API key,通過政策後才由外部代理層加入憑證
代理只看到替代值,真實憑證由沙盒外的 Supervisor 與 Proxy 在政策允許時加入。圖片來源:NVIDIA OpenShell 技術文章。

NVIDIA 的技術範例還展示了更細的控制。同一個 GitHub API 可以允許讀取、拒絕寫入,而不是只有「整個 GitHub 能用或不能用」兩種選擇。代理若需要新增權限,可以提出申請,但預設不能自己核准自己的要求。

Sentry 與 BlueField-4 多做了哪一層保護?

如果 OpenShell 是門禁規則,Sentry 就像不在同一間辦公室裡的警衛。它運行在 BlueField-4 DPU 上,從主機與代理工作負載之外觀察請求、回應、身分與資料存取。

DPU 是資料處理器,負責網路、儲存與安全等基礎設施工作。把 Sentry 放在獨立 DPU 的用意,是避免所有控制都跟代理放在同一台主機上。即使主機系統被攻破,外部硬體層仍可能保留觀察與隔離能力。

NVIDIA Open Agent Safety Platform 由 OpenShell、Sentry 與 BlueField-4 組成的官方架構圖
OpenShell 提供軟體沙盒,Sentry 與 BlueField-4 則從主機外加入獨立的監控與隔離層。圖片來源:NVIDIA Sentry 技術文章。

NVIDIA 產品頁表示,Sentry 會透過 DOCA 軟體檢查代理的請求與回應、驗證代理身分,並對資料、工具與 API 執行零信任政策。零信任不是把所有東西都封鎖,而是每次存取都要驗證,只開放完成任務所需的最小權限。

NVIDIA 宣稱,代理若跨出軟體邊界,Sentry 可在毫秒內隔離並停止它。這項能力的價值很清楚,但目前公開證據主要來自供應商自己的公告與技術文章。尚未看到同日發布的獨立攻防測試,能證明它在不同企業環境中都能達到相同結果。

OpenShell 與 Sentry 實際如何合作?

以讀取程式碼並提交修正的代理為例,整個流程可以這樣理解:

  1. OpenShell 先把代理放進沙盒,只開放指定專案資料夾。
  2. 代理連到模型或 GitHub 時,Supervisor 檢查目的地、使用的程式與請求類型。
  3. 只有通過政策的請求,才會在代理外部取得需要的憑證並送出。
  4. Sentry 從 BlueField-4 的獨立環境持續觀察活動,把身分、政策決策與資料存取串成紀錄。
  5. 若行為跨越設定邊界,軟體層先拒絕請求,硬體層則可再提供隔離與停止能力。

NVIDIA Technical Blog 內嵌的 OpenShell 自主代理設定示範;影片用於操作流程說明,不代表獨立效能測試。查看官方技術文章

這套設計不需要預測代理腦中每一個念頭。它要確保不被允許的行為即使被想到,也不容易真正執行。

哪些 AI Agent 與環境可以使用 OpenShell?

NVIDIA 表示,OpenShell 可搭配 Claude Code、Codex、OpenCode、GitHub Copilot CLI、OpenClaw 與自訂代理,也能使用開放或封閉模型。企業不必為了導入執行層控制,先把既有代理全部重寫。

官方支援矩陣列出的運行方式包含 Docker、Podman、Kubernetes 與 MicroVM。Linux 與 Apple Silicon Mac 屬於支援環境,Windows WSL 2 仍標示為實驗性功能。這表示 OpenShell 已具備正式版的部署路徑,但不是在每一種電腦上都能得到相同成熟度。

OpenShell 也不要求 NVIDIA 硬體。NVIDIA 說開源軟體可以延伸到 Arm 與 Intel 等第三方運算平台。只有想加入 Sentry 硬體隔離層時,才需要 BlueField-4 架構。

超過 100 家合作夥伴,代表已經大規模採用嗎?

不能這樣解讀。NVIDIA 的原文是超過 100 家組織正在使用、整合、支援或參與相關技術,合作深度並不一致。

目前公告中比較具體的案例包括:

  • SpaceXAI 正把平台用於 Cursor 程式開發代理與 Grok 模型。
  • Salesforce 與 NVIDIA 已將 OpenShell 整合進 Slack,團隊可查看代理活動與審計事件,也能核准或拒絕增權要求。
  • SAP 正把 OpenShell 嵌入 Joule Studio 的執行環境。
  • Anthropic 與 NVIDIA 合作,讓 Claude Managed Agents 的沙盒再加上 OpenShell 與 BlueField 控制。
  • Scale AI 正把相關技術納入企業與政府客戶使用的代理基礎設施。

另外還有 Cisco、CrowdStrike、Microsoft、Red Hat、Palantir、Palo Alto Networks、ServiceNow、Figure 等公司出現在生態名單中。這能證明 NVIDIA 有能力召集模型、資安、雲端、企業軟體與機器人業者,卻不能證明每家公司都已完成正式部署,更不能直接換算成付費客戶或營收。

這套平台仍有哪些限制?

第一個限制,是安全政策本身可能寫錯。OpenShell 可以忠實執行「允許 A、禁止 B」的規則,但如果另一個獲准工具也能完成 B,代理仍可能找到替代路徑。

OpenShell 團隊在形式化驗證研究筆記中公開了一個早期案例。團隊原本禁止代理寫入特定 GitHub 儲存庫,代理後來改用另一個已獲允許的低階工具,成功繞過原本的 API 規則。這個結果促使團隊加入形式化政策檢查,尋找多項權限組合後產生的意外通道。

形式化驗證是把政策轉成數學邏輯,再檢查是否存在超出邊界的可能路徑。它比讓另一個語言模型憑感覺審查更穩定,但仍受限於已建模的規則。官方研究也坦承,邏輯檢查本身不理解「刪除測試資料」與「刪除正式資料」的業務情境差別。

第二個限制,是 Sentry 目前屬於參考系統設計。企業仍要處理硬體、網路、身分、日誌與既有資安工具的整合,不能把 BlueField-4 插上伺服器就視為完成安全治理。

第三個限制,是公開成效資料仍少。NVIDIA 已公布合作名單、技術架構與自家測試,但尚未提供跨企業的攔截率、誤判率、部署成本或事故下降幅度。這些數字出現後,才能判斷平台是新的通用安全層,還是只適合高價值、高風險的 AI 基礎設施。

NVIDIA Open Agent Safety Platform 對輝達是利多嗎?

我對產品方向給中性偏多,對短期財務影響則維持中性。

偏多的理由,是 NVIDIA 正把競爭範圍從 GPU 擴大到 CPU、DPU、網路與安全軟體。企業一旦用 OpenShell 管理代理,再以 BlueField-4 加入獨立安全層,NVIDIA 提供的就不只是模型運算晶片,而是一套從執行到治理的基礎設施。

這也可能增加平台黏著度。安全政策、身分、審計紀錄與硬體控制一旦進入企業流程,替換供應商的成本通常高於更換單一晶片。

但公告沒有價格、訂單金額、部署數量或收入時程。OpenShell 採 Apache 2.0 開源授權,也能運行在第三方硬體上。這有利於擴大生態,卻代表軟體普及不一定直接變成 NVIDIA 軟體收入。

所以這則消息比較像 NVIDIA 全端 AI 平台策略的新拼圖,不是足以單獨支撐股票估值的財務事件。真正會提高我評價的證據,是 Sentry 從參考設計走向大規模正式部署、第三方攻防測試證明效果,以及公司開始揭露可辨認的安全產品收入。

哪些企業值得評估這套平台?

若 AI 代理只能整理公開資料、不能修改系統,OpenShell 的導入價值主要是建立一致的隔離與審計。若代理能接觸正式程式碼、客戶資料、付款流程、工業設備或機器人,外部強制邊界就更重要。

企業可以先盤點四件事:代理能讀什麼、能寫什麼、能連到哪裡,以及持有哪些憑證。這份權限地圖比先買哪一顆晶片更重要。OpenShell 適合用來把地圖轉成執行規則。需要主機外獨立監控,而且風險足以支持額外硬體成本的環境,再評估 Sentry。

小型團隊不必因為新聞立即導入 BlueField-4。先使用最小權限、隔離測試環境、限制對外上傳,並保留完整操作紀錄,通常是更直接的第一步。

NVIDIA Open Agent Safety Platform 常見問題

OpenShell 是新的 AI 模型嗎?

不是。OpenShell 是讓 AI 代理在受控環境中執行的開源軟體。它不負責生成答案,而是限制代理可存取的檔案、程序、網路與憑證。

OpenShell 一定要使用 NVIDIA GPU 或 BlueField-4 嗎?

不需要。OpenShell 可以獨立運行在官方支援的本機、雲端與 Kubernetes 環境,也能延伸到第三方運算平台。BlueField-4 是加入 Sentry 硬體隔離監控時使用的額外層。

Sentry 可以保證 AI Agent 永遠不會失控嗎?

不能。Sentry 能從獨立硬體層監控並執行既定政策,但政策是否完整、整合是否正確、異常判斷是否準確,仍會影響結果。它能縮小風險,不等於消除所有錯誤與攻擊。

超過 100 家合作夥伴都已經正式部署了嗎?

沒有足夠證據這樣說。NVIDIA 的名單混合了正在使用、整合、支援與共同開發的組織。SpaceXAI、Salesforce、SAP 等案例有較具體的用途,但多數公司的部署規模與付費狀態沒有公開。

OpenShell 是免費開源軟體嗎?

OpenShell 原始碼採 Apache 2.0 授權,可在授權條件下使用、修改與散布。實際部署仍可能產生雲端、硬體、維運、資安整合與支援成本。

結語:AI Agent 安全不能只靠它自己說「我會小心」

NVIDIA Open Agent Safety Platform 最有價值的觀念,是把模型護欄與系統權限分開。模型可以規劃,OpenShell 決定它實際能做什麼。需要更高保護時,Sentry 再從代理與主機之外監看並隔離。

這種分層設計比只靠提示詞可靠,也符合企業部署 AI 代理的真實需求。但安全邊界仍要靠人正確定義,形式化驗證只能檢查已被建模的政策,參考設計也還要經過正式部署與外部測試。

因此,這項發布對 NVIDIA 的全端平台方向是正面訊號,對安全成效與短期營收則還不能過度延伸。合作名單增加幾個 Logo 並非關鍵。接下來應追蹤的是有多少企業正式上線、能否公開證明事故減少,以及 Sentry 何時從參考設計變成可量化的業務。

資料來源