NVIDIA Nemotron 3.5 Lightning 是什麼?NeMo Switchyard 讓 AI Agent 自動選模型
NVIDIA 不只推出一個更快的小模型,而是把 AI Agent 拆成大型模型規劃、專門模型執行、路由器分工的系統。這能降低成本,但不代表品質與導入風險會自動消失。
NVIDIA 在 2026 年 8 月 11 日發布 Nemotron 3.5 Lightning 與 NeMo Switchyard。前者是為大量、重複任務打造的開放 AI 模型,後者則像 AI Agent 的調度員,會替工作流程中的每一步選擇較合適的模型。
這次更新真正重要的地方,不是 NVIDIA 又多了一個語言模型,而是它把企業 AI 的成本問題拆成三個角色:大型模型負責困難的規劃,小型模型處理大量執行工作,路由器則在品質、速度與費用之間分配任務。
我的判斷是,這套方向對企業 AI 落地偏正面,也能補強 NVIDIA 從 GPU 延伸到模型與開發工具的布局。不過,NeMo Switchyard 目前仍是 pre-alpha 實驗階段,官方案例也顯示省下成本時可能犧牲準確率,因此還不能把展示數字直接當成正式環境的保證。
Nemotron 3.5 Lightning 與 NeMo Switchyard 有什麼不同?
兩項產品解決的是不同問題。Nemotron 3.5 Lightning 負責實際產生回答、呼叫工具與處理任務;NeMo Switchyard 不回答問題,而是決定每次該把工作交給哪一個模型。
| 項目 | Nemotron 3.5 Lightning | NeMo Switchyard |
|---|---|---|
| 角色 | 執行大量專門任務的 AI 模型 | 在多個模型之間分配任務的路由工具 |
| 主要用途 | 程式碼檢查、工具操作、監控警示、客服問答 | 依工作難度、成本、延遲與政策選模型 |
| 開放方式 | 模型權重採 OpenMDW-1.1 授權 | 程式碼採 Apache 2.0 授權 |
| 部署位置 | PC、工作站、地端機房、資料中心與雲端 | 可放在 Agent、統一管理模型請求的入口或推論平台前方 |
| 目前限制 | 官方效能數據仍需用自身工作負載驗證 | GitHub 明列為 pre-alpha,不建議直接用於正式環境 |
AI Agent 是能拆解目標、使用工具並持續完成多步驟工作的 AI 系統。模型路由則是替 Agent 選模型的機制,概念類似客服中心分流:一般問題交給速度快、成本低的模型,真正困難的推理才升級給能力更強的模型。
為什麼 AI Agent 不該只用一個最強模型?
長時間運作的 Agent 並不是每一步都需要最高階推理。它可能先分析需求,再讀取檔案、執行指令、檢查結果,最後整理答案。規劃與除錯需要較強模型,但格式轉換、工具呼叫或驗證結果通常不必付出相同成本。
如果所有步驟都送到最昂貴的模型,品質較容易維持,費用與等待時間卻會快速增加。反過來說,全部交給較小模型雖然省錢,碰到複雜任務時又可能失敗。人工替每個步驟指定模型也做得到,但模型、價格與工作流程一改,維護規則就得跟著更新。
NeMo Switchyard 想處理的正是這個落差。它可根據請求內容、模型能力、價格、延遲、系統負載與先前操作結果決定路線,也能在低成本模型持續失敗時升級到更強模型。
這讓企業不必在「永遠用最強模型」和「永遠用最便宜模型」之間二選一。不過,路由器本身也需要評估資料、監控與例外處理,並不是安裝後就能自動得到最低成本。
Nemotron 3.5 Lightning 規格:30B 參數,但每次只啟用 3B
Nemotron 3.5 Lightning 是一款 300 億參數的混合專家模型。參數可理解為模型在訓練中學到的內部數值;混合專家模型(Mixture-of-Experts,MoE)則把模型分成多個專門區塊,每次只啟用與當前內容相關的一部分。
Lightning 雖有 300 億個總參數,單次運算約啟用 30 億個。這種設計希望保留較大的知識容量,同時把每次計算量壓到接近小型模型。官方模型卡列出的重點還包括:

- 最長支援 100 萬個 token。token 是模型切分文字的基本單位,並不等同一個中文字或英文單字。
- 提供 NVFP4 與 BF16 版本。這是儲存模型數值的不同精度格式,會影響記憶體需求、速度與相容硬體。
- 可在單張 H100 或一台 DGX Spark 上部署,也支援 Blackwell、Hopper 與 Ampere 架構的 NVIDIA GPU。
- NVIDIA 表示模型使用超過 20 兆個 token 預訓練,並提供權重、部分訓練資料與重現評測的流程。
模型採 OpenMDW-1.1 授權。該授權允許使用、修改與散布模型材料,但散布時須保留授權與來源通知,使用者也要自行處理資料或模型可能涉及的第三方權利。換句話說,「開放模型」提高了自架與客製彈性,不代表企業可以略過法務、資安與資料來源審查。
官方效能數字怎麼看?
NVIDIA 表示,Nemotron 3.5 Lightning 的輸出速度最高可達同級模型的 4 倍。另一項 PinchBench 測試中,它以 86% 準確率完成 10,000 個 Agent 任務,相較準確率接近的 Qwen3.6 35B,總完成時間快 30%。

這組數字的價值,在於它不只比較每秒產生多少 token,也比較 Agent 完成整項工作要多久。對會反覆呼叫模型的長流程來說,後者更接近實際成本。
但「最高 4 倍」是特定模型、硬體與設定下的結果,不能推論成所有部署都會快 4 倍。企業真正該測的是自己的客服對話、程式碼、文件格式與工具鏈,並同時記錄成功率、完整任務時間與每次任務成本。
NeMo Switchyard 能省多少錢?答案取決於能接受多少品質落差
NeMo Switchyard 支援多種路由方式。最簡單的是先分類問題,再指定模型;也可以觀察 Agent 正在探索、寫程式或修復錯誤的哪個階段,動態調整模型。它還能先從低成本模型開始,只有在偵測到反覆失敗或偏離目標時才升級。
NVIDIA 公布的內部測試顯示,Switchyard 在維持接近前沿模型準確率的情況下,可把任務成本降到單獨使用 Opus 4.8 的近三分之一。不過,更完整的合作案例也揭露了取捨:

- LangChain 在 145 個多輪 Agent 任務中,只把 7% 呼叫送往前沿模型,成本降低 74%,但準確率約下降 6 個百分點。
- Cognition 在 Devin Desktop 測試中,路由後的準確率為 50.6%,與單用 Opus 5 相差 2.8 個百分點,平均成本降低約 28%。
- Ramp 在軟體工程測試中,官方稱維持前沿模型表現,同時降低 58% 成本與 33% 執行時間。
這些案例支持「模型分工確實可能省錢」,卻沒有證明同一組路由規則適用所有企業。客服、法律文件與資安警示對錯誤的容忍度不同。若錯一次的代價很高,6 個百分點的準確率落差可能比節省的模型費用更昂貴。
導入成本不只來自模型費用
Switchyard 可以接收 OpenAI、Anthropic 與 Responses API 格式。API 是讓不同軟體互相傳送請求與結果的介面;Switchyard 讀取請求後,再把工作交給 vLLM、NVIDIA NIM、Ollama 或其他相容端點。這可降低更換供應商時的應用程式改寫量,也是它對開發團隊最實際的價值之一。
但 GitHub 專案目前明確標示為 pre-alpha,API 與演算法在 1.0 版前可能大幅變動,也註明不適合正式環境。企業若現在評估,較合理的做法是先挑一個錯誤成本低、量大且容易評分的流程做概念驗證,例如內部文件分類、重複格式檢查或非關鍵程式碼整理。
真正的導入成本還包括路由資料、品質評測、監控、故障切換、資安與維護人力。只有當省下的推論費用與等待時間,長期高於這些工程成本,模型路由才有商業價值。
對 NVIDIA 的意義:從賣 GPU 走向控制整套 AI 執行層
Nemotron 3.5 Lightning 可以在 NVIDIA GPU 上地端部署,Switchyard 又能替多個開放或封閉模型分流。表面上看,NVIDIA 允許企業混用競爭模型;實際上,它正把自身位置從晶片供應商延伸到模型、推論服務、客製工具與 Agent 調度層。
我對這項產品策略偏正面,因為企業不論最後選哪個前沿模型,都可能繼續使用 NVIDIA 的硬體與軟體工具。不過,單次產品發布還不足以改變 NVIDIA 的投資判斷。Switchyard 尚未成熟,Nemotron 也需要實際採用與使用量,才能證明軟體布局能轉化為收入或提高客戶黏著度。
對投資人來說,更值得追蹤的不是某一項官方跑分,而是 Nemotron 的下載與企業部署、NIM 服務用量、Switchyard 的正式版本與合作平台整合。若工具長期停留在實驗專案,這個正面判斷就會減弱。
Nemotron 3.5 Lightning 與 NeMo Switchyard 哪些人適合先試?
適合優先評估的團隊,通常已經有穩定的 Agent 工作流程、模型呼叫量夠大,而且能用明確指標判斷任務成功或失敗。這類團隊較容易算出路由前後的成本差異,也能累積調整路由器需要的資料。
如果公司仍停留在聊天機器人試用階段、沒有自動化評測,或每個任務都涉及高風險決策,現在導入的維護成本可能高於效益。這時先建立一套可重複的品質測試,比急著同時管理多個模型更實際。
Nemotron 3.5 Lightning 已上架 Hugging Face、ModelScope、OpenRouter 與 build.nvidia.com;NeMo Switchyard 的原始碼則已放上 GitHub。兩者都能開始測試,但只有 Lightning 已具備較完整的模型卡、部署說明與評測重現資料,Switchyard 仍應視為技術驗證工具。
FAQ
Nemotron 3.5 Lightning 是免費的嗎?
模型權重可依 OpenMDW-1.1 授權下載與使用,但實際運行仍會產生 GPU、雲端、電力與維護成本。使用 OpenRouter、NVIDIA NIM 或其他由供應商代為運行模型的服務時,也要另外查看費率。
NeMo Switchyard 會自動找到最便宜又最準的模型嗎?
不會。它提供路由框架與多種演算法,但團隊仍要設定可用模型、品質門檻、成本權重與失敗後的處理方式。沒有評測資料與監控,路由器可能只是把錯誤移到另一個模型。
Nemotron 3.5 Lightning 可以在本機執行嗎?
可以。官方列出 DGX Spark、H100,以及部分 Blackwell、Hopper、Ampere GPU 的部署方式,也提到 RTX PC、Jetson 與工作站等環境。能否順暢執行仍取決於模型格式、顯示記憶體、上下文長度與同時使用人數。
企業現在該直接導入 NeMo Switchyard 嗎?
較適合先做小型概念驗證,不建議直接接入關鍵正式流程。專案目前仍是 pre-alpha,介面與演算法可能變動;先選錯誤成本低、結果可評分的任務,較容易確認節省是否大於維護成本。
結論:這不是另一場模型跑分,而是 AI Agent 的成本分工
Nemotron 3.5 Lightning 的賣點是用較少的啟用參數處理大量任務,NeMo Switchyard 則把昂貴模型留給真正困難的步驟。兩者合在一起,反映企業 AI 正從「選一個最強模型」轉向「替不同工作選合適模型」。
這個方向值得關注,但現階段最實際的行動不是全面更換架構,而是用自己的任務做小規模測試。只要把準確率、完成時間、失敗成本與維護人力放在同一張表上,才能判斷路由是否真的省錢,而不是只把模型帳單換成更難看見的工程成本。