OpenAI Jalapeño 是什麼?首款 AI 推論晶片效能、Broadcom 合作與 NVIDIA 影響解析
OpenAI 公布首款自研推論晶片 Jalapeño 的實測結果。本文拆解每瓦吞吐量、延遲、Broadcom 合作與 NVIDIA 影響。
OpenAI 在 2026 年 8 月 25 日公布首款自研 AI 推論晶片 Jalapeño 的實測結果。官方表示,在三個公開大型語言模型的特定測試中,Jalapeño 每瓦可處理的 AI 工作量較對照系統高出 1.5 至 1.9 倍,端到端回應延遲也更低。
這項消息很容易被簡化成「OpenAI 晶片擊敗 NVIDIA」,但這不是最準確的解讀。測試只涵蓋特定模型、設定與運作區間,而且結果由 OpenAI 公布,還不能代表所有 AI 工作或真實資料中心成本。
Jalapeño 真正重要的地方,是 OpenAI 已經從購買算力,走到自行設計晶片、軟體與網路系統。這讓它有機會降低 ChatGPT、Codex 與 API(讓其他軟體呼叫 OpenAI 模型的介面)的推論成本,也增加與 NVIDIA 等供應商合作時的選擇權。
我的判斷是,這對 OpenAI 的產品與成本策略屬於中性偏多,但對 NVIDIA 的短期影響仍是中性。Jalapeño 已證明晶片能運作並跑出成績,下一關則是 2026 年底開始部署後,能否在規模、可靠度與成本上重現實驗結果。
OpenAI Jalapeño 是什麼?
Jalapeño 是 OpenAI 第一款針對大型語言模型推論設計的客製 AI 加速器。推論是模型完成訓練後,實際讀取提示、生成文字、寫程式或執行 Agent 任務的過程。每一次 ChatGPT 回答與 Codex 執行工作,都需要大量推論運算。
它不是一顆用來取代所有 GPU 的通用晶片。GPU 原本用於圖形運算,現在也廣泛負責 AI 模型的訓練與推論。OpenAI 的設計目標,是讓大型語言模型在實際服務時,同時維持高吞吐量與低延遲。吞吐量是系統在固定時間內能處理多少工作,延遲則是使用者要等多久才能收到結果。
OpenAI 負責晶片與系統架構,Broadcom 協助晶片實作、高速網路與量產整合,Celestica 則參與電路板、機架與系統工程。Jalapeño 因此不是 OpenAI 關起門來做出的單一晶片,而是它與供應鏈共同建立的第一代推論平台。

2025 年 10 月,OpenAI 與 Broadcom 已宣布合作部署總規模達 10 GW 的多代客製 AI 加速器與網路系統。GW 是十億瓦,這裡代表長期規劃的資料中心用電與運算規模,不等於 10 GW 的 Jalapeño 已經建成。Jalapeño 是這條多代產品路線中第一款公開的晶片。
Jalapeño 實測成績有多快?
OpenAI 使用 SemiAnalysis 維護的公開測試框架 InferenceX,比較 Jalapeño 與商用 NVIDIA 系統在相同公開模型上的推論表現。測試涵蓋 OpenAI 的 GPT-OSS 120B、DeepSeek R1 670B,以及 Kimi K2.5 1T。
Token 是模型讀取與生成內容時使用的字詞片段。以下表格比較的是每 kW,也就是每 1,000 W 電力可處理的 Token 吞吐量與回應速度,而不是晶片的理論峰值算力。
| 測試模型 | 對照系統 | Jalapeño 每瓦峰值吞吐量 | Jalapeño 端到端延遲 | 對照系統端到端延遲 |
|---|---|---|---|---|
| GPT-OSS 120B | NVIDIA GB200 | 約 1.9 倍 | 1.03 秒 | 1.80 秒 |
| DeepSeek R1 670B | NVIDIA GB300 | 約 1.7 倍 | 1.65 秒 | 5.99 秒 |
| Kimi K2.5 1T | NVIDIA GB300 | 約 1.5 倍 | 1.56 秒 | 5.31 秒 |
這組數字的重要性,在於推論系統通常要在速度與效率之間取捨。一次塞入更多請求可以提高總吞吐量,卻可能讓每位使用者等更久。Jalapeño 在這次測試中同時提高每瓦工作量並壓低延遲,代表它不是只靠排隊與大量批次處理換取漂亮數字。
對 AI Agent 來說,延遲尤其重要。AI Agent 是能拆解步驟、呼叫工具並持續完成任務的系統。它可能要連續搜尋資料、執行程式,再回到模型進行下一步。單一步驟只慢一點,累積十幾次後就會明顯拉長整個任務時間。
這讓我更看好 Jalapeño 用在互動式 AI 服務的方向。不過,跑分只能證明架構有潛力,還不能證明大規模上線後同樣穩定,也沒有回答 OpenAI 最終能省下多少美元。
OpenAI 官方影片整理 Jalapeño 的每瓦吞吐量與延遲測試;數字只代表公告中的特定模型與測試設定。影片來源:OpenAI 官方 X 貼文。
為什麼 Jalapeño 能同時降低延遲與耗電?
大型語言模型回答問題時,大致會經過兩個階段。第一階段是讀取提示內容,運算需求較高。第二階段是逐個產生 Token,此時記憶體頻寬與資料搬移往往更容易成為瓶頸。
如果模型狀態需要頻繁在不同晶片、記憶體與網路節點之間移動,運算單元就會花時間等待。晶片理論算力再高,也不代表整個回答流程一定更快。
Jalapeño 的設計重點,是把晶片、記憶體、網路與推論軟體一起規劃。它會盡量讓模型生成回答時需要重複使用的資料留在鄰近位置,減少跨晶片搬移與通訊等待。這些暫存資料常被稱為 KV cache,可以把它理解成模型生成長篇內容時使用的短期工作記憶。
OpenAI 公布的額定晶片功耗為 700 W,並表示三項測試中的持續功耗不超過 550 W。較低的功耗若能在正式部署中維持,就能讓同一座資料中心在電力限制下處理更多請求。
這也說明 OpenAI 為何要自研晶片。它每天營運 ChatGPT、Codex 與 API,能從真實流量觀察提示長度、Agent 步驟與模型等待發生在哪裡,再把這些需求直接放進下一代硬體。這種軟硬體共同設計,比單獨追求一顆晶片的理論峰值更貼近產品成本。
AI 也參與了 Jalapeño 的設計與程式最佳化
Jalapeño 另一個特別之處,是 OpenAI 不只替 AI 設計晶片,也用 AI 加速晶片開發。
OpenAI 表示,團隊從初始設計走到 tape-out 花了九個月。Tape-out 是晶片設計完成並交給製造端的關鍵里程碑。AI 被用來探索不同電路實作、縮短量測與驗證循環,也協助最佳化運算電路。
晶片完成後,工程團隊仍要替不同模型編寫底層運算程式。OpenAI 使用 Codex 與 GPT-Astra,在兩個月內讓三款原本不在量產計畫中的開放權重模型跑到高效能。OpenAI 也表示,在部分 GPT-OSS 的注意力與混合專家模型區塊中,AI 產生的實作比原本人類專家版本快 1.5 至 1.8 倍。
這個數字不能延伸成「AI 寫的整套程式都快 1.8 倍」,因為它只適用於被挑選的局部運算區塊。但它仍顯示一個值得關注的循環:AI 幫忙設計與編程晶片,新的晶片再用更低成本運行下一代 AI。
如果這套流程能在第二、第三代產品持續縮短開發時間,OpenAI 的優勢就不只是一顆晶片,而是更快把模型需求轉成硬體改良。這也是我對它長期策略偏正面的第二個理由。
這份跑分有哪些限制?
這次結果值得重視,但不適合直接當成 Jalapeño 已全面領先所有 NVIDIA GPU 的證據。
第一,OpenAI 使用公開的 InferenceX 框架與模型,但測試結果仍由 OpenAI 自己公布。InferenceX 的程式、資料與測試方法可以公開檢查,卻不等於 SemiAnalysis 已替每一項 Jalapeño 數字完成獨立第三方驗證。
第二,每瓦效能是依各加速器公開的晶片額定功耗進行標準化。這能建立一致的比較方式,但沒有完整涵蓋 CPU、記憶體、網路、散熱與整座機架的實際耗電,也不等於資料中心的總持有成本。
第三,測試固定在三個模型與特定輸入、輸出長度。不同模型架構、精度、同時使用人數與軟體版本,都可能改變結果。Jalapeño 是推論晶片,這份測試也沒有證明它在大型模型訓練上優於 NVIDIA。
因此,我會把這次結果視為「產品成立的第一份公開證據」,而不是晶片戰已經分出勝負。真正能提高評價的後續證據,是第三方可重現的測試、正式部署規模、長時間可靠度,以及每次成功任務的完整成本。
Jalapeño 會取代 NVIDIA 嗎?
短期不會。OpenAI 在公告中明確表示,未來仍會廣泛使用 NVIDIA 與其他合作夥伴的加速器,涵蓋模型訓練與推論。Jalapeño 的角色更像是增加一條第一方供應路線,而不是立刻搬走所有 GPU。
這對 NVIDIA 的影響可以分成兩層。短期來看,OpenAI 的算力需求仍快速增加,自研晶片新增的容量未必會直接變成 NVIDIA 訂單的等量減少。Jalapeño 也尚未完成大規模部署,因此目前沒有足夠證據判定 NVIDIA 營收會受到明顯衝擊。
長期來看,推論是 AI 產品每天持續發生的成本。只要 OpenAI 能把一部分高流量工作轉到自家晶片,就能減少對單一供應商的依賴,也更有能力選擇不同硬體、分配工作與談判價格。這才是 NVIDIA 需要留意的地方。
換句話說,Jalapeño 現在不是 NVIDIA 的替代品,而是 OpenAI 的議價工具與成本控制工具。若第二、第三代晶片順利擴大部署,影響才可能從供應補充,逐步變成真正的訂單競爭。
Jalapeño 對 ChatGPT、Codex 與 API 使用者有什麼影響?
對一般使用者來說,現在還不會因為這份跑分立刻看到 ChatGPT 降價或全面加速。OpenAI 計畫在 2026 年底前開始把 Jalapeño 部署到自家運算基礎設施,目前尚未公布會先支援哪些產品、部署多少晶片,也沒有承諾新的 API 價格。
如果正式部署成功,可能出現三種實際影響。第一,ChatGPT 與 API 在尖峰時段能服務更多請求。第二,Codex 等多步驟 Agent 的等待時間縮短。第三,OpenAI 有更大空間調整 API 價格、使用額度或高速度方案。
但硬體效率提高,不代表價格一定同比例下降。OpenAI 也可能把節省的成本投入更複雜的模型、更長的推理或更多 Agent 步驟。對使用者最值得追蹤的不是晶片跑分,而是服務延遲、可用性、使用上限與每次成功任務的價格是否真的改善。
OpenAI Jalapeño 常見問題
Jalapeño 是 GPU 嗎?
Jalapeño 是 OpenAI 為大型語言模型推論設計的客製 AI 加速器,功能與資料中心 GPU 有重疊,但架構是針對 OpenAI 的推論需求重新設計。它的重點是同時改善吞吐量、延遲與每瓦效能,而不是取代所有通用 GPU 工作。
Jalapeño 是 OpenAI 自己製造的嗎?
OpenAI 負責晶片與系統架構,但不是獨自完成所有製造與整合。Broadcom 提供晶片實作、網路與量產能力,Celestica 參與電路板、機架與系統工程。官方尚未在這次技術公告中完整列出所有製造供應商。
Jalapeño 真的比 NVIDIA GB300 快嗎?
在 OpenAI 公布的 DeepSeek R1 與 Kimi K2.5 特定測試中,Jalapeño 的每瓦峰值吞吐量較高,端到端延遲也較低。但這不代表它在所有模型、精度、軟體與資料中心環境都比 GB300 快,更不代表訓練效能也領先。
ChatGPT 何時會使用 Jalapeño?
OpenAI 表示計畫在 2026 年底前開始部署 Jalapeño,但沒有公布 ChatGPT、Codex 或 API 的個別上線日期。使用者是否能感受到改善,仍要看部署規模與實際工作分配。
OpenAI 之後還會買 NVIDIA GPU 嗎?
會。OpenAI 表示仍會廣泛部署 NVIDIA 與其他合作夥伴的加速器,用於訓練與推論。Jalapeño 增加的是供應選擇與第一方能力,不是立刻全面替換外部晶片。
結語:Jalapeño 的關鍵不是一次跑分,而是 OpenAI 開始掌握整套 AI 成本
Jalapeño 的首批實測證明,OpenAI 不只會訓練模型與開發產品,也已經做出能運作的第一方推論晶片。它在特定測試中同時提高每瓦吞吐量並降低延遲,讓 OpenAI 的全端策略第一次有了可量化的硬體證據。
但現在就宣布 NVIDIA 被取代,仍然太早。測試範圍有限,大規模部署尚未開始,實際成本與可靠度也還沒有公開。Jalapeño 目前更像是 OpenAI 建立第二條供應路線的起點,而不是 AI 晶片市場的終局。
接下來最值得看三件事:2026 年底部署是否如期展開、第三方能否重現效能,以及硬體效率是否轉化成更快、更穩定或更便宜的 ChatGPT、Codex 與 API。這三項若陸續成立,我才會把 Jalapeño 從產品里程碑,提高為足以改變 AI 晶片競爭格局的證據。