DeepSeek 創辦人稱 NVIDIA「自掘墳墓」?華為晶片、CUDA 護城河與中國 AI 算力真相
DeepSeek 創辦人梁文鋒被轉述稱 NVIDIA 正在「自掘墳墓」。這是否代表華為已取代 GB300?本文從來源可信度、晶片效能與 CUDA 生態拆解真相。
一份據稱來自 DeepSeek 創辦人梁文鋒閉門會的轉寫稿,最近在科技圈快速流傳。最受注意的一句話是:NVIDIA 正在「自掘墳墓」,而華為昇騰 950 超節點已能在效能與價格上替代 NVIDIA GB200、GB300。
這個說法很有話題性,但不能直接解讀成「華為已經擊敗 NVIDIA」。截至 2026 年 7 月 27 日,DeepSeek 尚未正式確認這份轉寫稿,原始錄音也沒有公開。更重要的是,稿內的「四顆華為晶片等於一顆 NVIDIA 晶片」沒有交代比較型號、工作負載、耗電量與測試方法,不能當成完整的效能結論。
真正值得注意的,不是哪一家晶片已經贏了,而是美國出口限制正在迫使中國 AI 公司投入原本不願承擔的遷移成本。這會削弱 NVIDIA 在中國市場的生態黏著度,但距離 CUDA 的全球護城河瓦解,仍有一段很長的路。
這份 DeepSeek 閉門會轉寫稿可信嗎?
這場投資者閉門會在 2026 年 5 月舉行,全程約 3 小時 44 分鐘。該媒體表示,已向參與投資 DeepSeek 的機構核實,會議與內容可信,但 DeepSeek 並未回覆採訪。
問題在於,網路流傳的 42 頁文件並不是官方逐字稿。盒飯財經對文件的查核指出,稿件註明由語音辨識自動轉寫,再經 AI 整理,沒有區分說話人,個別術語與數字可能出錯。公開網路上也找不到原始音檔。
因此,這份材料可以用來理解 DeepSeek 的策略方向,卻不適合把每一句話都當成精準、可驗證的公司公告。以下涉及梁文鋒的說法,都是針對「流傳轉寫稿」進行分析,而不是認定 DeepSeek 已正式背書。
「NVIDIA 自掘墳墓」究竟在說什麼?
梁文鋒的論點不是 NVIDIA 晶片突然失去競爭力,而是出口限制改變了中國企業的選擇。
如果中國公司能自由購買 NVIDIA 晶片,繼續使用熟悉的 CUDA 工具、函式庫與伺服器系統,通常比遷移到新平台更省事。國產晶片即使價格較低,也很難說服企業重寫程式、重新驗證模型,還要承擔系統不穩定的風險。
但當最先進的 NVIDIA 產品受到出口許可限制,企業就不能只比較「哪一張卡比較快」。即使替代方案需要更多晶片、更多工程時間,只要能穩定取得,就有理由投入。
這才是「自掘墳墓」背後的商業邏輯:限制銷售本來想壓低中國取得先進算力的速度,卻也替華為、Alibaba、Baidu 等本土晶片提供了最難得的導入機會。客戶一旦完成遷移,未來即使 NVIDIA 產品重新開放,也未必會把所有工作負載搬回去。
這個判斷對 NVIDIA 在中國市場偏空,對中國國產替代偏多,但它說的是採用動機,不是技術已經全面超車。
華為昇騰 950 真的能取代 NVIDIA GB200、GB300 嗎?
轉寫稿中最容易被誤讀的,是「四顆華為晶片等於一顆 NVIDIA 晶片」與「華為 950 超節點可完全替代 GB200、GB300」兩個說法。
問題是,AI 算力不能只用晶片顆數比較。至少還要知道:
| 比較項目 | 為什麼重要 |
|---|---|
| 工作負載 | 模型訓練、批次推論與即時推論需要的硬體特性不同 |
| 數值精度 | FP4、FP8、BF16 等格式的速度與模型品質不能直接混用 |
| 記憶體與頻寬 | 大型模型能否放入記憶體,以及晶片間搬移資料的速度,會影響實際吞吐量 |
| 能耗與散熱 | 四顆晶片若耗電與機房空間大幅增加,總成本可能不划算 |
| 軟體最佳化 | 同一套硬體經過編譯器與核心函式庫最佳化後,效能可能相差數倍 |
| 叢集穩定度 | 萬卡訓練需要處理通訊、故障恢復與長時間穩定運行,不是單卡跑分 |
華為官方資料顯示,Atlas 950 SuperPoD 以 UnifiedBus 互連,架構最多可連接 8,192 顆 NPU;華為也在 2026 年 7 月的 WAIC 展示 1,024 卡真機叢集。這證明它不是停留在簡報上的概念產品。

另一方面,NVIDIA GB300 NVL72是一套機櫃級系統,單櫃整合 72 顆 Blackwell Ultra GPU、36 顆 Grace CPU,並以 NVLink 提供 130 TB/s 的總頻寬。NVIDIA 賣的不是單一 GPU,而是晶片、網路、軟體與管理工具整合後的 AI 工廠。

現有公開資訊可以支持「Atlas 950 已成為可部署的替代選項」,卻不足以支持「同等成本、功耗與穩定度下全面追平 GB300」。我的判斷是,華為在中國市場已經跨過「能不能用」的門檻,下一關才是證明「是否更划算」。
CUDA 護城河為什麼比晶片規格更難取代?
CUDA 是 NVIDIA 的平行運算平台。白話來說,它讓開發者能使用 NVIDIA GPU 執行 AI、科學運算與影像處理,並提供編譯器、函式庫、除錯工具與效能最佳化工具。

一家 AI 公司選擇 NVIDIA,通常不是只買晶片。工程團隊還會依賴 CUDA、cuDNN、NCCL,以及 PyTorch 等框架對 NVIDIA 的成熟支援。模型訓練失敗時,也需要文件、監控、除錯與大量既有經驗。這些累積不會因競爭對手推出一顆規格接近的晶片就消失。
但 CUDA 的護城河也不是完全不可動搖。華為已開源部分 CANN 軟體堆疊,並支援 PyTorch、vLLM 與 TileLang 等工具。TileLang 是一種用來撰寫高效能運算核心的程式語言,可把上層模型運算轉換成不同加速器能執行的程式。工具越成熟,開發者直接接觸底層硬體差異的機會就越少,遷移成本也會下降。
AI 本身還可能加速這個過程。程式代理能協助修改與測試核心程式,讓企業移植 CUDA 工作負載時,不必完全依賴人工逐行改寫。
不過,「可以移植」不等於「生產環境同樣成熟」。真正的測試是:同一個大型模型在連續數週運行後,吞吐量、延遲、耗電、故障率與工程維護時間能否接近 NVIDIA。這些資料目前仍不足,因此我不認為 CUDA 的全球護城河已經快速瓦解。
DeepSeek 真正承認的差距,其實是算力資源
如果只截取「NVIDIA 自掘墳墓」,很容易把這場談話看成中國晶片勝利宣言。但同一份轉寫稿也承認,中國與美國 AI 的主要差距仍是可用算力。
梁文鋒被轉述稱,DeepSeek 與美國前沿公司的模型差距約為 12 至 18 個月,希望以對方一小部分的算力,把差距壓縮到 6 個月甚至 3 個月。他也把人才與應用差距,部分歸因於研究團隊能取得的運算資源不同:算力較少,就沒有足夠機會執行大量實驗。
這個說法更接近 DeepSeek 的核心策略。它不是假設國產晶片已經與 NVIDIA 同級,而是透過模型架構、低精度訓練、專用運算核心與開放權重,盡量提高每單位算力產出的模型能力。
效率可以縮小差距,卻不能無限取代規模。當競爭進入更大型模型、長時間研究實驗與大量使用者推論時,可取得的晶片數量、記憶體、電力與資料中心仍然重要。因此,DeepSeek 的成績同時證明兩件事:演算法效率確實能改寫成本,但先進算力仍是公司最想突破的限制。
DeepSeek 自研晶片,對 NVIDIA 與華為代表什麼?
Reuters 於 2026 年 7 月報導,DeepSeek 正在規劃自研 AI 晶片,初期聚焦推論,也就是讓訓練完成的模型實際產生回答。報導指出,專案仍在早期階段,DeepSeek 尚未正式回應。
如果消息屬實,這不代表 DeepSeek 很快就能製造出與 GB300 正面競爭的晶片。自研晶片還要面對設計、晶圓製造、先進封裝、高頻寬記憶體與軟體工具等限制。
它更像是一種垂直整合:DeepSeek 最了解自己的模型架構與推論流量,可以針對固定工作負載設計更精簡的晶片,降低每次回答的成本。Google TPU、Amazon Trainium 與 Meta 自研加速器採取的也是類似方向。
對 NVIDIA 而言,風險不是明天失去全球 AI 晶片市場,而是大型客戶逐步把穩定、規模大的工作負載搬到自研或國產晶片,只把最複雜、最前沿的任務留給 NVIDIA。對華為而言,DeepSeek 自研晶片既可能是合作,也可能成為推論市場的新競爭者。
這件事對 NVIDIA 的實際影響有多大?
我對 NVIDIA 的全球護城河仍維持中性偏多,對它在中國市場的長期黏著度則偏空。
理由有兩個。第一,出口限制替國產替代創造了需求。企業只要被迫完成一次遷移,華為 CANN、TileLang 與本地供應鏈就會得到更多真實工作負載、錯誤回報與工程人才,生態成熟速度自然加快。
第二,NVIDIA 仍掌握完整系統優勢。GB300 的競爭力不只來自單顆 GPU,還包括 NVLink、網路設備、函式庫、模型最佳化與資料中心管理。要在全球市場取代這套組合,比做出一顆可以執行相同模型的晶片困難得多。
最可能改變這個判斷的證據,不是另一句創辦人金句,而是公開、可重現的部署數據。如果 Atlas 950 能在 DeepSeek 等大型模型上,以接近的成本、功耗與穩定度完成訓練及推論,並能大規模交付,NVIDIA 的護城河就會從「全球標準」逐步變成「特定市場的高階選項」。
在這些證據出現以前,把事件解讀為中國替代進程加速,比宣告 NVIDIA 已被取代更接近現實。
FAQ
DeepSeek 創辦人真的說 NVIDIA 正在「自掘墳墓」嗎?
這句話出現在多家媒體引用的閉門會轉寫稿,但 DeepSeek 尚未正式確認,原始錄音也未公開。可以把它視為具有一定媒體核實基礎的轉述,不宜當成公司正式聲明。
四顆華為晶片真的等於一顆 NVIDIA 晶片嗎?
目前無法驗證。轉寫稿沒有說明兩邊的確切型號、工作負載、精度、功耗與成本,也沒有交代比較的是單晶片、伺服器還是整套超節點。缺少這些條件,四對一只能是方向性說法。
華為 Atlas 950 SuperPoD 已經上市了嗎?
華為已在 2026 年公開 Atlas 950 SuperPoD,並展示 1,024 卡真機叢集。這代表產品已進入實體部署階段,但大規模交付量、第三方效能與長時間運行穩定度仍需要更多公開資料。
CUDA 會被中國 AI 晶片取代嗎?
中國市場會逐步形成 CUDA 以外的工具與生態,但短期內很難在全球完全取代 CUDA。NVIDIA 累積多年的函式庫、開發者、框架最佳化與資料中心工具,仍是競爭者必須跨越的門檻。
DeepSeek 自研晶片會威脅 NVIDIA 嗎?
短期威脅有限,因為晶片設計到穩定量產需要很長時間。較實際的影響是 DeepSeek 可能把大量推論工作搬到自研或國產晶片,逐步降低對 NVIDIA 與華為單一供應商的依賴。
結論:出口限制正在改變生態,但還沒有改寫勝負
「NVIDIA 自掘墳墓」最有價值的地方,不是它預告 NVIDIA 即將失敗,而是點出出口管制的反作用力:當中國公司無法自由選擇最成熟的硬體,就會把資金、人才與真實業務投入替代生態。
這對 NVIDIA 的中國業務是長期風險,對華為與中國 AI 晶片是難得的成長窗口。但從可部署,到同等成本,再到全球生態,仍是三個不同階段。Atlas 950 已讓「能不能用」有了更明確答案;「是否更划算」與「能否取代 CUDA」,還需要真實數據證明。
現階段最合理的結論是:中國 AI 晶片替代正在加速,NVIDIA 的中國護城河確實被削弱,但它的全球硬體與軟體優勢尚未被推翻。