能效比 GPU 狂飆 140 倍!Extropic 發表首款熱力學 Transformer「Z1T」,AI 算力迎來物理學革命
Extropic 發表全球首個專為熱力學機率晶片打造的類 Transformer 模型 Z1T,推論能效比輝達 H100 提高 140 倍,生成速度達每秒 17,000 字,並揭示了稀疏縮放定律。本文全方位拆解熱力學運算原理與產業影響。

▲ Extropic 正式公布全球首個專為稀疏機率硬體量身打造的類 Transformer 模型家族 Z1T。(圖片來源:Extropic 官方研究部落格)
全球人工智慧(AI)正在面臨一場嚴峻的「電力死局」。隨著各大科技巨頭爭相建立百萬片 GPU 等級的超級資料中心,能源網已不堪重負,連微軟、Google 等巨頭都開始四處尋求重啟核電廠來供應伺服器的龐大電力需索。
然而,當全矽谷都在向輝達(NVIDIA)追逐更多昂貴、耗能的 GPU 時,一家由前 Google 量子 AI 物理學家創立的硬體新創,正試圖從底層物理學推翻當前的算力霸權。
2026 年 9 月 4 日,由知名「有效加速主義」(e/acc)發起人 Beff Jezos(本名 Guillaume Verdon)所創辦的熱力學運算晶片公司 Extropic,正式宣布推出 Z1T——全球第一個專為稀疏機率硬體(Sparse Probabilistic Hardware)量身打造的類 Transformer 模型家族。
根據 Extropic 官方公布的技術報告,Z1T 在搭配其自主研發的 Z1 熱力學晶片進行模型推論時:
- 能耗比輝達 H100 降低了兩個數量級,能源效率狂增高達 140 倍(每 Token 僅耗能 294.52 奈焦耳 vs. H100 的 40.9 微焦耳);
- 在純 Z1 運算層上,能效比甚至達到傳統 GPU 的 4,680 倍;
- 單一 Token 解碼延遲僅需 58.8 微秒,換算生成吞吐量高達 每秒 17,000 個 Token,大幅超越 H100;
- 同時揭示了顛覆業界認知的**「稀疏 Transformer 縮放定律」(Sparse Scaling Law)**。
這項突破不僅在學術界與 AI 社群掀起震撼,也讓 Extropic 甫於 2026 年 7 月底獲得美國商務部《晶片與科學法案》(CHIPS Act)簽署高達 7,500 萬美元意向書的背後戰略價值,徹底浮上檯面。
究竟什麼是「熱力學運算」?它為何能以百分之一的功耗擊敗現代 GPU?Z1 晶片與 Z1T 又是如何運作的?本文將以最透徹的技術解析與產業視角,帶你看懂這場可能改寫下一個十年 AI 硬體格局的算力革命。
快速導覽:Extropic Z1T 關鍵規格與數據對比
| 評比項目 | Extropic Z1T(Z1 晶片 + 異質架構) | 輝達 NVIDIA H100 (80GB HBM3) | 差距與優勢 |
|---|---|---|---|
| 每 Token 推論能耗 | 294.52 nJ(奈焦耳) | 40.9 µJ(微焦耳,在 10% MFU 典型情境) | 能效暴增約 139~140 倍 |
| 純神經網路核心層能耗 | 8.74 nJ(Z1 晶片取樣運算) | 40.9 µJ | 能效領先高達 4,680 倍 |
| 單批次解碼延遲(Batch=1) | 58.8 µs(微秒) | 702 µs (PyTorch eager) / 102 µs (torch.compile) | 速度提升 1.7~12 倍 |
| 單串流生成吞吐量 | 約 17,000 Tokens/s | 1,425~9,764 Tokens/s | 即時對話響應速度極致飛躍 |
| 底層運算邏輯 | 熱力學物理動態+機率位元(p-bit)取樣 | 馮紐曼架構+確定性高精度浮點矩陣乘法 | 從「對抗熱雜訊」轉為「利用熱雜訊」 |
| 硬體連通性架構 | 稀疏連接圖(每節點固定 16 個物理耦合) | 全互連高頻寬快取記憶體階層(密集矩陣) | 原生支援稀疏類神經架構 |
| 模型開放性 | Hugging Face 開源權重、GitHub 開源訓練配方 | 商業閉源晶片與專有 CUDA 生態系 | 開源社群可自由檢驗與複現 |
為什麼傳統 GPU 走進了死胡同?「硬體彩券」與能耗危機
要理解 Extropic 的革命性,必須先理解當前 AI 產業面臨的致命痛點。
1. 馮紐曼架構與「強行對抗熱力學」的沉重代價
現代所有數位電腦與 GPU(包括輝達的 H100、B200 等),都建立在傳統的「確定性布林邏輯」(Deterministic Boolean Logic)之上:一個位元(Bit)不是 0 就是 1,絕不容許任何模糊。
然而,在微觀物理世界中,當半導體製程推進到 3 奈米、2 奈米時,電子的熱擾動與量子穿隧效應會變得極其劇烈。為了確保電路裡的「0 和 1」不被周遭的熱雜訊打亂,工程師必須提高電壓、建立層層保護與同步時脈。
換句話說:傳統數位晶片耗費了絕大多數的電力與散熱代價,只是為了在物理上「鎮壓」宇宙中自然存在的熱力學雜訊。
2. 生成式 AI 本質是「機率」,何必用確定性晶片硬算?
但諷刺的是,大語言模型(LLM)與擴散模型(Diffusion Models)在數學本質上,全都是機率模型(Probabilistic Models)!
當 ChatGPT 產生下一個字、或是 Midjourney 生成下一張圖時,它們並不是在計算一加一等於二的確定性答案,而是在龐大的機率分佈中進行「取樣」(Sampling)。
當前整個產業的做法,是用消耗幾百萬瓦電力的昂貴數位矩陣乘法器(Matmul),費盡九牛二虎之力去逼近一個連續分佈,最後再透過 Softmax 和溫度係數進行隨機取樣。著名 AI 學者 Sara Hooker 曾提出著名的「硬體彩券」(Hardware Lottery)理論:當前獲勝的演算法往往不是最完美的,而是恰好最適合當下硬體的。如今的 Transformer,就是為 GPU 的密集矩陣乘法而高度特化的產物。
這正是 Extropic 創辦人 Guillaume Verdon 看見的巨大荒謬。
走進 Extropic 的物理宇宙:什麼是「熱力學運算」?
Extropic 的核心哲學可以用一句話總結:「不要對抗物理,順應物理。」
1. 創辦人 Guillaume Verdon 與「e/acc」哲學
Guillaume Verdon 擁有滑鐵盧大學理論物理與量子計算博士學位,曾擔任 Alphabet / Google Quantum AI 團隊的資深量子機器學習科學家。在網路世界中,他更為人所知的身分是 Beff Jezos——2023 年席捲矽谷、主張透過技術進步與能源獲取加速人類文明擴張的「有效加速主義」(e/acc)精神領袖。
Verdon 認為,宇宙的終極推動力就是熱力學熵增與自由能耗散。生命本身就是一種高效處理能量與資訊的非平衡態熱力學系統。如果人類的大腦只需要 20 瓦的微弱電力就能運行無比複雜的智慧,憑什麼伺服器要用幾千瓦的龐然大物?
答案就是:人類大腦本身也是一種在溫暖、嘈雜環境下運行的機率生化網路。
2. Z1 晶片的核心:機率位元(p-bit)與熱擾動
Extropic 的解決方案是:製造一種直接利用電子熱雜訊來進行計算的晶片——熱力學取樣單元(Thermodynamic Sampling Unit, TSU)。其首款全自研晶片被命名為 Z1。
Z1 晶片採用標準的亞閾值 CMOS(sub-threshold CMOS)製程製造,不需要像量子電腦那樣耗費鉅資使用極低溫稀釋冷凍機,而是在常溫下運作。它有三大核心特徵:
- 機率位元(p-bits): 傳統位元只能是 0 或 1;量子電腦的量子位元(qubit)具有量子疊加態;而 Z1 的 p-bit 則是一種二元隨機電路,其狀態以特定機率在 -1 與 +1 之間不斷隨機跳變,跳變機率直接受周圍相鄰 p-bit 的偏壓與物理耦合強度控制。
- 物理伊辛模型(Ising Model)與吉布斯取樣: Z1 晶片在物理層面上直接實現了一個可編程的「伊辛能量函數」。晶片內建 50 MHz 的內部時脈,以極高的速度在晶片記憶體內原生執行「著色吉布斯取樣」(Chromatic Gibbs Sampling)。
- 超低取樣能耗: 傳統 GPU 產生一個高品質隨機數需要複雜的演算法與大量時脈週期,而 Z1 是直接讀取電子的熱擾動,每次取樣的能量消耗僅僅只有 $1.3 \times 10^{-14}$ 焦耳(即 13 飛焦,fJ)!
▲ Z1 晶片局部環狀拓撲結構(Toroidal Boundary)與耦合圖鄰接矩陣動態展示,左側為物理連接性,右側為適配硬體的極度稀疏耦合矩陣。(影片來源:Extropic 官方技術白皮書)
Z1 晶片局部環狀拓撲結構(Toroidal Boundary)與耦合圖鄰接矩陣動態展示,左側為物理連接性,右側為適配硬體的極度稀疏耦合矩陣。 影片來源:Extropic 官方技術白皮書。
3. Z1 晶片的物理限制:極致的稀疏性(Sparse Connectivity)
但上帝開了一扇門,也關了一扇窗。
Z1 晶片擁有 8 顆核心、總計 269,568 個 p-bits,以及 2,135,904 條固化的硬體耦合邊(Coupling Edges)。
在矽晶圓的物理佈局中,每個 p-bit 只能與它周圍物理相鄰的 16 個 p-bit 進行電磁耦合(即 degree-16 graph)。這意味著:Z1 的物理連通圖在空間上是極端「稀疏」(Sparse)的!
然而,目前的 Transformer 架構(例如 GPT-4、Llama 3)仰賴的是**「全對全」的密集矩陣乘法(Dense Matrix Multiplication)**。GPU 透過層層 SRAM 快取與高頻寬記憶體(HBM)讓每個核心都能存取所有數據;但 Z1 的物理晶片根本無法直接執行標準的密集矩陣乘法。
如果不能跑 Transformer,任何新架構在今天都只能淪為實驗室裡的玩具。這就是為什麼 Extropic 必須研發 Z1T。
演算法與硬體的極致共生:Z1T 如何把 Transformer 搬上熱力學晶片?
Extropic 意識到,不能用舊思維硬套新硬體。要讓熱力學晶片跑語言模型,必須進行深度的「軟硬體協同設計」(Hardware-Software Co-Design),對經典 Transformer 的關鍵積木進行外科手術式的重構。

▲ 稀疏矩陣乘法直接嵌入 Z1 物理圖:每個輸出 p-bit 利用其 16 條耦合線連接 4 個輸入值 × 4 個 DY4P 機率位元,將神經網路運算直接化為物理能量平衡。(圖片來源:Extropic 官方研究部落格)

1. 從玻爾茲曼機借火:Tanh-Linear 單元與連續數值編碼
Z1 輸出的是隨機位元序列,神經網路卻需要連續的浮點數向量。Extropic 借鑑了人工智慧先驅 Geoffrey Hinton 早期的「玻爾茲曼機」(Boltzmann Machine)理論:
當對處於熱平衡狀態下的單一可見節點與周圍 16 個鄰近隱藏節點進行條件期望值平均時,物理分佈的數學期望值,會精準呈現一個雙曲正切函數($\tanh$): $$\mathbb{E}[v \mid h] = \tanh\left( b_v + \sum_{j=1}^{16} J_j h_j \right)$$
利用這個物理特性,Extropic 發明了 DY4P(p-int)編碼:將 4 個 p-bit 組成一組,以 $1/4$ 到 $1/32$ 的二進位加權求和,對多次取樣進行平均,就能在熱力學硬體上以極低能耗獲得等同於低精度整數的連續數值運算!
更妙的是,在硬體內進行稀疏矩陣向量積時,矩陣乘法與 $\tanh$ 激勵函數是在物理層面上「融合成一步完成」的,完全不需要額外計算時脈。
2. 淘汰 RMSNorm,改用物理原生的 DyT(動態雙曲正切)
現代 LLM 普遍使用 RMSNorm 來穩定層間特徵數值,但 RMSNorm 涉及平方和、開根號與除法,在非傳統數位晶片上非常昂貴。
Extropic 引用了 Yann LeCun 等人最新的「無需正規化的 Transformer」(Transformers Without Normalization)研究,發現 RMSNorm 的行為本質上非常接近縮放後的雙曲正切。因此,Extropic 在 Z1T 中以 DyT(Dynamic Tanh) 全面替換 RMSNorm: $$\operatorname{DyT}(x) = \gamma \tanh(\alpha x) + \beta$$ 由於 Z1 原生就能在物理上產生 $\tanh$,這一步運算直接被無縫融合進晶片的下一個取樣層中,能耗趨近於零!

▲ 門控卷積注意力(GCA)運算管線視覺化:將傳統密集注意力重構為 4-稀疏投影矩陣與局部一維卷積,完美適配 Z1 晶片的 degree-16 稀疏硬體拓撲。(圖片來源:Extropic 官方研究部落格)

3. 重構注意力機制:門控卷積注意力(GCA)
標準的自注意力機制(Self-Attention)計算 $QK^\top$ 矩陣具有 $O(T^2 D)$ 的複雜度,而且必須是密集的。
為了適配 Z1 晶片「每個節點只有 16 條物理連接」的約束,Extropic 改造了無注意力 Transformer(Attention-Free Transformer, AFT)架構,打造出 Gated Convolutional Attention(GCA,門控卷積注意力)。
在 GCA 中,模型放棄了計算全序列每個 Token 之間的兩兩內積,而是採用 4-稀疏投影矩陣 產生門控信號,並結合一維卷積(1D Convolution)進行局部上下文的加權衰減與滑動視窗聚合。這種運算局部性極高,能夠完美對齊 Z1 晶片的局部環狀拓撲結構。

▲ 單一 Token 穿越 4 層模組的異質流動圖:銅色為 FPGA,金色為 Z1 晶片。全流程能耗僅 294.52 nJ,遠低於輝達 H100 的 40.9 µJ。(圖片來源:Extropic 官方研究部落格)

4. 異質分離推理架構(Disaggregated Inference Pipeline)
在實際部署中,Extropic 並沒有天真地宣稱要淘汰所有數位晶片,而是採用了務實的「混合分工」策略:
- Z1 熱力學晶片(TSU): 負責運算量最大、重複取樣最頻繁的神經網路主體層(Sparse Tanh-Linear 投影、GCA 門控與 MLP 層)。
- 協同處理器(FPGA / XPU): 負責殘差連接(Residual)、位置編碼、池化(Pooling)以及最後將隱藏維度投射到數萬個詞彙表的「詞彙讀出矩陣」(Vocab Logits Matmul)。
數據在晶片間以 25.6 Gbit/s 的高速匯流排串流傳輸,構建了一條極具擴展性的異質流水線。

▲ Z1T GCA 模型驗證損失與訓練運算量(FLOPs)關係圖。紅星為 GPT-2-small 與 GPT-2-XL;雖然達到相同 Loss 需多耗費約 10 倍 FLOPs,但 Z1 上的每個 FLOP 便宜了 1,000 倍,實現淨節能 140 倍。(圖片來源:Extropic 官方研究部落格)

震撼業界的重大發現:稀疏 Transformer 縮放定律(Sparse Scaling Law)
在 AI 領域,OpenAI 與 DeepMind 確立的「縮放定律」(Scaling Laws)被奉為圭臬:只要增加運算量(FLOPs)、數據量與模型參數,模型損失(Loss)就會遵循冪律平滑下降。但過去的定律全部是針對「密集矩陣(Dense)」推導的。
當硬體物理限制把模型逼向「極致稀疏」時,Scaling Law 還成立嗎?
Extropic 進行了大規模的實證研究。他們設定固定的物理連接度 $c \in {4, 16, 32, 64, 128}$(每個神經元僅連接 $c$ 個輸入),對不同參數規模與運算預算(從 $3 \times 10^{14}$ 到 $10^{18}$ FLOPs)進行掃描訓練。
他們發現了一個兼具殘酷與希望的物理新定律:
【稀疏與熱力學的終極算力代價替換】
數學維度(FLOPs 效率):
密集模型(Dense / GPT-2) ────► 需要 1x FLOPs
稀疏模型(Sparse / Z1T) ────► 需要約 10x FLOPs(數學效率較低)
物理維度(每 FLOP 能源成本):
傳統 GPU(高壓對抗雜訊) ────► 能源成本 1,000x
熱力學晶片(亞閾值熱雜訊取樣)─► 能源成本 1x(物理能效暴增千倍)
─────────────────────────────────────────────────────────────
最終淨能耗成果:
Z1T 綜合推論能耗比 GPU 節省超過 100~140 倍!
關鍵洞見:算力不平等,物理代價才是王道!
- 稀疏懲罰(Mathematical Penalty): 實驗證明,要達到與標準 GPT-2 相同的語言模型測試損失(Loss),稀疏的 Z1T 由於結構受限,需要多耗費約 一個數量級(約 10 倍)的訓練 FLOPs。
- 物理紅利(Physical Thermodynamic Dividend): 但是,一個 FLOP 在不同硬體上的物理代價根本天差地別!在 GPU 上做浮點運算昂貴無比,而在 Z1 晶片上利用熱力學取樣完成一次運算,能源消耗比 GPU 足足便宜了 1,000 倍(三個數量級)!
- 最終結果: 兩者相抵之後,稀疏架構雖然在數學上「多算了 10 倍步驟」,但在物理上卻「省了 1,000 倍電力」,最終在達成相同智力表現的前提下,淨能效實現了 100 到 140 倍的驚人飛躍!
這項發現粉碎了學界長期以來的迷思——過去人們因為稀疏模型在 GPU 上跑得慢且需要更多 FLOPs 而放棄稀疏化;然而一旦硬體基底切換到熱力學晶片,稀疏架構反而是解放物理能效的最佳鑰匙。
實測對決 NVIDIA H100:能耗與延遲數據全剖析
Extropic 在相同的測試標準下,將 Z1T 系統(Z1 晶片+FPGA 協處理器)與業界標竿 NVIDIA H100 80GB HBM3 進行了單批次(Batch-1)自回歸解碼的逐項對決:
1. 能耗對決:奈焦耳(nJ)vs. 微焦耳(µJ)
在實際推論過程中,產生單一 Token 的能耗對比如下:
- NVIDIA H100:
- 在典型 10% 模型利用率(MFU,小模型或稀疏生成時 GPU 的常見利用率):每 Token 耗能 40.9 µJ(40,900 nJ)。
- 即使在假設 100% 滿載利用率的理想極限下:每 Token 仍需耗能 4.09 µJ(4,090 nJ)。
- Extropic Z1T:
- 每 Token 總能耗僅需 294.52 nJ!
- 拆解能耗分佈:負責殘差與協同控制的 FPGA 消耗了 285.78 nJ;而 Z1 熱力學取樣晶片本身僅消耗了微不足道的 8.74 nJ。
結論:在真實負載下,Z1T 整體系統能效是 H100 的 139 倍;而在執行類神經取樣的核心層上,Z1 展現了高達 4,680 倍的懸殊能效差距!
2. 生成延遲對決:每秒 17,000 字的恐怖推論速度
在即時互動式 AI 應用中,延遲(Latency)決定了用戶體驗。
- NVIDIA H100(單批次解碼):
- PyTorch 原生模式:每 Token 耗時 702 µs(吞吐量約 1,425 Tokens/s)。
- 使用
torch.compile編譯優化後:每 Token 耗時 102 µs(吞吐量約 9,764 Tokens/s)。
- Extropic Z1T(保守估計模型):
- 總延遲僅需 58.8 µs!
- 換算生成吞吐量達到驚人的 17,000 Tokens/s!
延遲時間細項拆解: 在 Z1T 的 58.8 微秒中,FPGA 的協調操作佔了 38.0 微秒,Z1 晶片的物理並行取樣僅花費 16.0 微秒,其餘數據讀寫僅需 4.8 微秒。這意味著在邊緣設備或個人工作站上,熱力學架構具備帶來「瞬時生成」極致體驗的潛力。
局限與挑戰:熱力學晶片明天就能取代輝達嗎?
儘管 Z1T 展現了令人難以置信的物理前景,但若要走向大規模商業量產,Extropic 仍面臨諸多嚴峻考驗:
1. 系統能耗瓶頸反而在「數位端」
在目前的實測中,那塊用來處理非線性協同工作的 FPGA 消耗了全系統 95% 以上的電力(285.78 nJ / 294.52 nJ)。換言之,熱力學晶片太省電了,反而襯托出傳統數位晶片的笨重。Extropic 未來必須打造專屬的整合型 ASIC 協處理器,甚至將詞彙表讀出層也熱力學化,才能將整體系統能效真正推進至 1,000 倍以上。
2. Decode 強悍,但 Prefill 仍需 GPU
語言模型推論分為兩階段:處理長文本提示詞的「前綴填充」(Prefill),以及一個字一個字產生的「自回歸解碼」(Decode)。 Z1T 的架構目前在單批次解碼上所向披靡,但在面對數萬 Token 的長文本並行 Prefill 時,傳統 GPU 的高頻寬密集矩陣乘法依然效率更高。短期內,業界最可能的形態是**「GPU 負責讀取理解長 Prompt,TSU 熱力學晶片負責瘋狂吐字生成」**的混合架構。
3. 生態系護城河(The CUDA Moat)
輝達最強大的武器不是晶片本身,而是耕耘近二十年的 CUDA 軟體生態。雖然 Extropic 展現了十足的誠意,在 Hugging Face 開源了 Z1T 的模型權重,並在 GitHub 公開了完整的訓練配方,但從編譯器、推論框架(如 vLLM、TensorRT-LLM)到主流開發者工具鏈的支援,仍有漫長的地盤爭奪戰要打。
產業展望與投資觀察:美國晶片法案 7500 萬美元注資背後的戰略棋局
2026 年 7 月底,美國商務部宣布依據《晶片與科學法案》(CHIPS Act),與 Extropic 簽署了一項價值高達 7,500 萬美元的非約束性意向書(Letter of Intent, LOI)。
這筆資金的目標非常明確:
- 建立全美製造鏈: 推動熱力學取樣單元(TSU)在美國本土晶圓代工廠進行商業化規模量產;
- 建置 Z1 算力叢集: 打造首個全熱力學 AI 超級運算叢集,向美國國防部、能源部及學界開放 Early Access;
- 驗證次世代綠色 AI 戰略: 在全球 AI 資料中心耗電量逼近多國全國總用電量之際,為美國搶先佈局不受先進製程設備卡脖子的後摩爾定律替代算力。
投資人與科技產業該如何解讀?
- 對半導體版圖的啟示: 晶片產業正在從單純追求「電晶體微縮(摩爾定律)」轉向「領域特化物理運算架構」。除了光子計算、量子計算之外,熱力學運算已正式晉升為最具商業可行性的第三極。
- 雲端資料中心資本支出(Capex)拐點: 若 2027 年 Extropic 如期向早期客戶交付商業化晶片,雲端服務巨頭(CSP)在推論階段的電力成本將可能迎來斷崖式下降,這將直接推動 AI Agent 進行百萬步複雜推演的邊際成本趨近於零。
- 輝達的潛在威脅: 雖然短期內無人能撼動輝達在 AI 訓練市場的絕對統治,但在推論市場佔比超過 80% 的成熟期,以 Extropic 為代表的熱力學專用晶片,將成為最不可忽視的奇兵。
常見問題快速整理(FAQ)
Q1:什麼是 Extropic?這家公司是什麼來頭?
Extropic 是一家 2022 年成立於美國舊金山的底層硬體新創,由前 Google 量子 AI 科學家 Guillaume Verdon(即網路上著名的 e/acc 發起人 Beff Jezos)與 Trevor McCourt 共同創立。公司專注於開發利用熱力學物理原理進行機率取樣的新型 AI 晶片。
Q2:Z1 晶片與我們電腦裡的 CPU/GPU 有何不同?
CPU 和 GPU 都是傳統的數位邏輯晶片,靠高電壓維持「非 0 即 1」的確定性狀態,極度耗電;Z1 是「熱力學取樣單元」(TSU),採用亞閾值 CMOS 製造,直接利用常溫下電子的天然熱擾動(雜訊)來進行隨機運算,以百萬分之一的能量進行極速機率取樣。
Q3:Z1T 是一個全新的大語言模型,還是一種新架構?
Z1T 既是一種新型神經網路架構,也是 Extropic 訓練出的一系列開源模型家族。它借鑑了 Transformer 的自回歸特性,但將內部組件替換為適合熱力學晶片的門控卷積注意力(GCA)、動態雙曲正切(DyT)與稀疏連接權重。
Q4:號稱「能效提高 140 倍」,是真的已經實測,還是理論推導?
140 倍是 Extropic 基於 Z1 晶片底層物理實測取樣數據(每取樣 13 fJ)、搭配真實 FPGA 協處理器功耗模型,對比真實 NVIDIA H100 (80GB HBM3) 在相同參數量下的單批次推論綜合對比結果。該數據剔除了最後一層龐大的詞彙表密集矩陣,代表核心神經網路層的實質效率。
Q5:開發者現在可以使用 Z1T 嗎?
可以!Extropic 秉持開源精神,已經在 Hugging Face 上釋出了 Z1T 的開源權重,並在 GitHub 公開了完整的模型訓練配方與代碼。但若要享受到 140 倍的極致硬體能效,則需等待預計於 2027 年開放的 Z1 叢集硬體存取權限。
結語:從「對抗物理」到「順應物理」的智慧昇華
在過去半個世紀裡,人類的電腦科技史本質上是一部「馴服物理」的抗爭史——我們製造越來越精密的光刻機,雕刻越來越微小的電晶體,並注入龐大的電力,強迫混亂的物理世界服從冰冷精確的二進位代數。
然而,當人工智慧邁向具備認知、想像與直覺的通用智慧(AGI)時,我們終於發現,智慧的終極載體或許本就不是冰冷死板的矩陣乘法器。
正如 Guillaume Verdon 在技術發表中所寫道的:
「這只是軟硬體協同設計的一小步,卻是智慧實體化與極致緻密化(Densification of Intelligence)的一大步。」
當 AI 晶片開始擁抱熱雜訊,不再將熱力學視為敵人,而是當成天然的計算泉源,一條通往兆級參數、卻僅需幾顆電池驅動的綠色 AI 新紀元,或許正從這裡悄然展開。
資料來源與延伸閱讀
- Extropic 官方技術發表(2026-09-04): Z1T: Sparse Transformer-Like Models for Probabilistic Hardware
- Extropic 官方 X 平台公告: Extropic Status on Z1T Announcement
- 美國商務部《晶片法案》7,500 萬美元意向書公布: Department of Commerce Announces CHIPS Incentives with Extropic
- Z1 硬體技術白皮書: From One to One Billion: Torx, Thermalizers, and Z1
- Hugging Face 開源模型: Extropic Z1T Open Weights on HF
- GitHub 訓練庫: Extropic Z1T Open Training Recipe