26 位學者發表硬體暫停論文:停產訓練晶片,前沿 AI 真能停十年?
26 位跨領域學者發表 210 頁工作論文,評估用晶片管制讓前沿 AI 訓練暫停十年的可行性。本文整理停產訓練晶片、改用推論專用晶片、查核違規訓練的做法與前提。
暫停 AI 的呼聲越來越多,但最常被追問的是另一件事:別人不停,我為什麼要停?
一份 210 頁的工作論文,試著從硬體回答這個協調難題。
論文名為《The Feasibility of a Hardwired Pause of Frontier AI Training》,由 26 位學者共同掛名,10 月上旬公開。
作者群來自統計、哲學、經濟、國際關係與電機,包括柏克萊電腦科學教授 Stuart Russell 與經濟學家 Barry Eichengreen。
它提出的「硬體暫停」,是禁止訓練新的前沿模型,同時停產能做訓練的晶片,逐步換成只能跑既有模型的晶片。
我認為這份論文的價值,在於把「能不能停」拆成可以檢驗的條件,政治意願則被明確放在分析之外。

硬體暫停要停什麼,又保留什麼?
先說兩個名詞。訓練是用大量算力打造新模型,推論則是用已經做好的模型回答問題。
論文說,這個方案只禁止前沿等級的訓練,允許各國繼續使用核准清單上的既有模型。
第二個核心是晶片。各國要停止生產可訓練晶片,並把現有存量逐步換成推論專用晶片。
論文舉的例子是「模型專用晶片」,製造時就把某個模型的結構與權重刻進電路。權重是模型學到的數值,決定輸入資訊如何變成答案。
這種晶片能快速、省電地跑那一個模型,論文認為就算被偷走,也很難拿來訓練新模型。
論文引述新創 Taalas 自己公布的數據:其原型晶片跑 Llama 3.1 8B 時,單一使用者每秒約 17,000 個詞元。
作者也提醒,這是單一使用者的速度,整體吞吐量仍是通用加速器較強。詞元是模型處理文字的片段,吞吐量則是同時服務所有使用者的總量,兩者不能直接比較。
換晶片之所以重要,是因為作者擔心暫停期間晶片繼續累積。他們稱這些存量為「乾柴」,一旦有人退出協議,就能點燃新一輪競賽。
怎麼抓到有人偷偷訓練?
作者把查核當成數量問題。用一台電腦訓練小模型幾乎抓不到,但動用數十萬到數百萬顆晶片的前沿訓練,就難以隱藏。
論文估計,前沿訓練的算力預算過去約每 18 個月成長十倍。
依論文的算力估算,想在暫停後明顯超越前沿,違規者需要動用全球算力的可觀比例,持續數月到數年。這是方案的核心假設,也解釋了作者為何把查核重心放在大規模晶片供應。
違規分成兩種。「暗中規避」是表面遵守、私下訓練,作者認為合理的查核在短期內大致足以防範。
「公開毀約」則是某國囤積大量晶片後直接退出協議,單靠查核擋不住,所以才需要減少可訓練晶片的總量。
具體做法包括全球晶片普查。作者建議比對銷售紀錄、稅務資料、機房庫存與電費帳單,找出暫停前的晶片。
普查和換晶片都要時間,所以論文把過渡期分成四個階段來安排。
四個階段與十年的前提
第零階段在正式協議之前,市場已因效率因素開始改用推論晶片。第一階段從協議生效開始,禁令上路,同時設計新晶片並啟動普查。
第二階段是推論晶片大量量產,舊的可訓練晶片透過以舊換新或回購陸續退役。
第三階段,多數推論改由推論專用晶片承擔。論文特別說明,各階段的長度要看各國準備程度與產能。
晶片數量固定,也不代表模型能力完全不會進步。研究者仍可能改良訓練方法,讓相同晶片做到更多事,因此方案還必須計入演算法變強的速度。
至於能否撐十年,作者給出一個門檻:暫停後的訓練效率進步,不能快過每五年提升十倍。
他們列出四個前提:各國共同管理晶片製造、分享資訊找出舊晶片、推論晶片及時量產,以及訓練效率進步不比暫停前更快。
論文也承認代價。查核需要新的監管體制,方案也可能鞏固領先企業的市場地位,模型的安全漏洞更難靠重新訓練修補。
作者也強調,保留既有模型服務,就仍要處理這些模型帶來的風險。硬體暫停要防止能力持續向前衝,不能取代服務部署、安全測試與濫用防範。
這些代價會不會被接受,取決於各國是否真有暫停意願,而論文在一開始就把這點設為假設。
常見問題
這份論文主張現在就該暫停 AI 嗎?
論文明說只研究可行性,不評估暫停是否比其他政策好,也不估計實施機率。共同作者也不一定同意每項主張。
一般人還能用 AI 服務嗎?
依論文設計,核准清單上的既有模型可以繼續提供推論服務。受限制的是訓練更強的新前沿模型。
這個方案有國家採納嗎?
目前它是標示為 1.0.1 版的學術工作論文,內容是方案設計與可行性分析,並不是已簽署的國際協議。
結語
硬體暫停的核心邏輯,是管住能做訓練的晶片,而不必審查使用者輸入的每個提示詞。它能否落地,要看美中兩國是否願意接受普查與晶片退役,這仍是論文之外的政治題。
延伸閱讀:Dario Amodei 為何主張放慢前沿 AI?讓安全門檻決定模型加速速度
延伸閱讀:OpenAI Jalapeño 是什麼?首款 AI 推論晶片效能、Broadcom 合作與 NVIDIA 影響解析