Dust 挑戰反向傳播:Q Labs 用前向運算訓練語言模型,突破在哪、距離大模型多遠?
Q Labs 的 Dust 研究用前向運算估計模型更新方向,挑戰傳統反向傳播的訓練方式。本文解釋方法、實驗規模與運算限制,釐清千倍到萬倍的效率比較對象,避免把研究成果當成大型模型成本保證。
語言模型訓練的一個基本問題,正在重新吸引開發者討論:一定要依賴反向傳播嗎?Q Labs 的 Dust 研究在 2026 年 10 月 5 日的 Hacker News 討論中獲得關注,提出以多次前向運算估計學習方向的方法。這項研究值得看,因為它挑戰的是訓練方法。目前成果仍主要來自較小規模的實驗。
本文會進一步說明訓練的核心,並分析實際使用條件與評估方法。

改變學習方向的估計方式
一般訓練先讓模型產生輸出,再透過反向傳播,計算各個參數應該如何調整。參數是模型內部學到的數值。Dust 依照 官方研究,在模型的中間活動加入小幅擾動,比較多次前向運算的結果,藉此估計參數更新方向。
它不做傳統的反向運算,但仍然估計梯度,也仍使用像 SGD 這類更新方法。梯度可以理解為「往哪個方向調整,較可能讓錯誤減少」。所以這不是完全沒有學習方向、沒有最佳化程式的訓練。
有競爭力的結果,來自特定實驗條件
研究的主要語言模型實驗包含最高約 2.43 億參數與十億 token 的訓練資料規模。token 是模型讀取文字的切分單位。這和最前沿大型模型所需的訓練規模,仍然有很大的距離。
在部分投入較多運算的設定下,Dust 能接近或超過研究中的反向傳播基線。比較結果需要連同運算量、模型規模與評估條件一起看,不能推論所有訓練都會更省錢,或明天就能取代目前的大模型方法。
千倍到萬倍的說法,比較物件要看清楚
研究討論相對於在參數空間進行搜尋的方法,可能有約千倍至萬倍的效率改善估計。這個比較物件和傳統反向傳播不同,而且包含推估。因此不能把它寫成「比一般大模型訓練省一萬倍」。
我的看法是,Dust 的價值在於提供可以再測試的替代方法。新的訓練設計可能影響硬體分工與平行運算方式,但要回答成本問題,還需要更大規模的實驗和一致的運算預算比較。
訓練的核心,是知道哪些調整能讓預測更接近答案
語言模型訓練會先根據輸入預測後續文字,再與訓練資料中的答案比較。差距稱為損失,損失較低表示在該目標上預測較接近。訓練方法需要找到參數應該如何調整,才能降低這種差距。Dust 討論如何取得更新方向,仍需要明確訓練目標與持續優化。
傳統反向傳播利用計算過程中的關係,把損失的影響向前追溯到各個參數。它能夠提供有效的梯度,也就是表示參數小幅變化對損失影響的方向與程度。Dust 嘗試用前向運算與擾動估計取得相關方向,改變的是求取更新資訊的方法。
因此,「不用反向傳播」不能寫成「不用梯度」或「不需要優化」。Dust 仍進行參數更新,並可搭配既有優化方法。理解這個區分,才能看清研究挑戰:它需要在減少反向計算依賴的同時,取得足夠可靠的更新方向,讓模型繼續學習。
擾動就像做小幅試驗,但試驗位置影響效率
擾動可以理解成在計算中的某個位置加入小變化,再觀察結果如何改變。如果變化讓損失降低,就提供一個值得學習的方向。多個擾動樣本則幫助估計整體關係。這個直覺類似比較小幅調整前後的效果,但實際算法需要處理很多層與大量參數,不能只靠一個試驗完成訓練。
直接在龐大的參數空間隨機嘗試,容易需要很多樣本才能找到有用方向。Dust 把擾動放在模型計算中的激活,也就是中間層產生的數值。它嘗試利用這類位置取得更有效的信號,再對應到參數更新。研究的重點在於信號質量與計算安排,而不是隨機性本身。
這種方法的表現會受到擾動尺度、樣本數與模型結構影響。變化太小可能難以分辨,太大則可能偏離局部關係。官方附錄提供實驗與參數說明,讀者應把方法放回具體設置理解。簡化比喻可以幫助入門,實際判斷仍要看實驗條件。
更新方向需要分配到多層,這是信用分配問題
一個預測錯誤可能受到多層計算影響,訓練需要知道哪些部分應該改變。這個問題常稱為信用分配,意指把結果的影響合理分配給參與計算的部分。反向傳播擅長系統性處理這種關係,新的方法則需要以其他方式取得足夠資訊。
Dust 的研究嘗試利用激活擾動與局部關係估計更新方向。官方實驗關心估計與參考方向的接近程度,以及最終訓練損失。方法能產生方向只是第一步,方向是否穩定、能否持續降低損失,才決定訓練是否有效。
對讀者而言,值得觀察的是模型變大或資料增加後,這種分配是否仍保持效率。小模型實驗可以驗證機制,卻不能直接回答大型模型所有層級的運作成本。信用分配的困難不會因為前向計算看起來簡單就消失,它正是新訓練方法需要證明的核心之一。
千倍到萬倍的比較對象,不能換成反向傳播
官方報告約千倍到萬倍的效率差異,比較對象是特定參數空間演化策略方向估計,並非傳統反向傳播的總訓練成本。演化策略在這裡指通過多組擾動觀察表現、再估計更新方向的方法。比較範圍不同,會改變數字的意義。
如果把這個結果寫成大模型訓練費用可以直接降低千倍,就會超出實驗依據。方向估計所需樣本、完整訓練的運算與硬體時間,是不同層級。一個步驟的改善,未必以相同比例轉成整套訓練的節省。讀者需要確認圖表比較的任務與基準。
正確的觀察是,Dust 在所研究的條件下,能夠比特定重量空間擾動方法更有效取得方向。這為前向訓練提供研究價值。與反向傳播相比是否更經濟,則需要相同模型、資料與運算預算的完整比較,不能借用另一個比較對象的倍數。
目前實驗規模,仍與前沿大型模型有距離
官方實驗最高達到約二億四千三百萬參數,並使用到十億文字單位規模的訓練。這個範圍足以研究方法是否能夠訓練語言模型,也比簡單玩具任務更有說服力,但仍明顯小於目前許多大型模型。規模差距需要保留,不能從可訓練小模型直接推論可取代全部大型訓練。
參數與資料增加時,記憶體、通信與運算安排都可能改變。小規模上可並行的擾動,到了更大環境可能受到硬體資源限制。方法是否能繼續保持方向質量,也需要實驗驗證。這些問題屬於下一階段研究,而不是對當前成果的否定。
對工程團隊,最適合的是先在公開範圍內重現,再考慮自己的任務。若一開始就把方法套到遠大於實驗的模型,出現問題時很難知道來自實現、設置還是規模。逐步重現能夠讓研究價值被具體檢驗,也避免把新聞熱度轉成不必要的運算投入。
運算豐富的條件,需要同時比較樣本與時間
Dust 在運算資源較豐富的實驗設置中,可以取得與反向傳播接近或有競爭力的結果。更多擾動樣本有助於估計,但也會增加前向計算。能並行不代表沒有成本,實際收益取決於硬體如何執行、資料如何移動與訓練多久完成。
比較時可以分別看處理資料量、運算量、實際時間與最終損失。只固定訓練文字數量,可能讓一方使用更多計算。只固定時間,又可能受到硬體實現差異影響。清楚保留預算,才能知道方法是用更多資源換取結果,還是確實提高了效率。
記憶體也需要實測。減少某些反向計算需求,可能帶來不同儲存方式,但擾動樣本與並行安排也有自己的佔用。本文沒有把方法名稱當成已經證明的節省比例。工程評估應以實際量測說明,哪些資源減少,哪些資源增加。

公開附錄幫助讀者檢查研究的條件
Q Labs 提供架構、不同檢查點、樣本數與訓練結果等附錄,讓讀者可以看到主文之外的實驗設置。架構說明模型如何組成,圖表則比較不同條件下的方向與表現。它們幫助判斷成果來自什麼設置,而不只是看到一條宣傳性結論。
讀者看附錄圖時,應確認橫軸、縱軸與每條曲線對應條件。不同樣本數的改善,可能在某些階段明顯、在其他階段有限。只挑最好的一個點,會隱藏方法對設置的敏感度。完整圖表更適合用來決定重現實驗的範圍。
程式碼庫也提供進一步檢查入口,但公開程式碼不等於在任何環境都能直接取得相同結果。依賴、硬體與隨機種子都可能影響重現。團隊若嘗試,應保存版本與設置,讓差異可解釋。研究型工具的交付標準,應以可重複證據為核心。
重現研究,可以先檢查最小可比較範圍
重現不必一開始就追求最大的實驗。團隊可以先使用公開的小型配置,確認損失是否下降、方向估計是否符合預期,再增加樣本與資料。這樣更容易找到設定或實作問題,也能避免花費大量運算後仍無法解釋差異。
每次比較應記錄程式版本、訓練資料與硬體條件,並保留失敗結果。若只保存最好的一次,會低估方法的變動。多次重複與一致預算,能幫助判斷結果是否穩定,也讓研究討論從新聞標題回到可檢查的證據。
最有價值的後續,是在相同預算下持續擴大驗證
Dust 挑戰一個語言模型訓練的基礎方法,因此值得關注。後續需要觀察模型規模、資料量與任務範圍擴大後,方向估計是否仍穩定,以及完整成本是否具有優勢。這些證據會決定它是特定研究條件下的替代方法,還是能進入更多訓練工作。
對一般讀者,理解新方法不必等於預測反向傳播即將消失。訓練領域可以同時存在不同方法,適合的選擇取決於硬體、任務與預算。Dust 提供新的技術可能,當前實驗則說明可能性已有具體依據,但應用範圍仍需要繼續建立。
對研究與工程團隊,可以先從小規模、相同預算與固定評估開始。若能重現方向質量與訓練結果,再逐步擴大,比直接引用巨大倍數更有意義。把方法、比較對象與實驗規模一起保留,才能準確理解這則熱門研究的突破與距離。
實驗條件可參考 Dust 官方附錄 與 Q Labs 官方程式碼庫。
常見問題
不做反向傳播,就完全不用梯度嗎?
Dust 透過前向結果估計梯度,再更新模型。改變的是估計方式,不能把它稱為完全沒有梯度的方法。
這已經證明大型模型可以更便宜訓練嗎?
公開實驗規模與前沿大型模型有差距,也有特定運算條件。大型部署的成本優勢尚不能直接由這些結果確認。
研究熱度之後,看能否重現與擴大
官方提供程式碼,讓研究者有機會重現實驗。下一個值得追蹤的里程碑,是方法擴大後是否仍有競爭力,以及公平比較下的總成本如何變化。