Dust 挑戰反向傳播:Q Labs 用前向運算訓練語言模型,突破在哪、距離大模型多遠?

Q Labs 的 Dust 研究用前向運算估計模型更新方向,挑戰傳統反向傳播的訓練方式。本文解釋方法、實驗規模與運算限制,釐清千倍到萬倍的效率比較對象,避免把研究成果當成大型模型成本保證。

Share
Q Labs Dust 官方研究方法動畫的原始第一幀
擷取自 Q Labs 官方方法動畫的第一幀,保留原始研究示意。 圖片來源:https://qlabs.sh/research/dust

語言模型訓練的一個基本問題,正在重新吸引開發者討論:一定要依賴反向傳播嗎?Q Labs 的 Dust 研究在 2026 年 10 月 5 日的 Hacker News 討論中獲得關注,提出以多次前向運算估計學習方向的方法。這項研究值得看,因為它挑戰的是訓練方法。目前成果仍主要來自較小規模的實驗。

本文會進一步說明訓練的核心,並分析實際使用條件與評估方法。

Q Labs Dust 官方研究方法動畫的原始第一幀
擷取自 Q Labs 官方方法動畫的第一幀,保留原始研究示意。 圖片來源:Q Labs。

改變學習方向的估計方式

一般訓練先讓模型產生輸出,再透過反向傳播,計算各個參數應該如何調整。參數是模型內部學到的數值。Dust 依照 官方研究,在模型的中間活動加入小幅擾動,比較多次前向運算的結果,藉此估計參數更新方向。

它不做傳統的反向運算,但仍然估計梯度,也仍使用像 SGD 這類更新方法。梯度可以理解為「往哪個方向調整,較可能讓錯誤減少」。所以這不是完全沒有學習方向、沒有最佳化程式的訓練。

有競爭力的結果,來自特定實驗條件

研究的主要語言模型實驗包含最高約 2.43 億參數與十億 token 的訓練資料規模。token 是模型讀取文字的切分單位。這和最前沿大型模型所需的訓練規模,仍然有很大的距離。

在部分投入較多運算的設定下,Dust 能接近或超過研究中的反向傳播基線。比較結果需要連同運算量、模型規模與評估條件一起看,不能推論所有訓練都會更省錢,或明天就能取代目前的大模型方法。

千倍到萬倍的說法,比較物件要看清楚

研究討論相對於在參數空間進行搜尋的方法,可能有約千倍至萬倍的效率改善估計。這個比較物件和傳統反向傳播不同,而且包含推估。因此不能把它寫成「比一般大模型訓練省一萬倍」。

我的看法是,Dust 的價值在於提供可以再測試的替代方法。新的訓練設計可能影響硬體分工與平行運算方式,但要回答成本問題,還需要更大規模的實驗和一致的運算預算比較。

訓練的核心,是知道哪些調整能讓預測更接近答案

語言模型訓練會先根據輸入預測後續文字,再與訓練資料中的答案比較。差距稱為損失,損失較低表示在該目標上預測較接近。訓練方法需要找到參數應該如何調整,才能降低這種差距。Dust 討論如何取得更新方向,仍需要明確訓練目標與持續優化。

傳統反向傳播利用計算過程中的關係,把損失的影響向前追溯到各個參數。它能夠提供有效的梯度,也就是表示參數小幅變化對損失影響的方向與程度。Dust 嘗試用前向運算與擾動估計取得相關方向,改變的是求取更新資訊的方法。

因此,「不用反向傳播」不能寫成「不用梯度」或「不需要優化」。Dust 仍進行參數更新,並可搭配既有優化方法。理解這個區分,才能看清研究挑戰:它需要在減少反向計算依賴的同時,取得足夠可靠的更新方向,讓模型繼續學習。

擾動就像做小幅試驗,但試驗位置影響效率

擾動可以理解成在計算中的某個位置加入小變化,再觀察結果如何改變。如果變化讓損失降低,就提供一個值得學習的方向。多個擾動樣本則幫助估計整體關係。這個直覺類似比較小幅調整前後的效果,但實際算法需要處理很多層與大量參數,不能只靠一個試驗完成訓練。

直接在龐大的參數空間隨機嘗試,容易需要很多樣本才能找到有用方向。Dust 把擾動放在模型計算中的激活,也就是中間層產生的數值。它嘗試利用這類位置取得更有效的信號,再對應到參數更新。研究的重點在於信號質量與計算安排,而不是隨機性本身。

這種方法的表現會受到擾動尺度、樣本數與模型結構影響。變化太小可能難以分辨,太大則可能偏離局部關係。官方附錄提供實驗與參數說明,讀者應把方法放回具體設置理解。簡化比喻可以幫助入門,實際判斷仍要看實驗條件。

更新方向需要分配到多層,這是信用分配問題

一個預測錯誤可能受到多層計算影響,訓練需要知道哪些部分應該改變。這個問題常稱為信用分配,意指把結果的影響合理分配給參與計算的部分。反向傳播擅長系統性處理這種關係,新的方法則需要以其他方式取得足夠資訊。

Dust 的研究嘗試利用激活擾動與局部關係估計更新方向。官方實驗關心估計與參考方向的接近程度,以及最終訓練損失。方法能產生方向只是第一步,方向是否穩定、能否持續降低損失,才決定訓練是否有效。

對讀者而言,值得觀察的是模型變大或資料增加後,這種分配是否仍保持效率。小模型實驗可以驗證機制,卻不能直接回答大型模型所有層級的運作成本。信用分配的困難不會因為前向計算看起來簡單就消失,它正是新訓練方法需要證明的核心之一。

千倍到萬倍的比較對象,不能換成反向傳播

官方報告約千倍到萬倍的效率差異,比較對象是特定參數空間演化策略方向估計,並非傳統反向傳播的總訓練成本。演化策略在這裡指通過多組擾動觀察表現、再估計更新方向的方法。比較範圍不同,會改變數字的意義。

如果把這個結果寫成大模型訓練費用可以直接降低千倍,就會超出實驗依據。方向估計所需樣本、完整訓練的運算與硬體時間,是不同層級。一個步驟的改善,未必以相同比例轉成整套訓練的節省。讀者需要確認圖表比較的任務與基準。

正確的觀察是,Dust 在所研究的條件下,能夠比特定重量空間擾動方法更有效取得方向。這為前向訓練提供研究價值。與反向傳播相比是否更經濟,則需要相同模型、資料與運算預算的完整比較,不能借用另一個比較對象的倍數。

目前實驗規模,仍與前沿大型模型有距離

官方實驗最高達到約二億四千三百萬參數,並使用到十億文字單位規模的訓練。這個範圍足以研究方法是否能夠訓練語言模型,也比簡單玩具任務更有說服力,但仍明顯小於目前許多大型模型。規模差距需要保留,不能從可訓練小模型直接推論可取代全部大型訓練。

參數與資料增加時,記憶體、通信與運算安排都可能改變。小規模上可並行的擾動,到了更大環境可能受到硬體資源限制。方法是否能繼續保持方向質量,也需要實驗驗證。這些問題屬於下一階段研究,而不是對當前成果的否定。

對工程團隊,最適合的是先在公開範圍內重現,再考慮自己的任務。若一開始就把方法套到遠大於實驗的模型,出現問題時很難知道來自實現、設置還是規模。逐步重現能夠讓研究價值被具體檢驗,也避免把新聞熱度轉成不必要的運算投入。

運算豐富的條件,需要同時比較樣本與時間

Dust 在運算資源較豐富的實驗設置中,可以取得與反向傳播接近或有競爭力的結果。更多擾動樣本有助於估計,但也會增加前向計算。能並行不代表沒有成本,實際收益取決於硬體如何執行、資料如何移動與訓練多久完成。

比較時可以分別看處理資料量、運算量、實際時間與最終損失。只固定訓練文字數量,可能讓一方使用更多計算。只固定時間,又可能受到硬體實現差異影響。清楚保留預算,才能知道方法是用更多資源換取結果,還是確實提高了效率。

記憶體也需要實測。減少某些反向計算需求,可能帶來不同儲存方式,但擾動樣本與並行安排也有自己的佔用。本文沒有把方法名稱當成已經證明的節省比例。工程評估應以實際量測說明,哪些資源減少,哪些資源增加。

Q Labs 官方附錄比較不同檢查點與擾動樣本數;圖中的研究條件不可視為大型模型效能保證。
Q Labs 官方附錄比較不同檢查點與擾動樣本數;圖中的研究條件不可視為大型模型效能保證。 圖片來源:Q Labs。

公開附錄幫助讀者檢查研究的條件

Q Labs 提供架構、不同檢查點、樣本數與訓練結果等附錄,讓讀者可以看到主文之外的實驗設置。架構說明模型如何組成,圖表則比較不同條件下的方向與表現。它們幫助判斷成果來自什麼設置,而不只是看到一條宣傳性結論。

讀者看附錄圖時,應確認橫軸、縱軸與每條曲線對應條件。不同樣本數的改善,可能在某些階段明顯、在其他階段有限。只挑最好的一個點,會隱藏方法對設置的敏感度。完整圖表更適合用來決定重現實驗的範圍。

程式碼庫也提供進一步檢查入口,但公開程式碼不等於在任何環境都能直接取得相同結果。依賴、硬體與隨機種子都可能影響重現。團隊若嘗試,應保存版本與設置,讓差異可解釋。研究型工具的交付標準,應以可重複證據為核心。

重現研究,可以先檢查最小可比較範圍

重現不必一開始就追求最大的實驗。團隊可以先使用公開的小型配置,確認損失是否下降、方向估計是否符合預期,再增加樣本與資料。這樣更容易找到設定或實作問題,也能避免花費大量運算後仍無法解釋差異。

每次比較應記錄程式版本、訓練資料與硬體條件,並保留失敗結果。若只保存最好的一次,會低估方法的變動。多次重複與一致預算,能幫助判斷結果是否穩定,也讓研究討論從新聞標題回到可檢查的證據。

最有價值的後續,是在相同預算下持續擴大驗證

Dust 挑戰一個語言模型訓練的基礎方法,因此值得關注。後續需要觀察模型規模、資料量與任務範圍擴大後,方向估計是否仍穩定,以及完整成本是否具有優勢。這些證據會決定它是特定研究條件下的替代方法,還是能進入更多訓練工作。

對一般讀者,理解新方法不必等於預測反向傳播即將消失。訓練領域可以同時存在不同方法,適合的選擇取決於硬體、任務與預算。Dust 提供新的技術可能,當前實驗則說明可能性已有具體依據,但應用範圍仍需要繼續建立。

對研究與工程團隊,可以先從小規模、相同預算與固定評估開始。若能重現方向質量與訓練結果,再逐步擴大,比直接引用巨大倍數更有意義。把方法、比較對象與實驗規模一起保留,才能準確理解這則熱門研究的突破與距離。

實驗條件可參考 Dust 官方附錄 與 Q Labs 官方程式碼庫。

常見問題

不做反向傳播,就完全不用梯度嗎?

Dust 透過前向結果估計梯度,再更新模型。改變的是估計方式,不能把它稱為完全沒有梯度的方法。

這已經證明大型模型可以更便宜訓練嗎?

公開實驗規模與前沿大型模型有差距,也有特定運算條件。大型部署的成本優勢尚不能直接由這些結果確認。

研究熱度之後,看能否重現與擴大

官方提供程式碼,讓研究者有機會重現實驗。下一個值得追蹤的里程碑,是方法擴大後是否仍有競爭力,以及公平比較下的總成本如何變化。

資料來源

延伸閱讀

Read more

【Future Circle 共筆】AI 總是生成一樣的圖片?從理解同質化到如何保留差異

【Future Circle 共筆】AI 總是生成一樣的圖片?從理解同質化到如何保留差異

當 AI 已經能快速產出夠好的答案,同質化的關鍵或許不只是 AI 能產出什麼 生成式AI已經成為我們日常生活中習慣的工具,你是否發現生成的圖片或文章往往透著一股難以言喻的相似感?這並非錯覺,而是「AI 同質化」的現象。本文將以圖片生成為例,討論 AI 模型本身的限制,以及使用者過度依賴「生成公式」如何加劇審美收斂。在追求產出效率的時代,打破同質化的關鍵在保留批判性思維、專業經驗積累與跨界連結的能力。AI 或許能快速提供及格的答案,但我們應該珍視並保留人類獨有的主體性與經驗;只要反客為主善用這項工具,AI 同樣能幫助我們探索更多意想不到的可能。