Ai2 發布 Olmo-core 3:開放大型 MoE 訓練工具,兆級參數測試代表什麼?
Olmo-core 3 更新開放 MoE 訓練系統,改善 GPU 分工與資料路由。本文解釋專家混合模型、2.7 倍吞吐量比較,以及兆級參數測試與模型品質的差別。
Ai2 在 2026 年 10 月 1 日發布 Olmo-core 3,更新用來訓練大型語言模型的開放框架。這次重點是 MoE,也就是專家混合架構:模型包含許多專門處理不同輸入的元件,但每次只使用其中一部分。
這則消息比較像 AI 工廠的設備更新。它讓研究者研究如何更有效率地訓練模型,並非宣布使用者已能下載一款兆級參數的新聊天模型。

為什麼 MoE 只動用部分參數?
參數是模型訓練後學到的數值。一般密集模型處理文字時,幾乎整套模型都參與;MoE 會選擇部分專家元件處理輸入,希望在擴大總容量時控制單次運算量。
官方介紹提供一個測試:專家數從 8 增加到 128,每個 token 仍只選 4 個專家。Token 是模型處理文字的小單位,不一定等於一個中文字或英文單字。
在這個設定下,總參數從約 46 億增加到 470 億,每個 token 使用的參數仍約 32 億,訓練吞吐量下降不到 5%。吞吐量是固定時間能處理多少資料,這組數字說明系統如何擴大容量,不直接表示回答品質提升多少。
專家分散在 GPU,資料要送到對的地方
GPU 是常用來執行 AI 運算的晶片。當模型變大,單張 GPU 放不下全部內容,訓練系統就要安排不同晶片存放哪些部分,以及彼此如何交換資料。
官方說明,Olmo-core 3 的新系統讓專家留在 GPU 上,再把相關輸入送過去,減少反覆搬動模型權重(模型學到的核心參數)的工作。
可以把它想成把工作送到固定的專業工作桌,而不是每接到一批工作,就重新搬一次所有設備。這個比喻有助於理解方向,實際系統還涉及多種分工與通信安排。
2.7 倍比較的是指定訓練設定
在 8 張 NVIDIA B300 GPU 的初步測試中,470 億參數 MoE 的新系統每張 GPU 每秒處理約 52,000 個 token,舊實作約 19,400 個,吞吐量約為 2.7 倍。
這是官方對自家較早實作的比較,不是證明比所有其他訓練框架快 2.7 倍。硬體、模型與測試設定都影響結果。
我會把它看成一次有具體條件的工程改善。要判斷能否套用在另一個研究團隊,需要看模型配置、GPU 與資料傳輸方式,不能只取出倍數當通用承諾。
兆級參數測試,測的是系統規模
官方也測試了 1.2 兆總參數配置,使用 512 張 GPU,每個 token 啟用約 583.6 億參數。但這些測試使用隨機路由來評估系統效能,沒有用來評估訓練完成模型的回答品質。
另外,團隊嘗試 2.38 兆總參數配置。官方明確稱它為短時間容量測試,而非完整訓練,不能寫成已完成一款 2.38 兆參數模型。
這個區分是閱讀 AI 系統新聞的關鍵。系統裝得下、跑得動、持續訓練有效率,以及最後模型有用,是不同階段的問題。
開放訓練框架,讓研究者查看取捨
Olmo-core 3 不只公布效能,也公開訓練系統與技術報告。研究者可以改動硬體配置、路由與分工方法,觀察哪些方法在自己的情境有效。
官方介紹也列出未必成功的嘗試,例如讓通信與運算更多重疊,部分測試反而降低整體速度。這表示優化不能只看某一段變快,要看完整流程。
我認為公開這些取捨比單一漂亮數字更有研究價值。對沒有大型 GPU 叢集的一般讀者,這篇可以先用來理解大型模型背後的訓練工作,不必把它當成個人電腦安裝指南。
常見問題
Olmo-core 3 是聊天模型嗎?
它是開放的模型開發與訓練框架。這次發布主要更新大型 MoE 訓練系統。
MoE 每次只用部分參數,所以所有硬體需求都很低嗎?
總模型和訓練狀態仍需要存放,專家之間也有資料傳輸成本。單次啟用較少參數,不代表整個訓練工作很小。
兆級參數測試證明模型更聰明嗎?
沒有。官方說明這些是系統效能與容量測試,不能直接作為模型品質評測。
結語:看見大型模型背後的工程
Olmo-core 3 的更新把大型 MoE 訓練中的分工、搬運與運算效率放到檯面上。它讓開放模型研究不只有成品權重,也有可以研究的訓練基礎。
我會同時保留測試條件與結果的界線。系統效能改善值得關注,下一代模型的能力則要等實際模型與品質評估來回答。