Ai2/Hugging Face/官方:推出 Olmo-core 3——開源可擴至萬億參數級 MoE 訓練基建;專家池八至一百二十八、吞吐降幅少於百分之五;八卡 B300 約二點七倍吞吐

Key takeaway

Allen Institute for AI(Ai2)於二零二六年十月一日透過 Hugging Face 官方部落格發布 Olmo-core 3,把開源大型語言模型訓練框架升級為可擴至萬億參數級的 Mixture-of-Experts(MoE)訓練系統。官方基準顯示,專家池由八擴至一百二十八、總參數由約四十六億增至約四百七十億時,每 token 啟動參數仍約三十二億,訓練吞吐降幅少於百分之五;在八張 NVIDIA B300 上,相對舊版 FSDP 實作約達二點七倍吞吐。來源真實性已驗證。

Ai2/Hugging Face/官方:推出 Olmo-core 3——開源可擴至萬億參數級 MoE 訓練基建;專家池八至一百二十八、吞吐降幅少於百分之五;八卡 B300 約二點七倍吞吐

Allen Institute for AI(Ai2)於二零二六年十月一日透過 Hugging Face 官方部落格發布 Olmo-core 3,把開源大型語言模型訓練框架升級為可擴至萬億參數級的 Mixture-of-Experts(MoE)訓練系統。官方基準顯示,專家池由八擴至一百二十八、總參數由約四十六億增至約四百七十億時,每 token 啟動參數仍約三十二億,訓練吞吐降幅少於百分之五;在八張 NVIDIA B300 上,相對舊版 FSDP 實作約達二點七倍吞吐。來源真實性已驗證。

大型模型訓練成本與能耗持續上升,學術與中小型團隊愈難負擔「密集聚類」開發路徑。MoE 以「總參數大、每次只啟動少數專家」換取效率,但專家路由、跨 GPU 通訊與權重重分片,往往把理論優勢吃掉。Ai2 今次把訓練基建本身開源升級,並同步公開技術報告與 GitHub 程式碼,讓下一代 Olmo 與外部研究者共用同一套可驗證堆疊。來源真實性已驗證;本文整理官方公布的架構取捨、硬數字與對企業/香港市場的啟示。

一、核心事件

二零二六年十月一日,Ai2 在 Hugging Face 發表〈Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs〉,宣布 Olmo-core 3 正式釋出。重點不是單一權重檔,而是把 MoE 訓練系統重新設計,目標在維持計算效率的前提下,把訓練規模推到萬億參數級,並作為下一代 Olmo(將採 MoE 架構)的核心基礎設施。

技術細節

官方公布的關鍵基準包括:

  • 專家擴展壓力測試:專家池由 8 增至 128,每 token 仍只選 4 個專家,每 token 啟動參數約維持 3.2B;總參數容量由約 4.6B 增至約 47B,訓練吞吐降幅少於 5%。
  • 吞吐對比(初步測試):八張 NVIDIA B300 上,47B MoE 以新堆疊達每 GPU 約 52,000 tokens/s,舊版實作約 19,400 tokens/s,約 2.7×。
  • 萬億級量測:在 B300 叢集上基準測試含 1.2 萬億總參數、每 token 啟動約 58.36B、跨 512 GPU 的配置,最高觀測吞吐約 858 TFLOP/s/GPU(隨機路由,量測系統性能而非已訓練模型品質)。
  • 容量探邊:搭配 DeepEP v2 通訊路徑的短時容量測試曾達約 2.38 萬億總參數(非完整訓練行程)。
  • MXFP8:在四張 B300、專家負載均勻的受控基準中,相對 BF16 端到端訓練吞吐約高 21%,峰值活躍記憶體由約 103 GiB 降至約 95 GiB。

平行技術組合包括 expert parallelism、pipeline parallelism,以及把 optimizer state 分散的 distributed optimizer;路由側則提到 rowwise expert parallelism、GPU-resident routing 與 grouped GEMM,以降低資料重排與 CPU–GPU 往返等待。

二、技術原理深度解析

早期 Olmo-core 的 MoE 路徑偏重 FSDP:每個小 batch 反覆 gather/reshard 權重。Olmo-core 3 改以 DDP 思路為主,讓專家常駐 GPU,把相關資料路由過去,避免反覆搬動整份權重。這與「MoE 的成本往往花在通訊與協調,而非矩陣乘法本身」的工程現實一致。

Ai2 亦明示 NVIDIA Megatron-Core 已是成熟大規模 MoE 選項;Olmo-core 3 的價值在於把整合式 MoE 訓練棧嵌回 Olmo 自家開源框架,並相對其舊 FSDP 實作交出可複現的吞吐提升。技術報告另記載多項訓練與評測實驗(含最終未採用的方案),方便第三方複核取捨,而非只公開「成功數字」。

對開發者而言,重點是:開源的不只是權重,還有把 MoE 擴到萬億級時真正卡住的系統層決策——路由、平行切分、低精度格式與通訊棧如何一起調。

四、日常應用場景

1. 開發者與技術團隊

可直接在 GitHub(allenai/olmo-core)取用堆疊,按硬體調整 expert/pipeline 平行與 MXFP8 開關,自訓或微調領域 MoE,而不必一開始就綁定單一封閉訓練平台。

2. 企業與隱私敏感行業

金融、法律、醫療若需「資料不出境」的領域模型,開源訓練基建降低了自建 MoE 管線的門檻;仍須自備合規的資料治理、評測與上線閘門。企業亦可先以較小專家池驗證資料與評測協議,再垂直擴專家數。

3. 一般用戶

終端使用者短期不會直接操作 Olmo-core;間接受益來自後續更強、更可稽核的開源 Olmo 世代,以及研究社群以同一基建複製實驗。

4. 香港與亞洲市場視角

香港企業與大學實驗室常面對 GPU 時段有限、雲端出口成本敏感。官方顯示「總參數大增、啟動參數近乎固定、吞吐只微降」的曲線,有助以既有卡數嘗試更高容量 MoE,而不是只能追密集聚類的參數量。亞洲多語與垂直領域(粵語客服、監管文件、貿易單證)亦適合在開源棧上做可控微調。

五、專業評價與潛在考量

優勢

  • 硬數字清楚(專家擴展、B300 吞吐倍數、1.2T/512 GPU、MXFP8),便於採購與研究決策對照。
  • 訓練基建與技術報告、程式碼一併開放,符合「可複現開源」路線。
  • 明確對標下一代 Olmo 將走 MoE,產品路線與基建一致。

需要留意的地方

  • 萬億級數字多為系統基準或短時容量測試,不等於已釋出同規模、同品質的正式預訓練權重。
  • 2.7× 為相對 Ai2 舊 FSDP 實作的初步測試,不宜直接等同於對 Megatron-Core 或其他框架的全面勝出。
  • MXFP8 收益取決於轉換開銷與工作負載;真實路由不均時,數字可能偏移。
  • 企業落地仍須處理資料授權、安全評測與推論服務化,訓練棧本身不是完整 MLOps。

結語

Olmo-core 3 把「開源模型」競爭從權重檔推進到 可擴至萬億參數級的 MoE 訓練系統:在專家池大幅擴張時守住啟動參數與吞吐,並在 B300 上交出約二點七倍的實作級加速。對需要自訓或私有化領域模型的團隊,這是一條可稽核、可分叉的工程路徑。若你在香港規劃資料留港的私有模型微調與託管,可參考 YSK Limited 的企業私有 LLM 全託管(年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API,100% 數據不出境):https://ysk.hk/services/ai-automation


參考來源

Related services & products