Reflection/官方:發布首個開放權重模型 Beam——五千零一億參數 MoE、每詞元啟用二百三十億;一萬零五百枚 GB300 強化學習四周逾一億次 rollout;SWE-bench Verified 八十點九;本月以 Apache 2.0 釋出權重

重點摘要

美國開放模型初創 Reflection AI 於香港時間十月六日凌晨發布首個開放權重模型 Beam:稀疏混合專家(MoE)架構、總參數五千零一億、每個詞元只啟用二百三十億,主打程式編寫、推理與代理(agent)工作。官方表示模型正進行最後紅隊測試,先開放候補名單試用,並將於本月內以 Apache 2.0 授權釋出權重、技術報告與模型卡。

Reflection/官方:發布首個開放權重模型 Beam——五千零一億參數 MoE、每詞元啟用二百三十億;一萬零五百枚 GB300 強化學習四周逾一億次 rollout;SWE-bench Verified 八十點九;本月以 Apache 2.0 釋出權重

美國開放模型初創 Reflection AI 於香港時間十月六日凌晨發布首個開放權重模型 Beam:稀疏混合專家(MoE)架構、總參數五千零一億、每個詞元只啟用二百三十億,主打程式編寫、推理與代理(agent)工作。官方表示模型正進行最後紅隊測試,先開放候補名單試用,並將於本月內以 Apache 2.0 授權釋出權重、技術報告與模型卡。

官方數據顯示,Beam 在 SWE-bench Verified 取得八十點九分、Terminal-Bench 2.1 取得八十點一分;強化學習階段動用一萬零五百枚 NVIDIA GB300 GPU 連續四周、產生逾一億次 rollout。Reflection 承認 Kimi K3 等更大型開放模型在原始能力上仍然領先,Beam 的賣點是推理算力效率:同級推理任務聲稱只需 GLM-5.2 約三分一至四分一算力。對香港企業而言,這是一個可商用、可自行部署的非中國開放權重選項。

Reflection/官方:發布首個開放權重模型 Beam——五千零一億參數 MoE、每詞元啟用二百三十億;本月以 Apache 2.0 釋出權重

由 NVIDIA 支持的 Reflection AI 於美國時間十月五日在官方網站發表長文〈Introducing Beam: Reflection’s 501B open-weight model〉,正式公開旗下首個模型。彭博同日以「Nvidia 支持的 Reflection 推出開放 AI 模型、挑戰中國」為題報道。本文內容已逐項核對 Reflection 官方發布原文(包括基準表、訓練規模與授權安排),來源真實性已驗證;所有基準分數均為 Reflection 自行公布或引用第三方的數字,尚待權重公開後由外界獨立重測。

本文重點:Beam 的規格與狀態、高算力強化學習的做法、與中國開放模型的比較、企業與香港市場的實際用法,以及需要留意的地方。

一、核心事件:Beam 是甚麼

技術細節

  • 架構:稀疏混合專家模型,總參數五千零一億(501B),每個詞元啟用約二百三十億(23B);共五十二層,交錯使用局部與全域注意力。
  • 預訓練:以二十三點八萬億(23.8T)詞元訓練,來源包括網頁、公開資料及授權專有數據集;在六千一百四十四枚 NVIDIA GB300 NVL72 GPU 叢集上用不足四周完成,期間只作九次半自動回退,後段有效訓練時間比例(goodput)達百分之九十二點三。
  • 中段訓練:把有效上下文長度延伸至一百萬詞元,為長流程代理任務鋪路。
  • 強化學習:一萬零五百枚 GB300 GPU 連續四周,產生逾一億次 rollout,單次最長上下文二十五萬六千詞元,訓練與評分共用上約十三億個沙盒;環境池接近一百萬個程式、代理與理工科任務。
  • 模態:只處理文字;圖像等資料須先轉為文字才可使用。
  • 發布狀態:正進行最後紅隊測試與評估,先向少數用戶開放候補試用;官方承諾本月內以 Apache 2.0 授權釋出權重,連同技術報告、模型卡、說明文件及運行、評測、微調的完整工具鏈,並會配合多個分發夥伴上架。

二、技術原理深度解析

1. 把強化學習當作主要的擴展方向。 Reflection 指出,隨着強化學習算力增加,Terminal-Bench、HLE 與 DeepSWE 分數持續上升,「未見平台期」。訓練期間平均同時運行十一萬個 rollout,最高同時開啟十七萬個沙盒,九成新沙盒於十秒內就緒;新權重推送至推理機隊的中位時間約十二秒。期間發生七十一宗推理故障,均無需中止訓練。

2. 完全非同步訓練與「策略陳舊」問題。 長 rollout 的前段詞元可能由較舊的權重版本生成,令學習不穩定。Reflection 為每個詞元標記生成版本,並開發新演算法處理陳舊度及訓練與推理引擎之間的數值差異;官方圖表顯示,即使樣本落後一百零七個權重版本(約一天),數值仍保持穩定。

3. 推理長度可調。 訓練時加入可控的長度懲罰,獎勵正確答案、壓抑多餘詞元。用戶可透過「reasoning effort」參數,在回應長度與表現之間取捨,按任務及算力預算調節。

4. 穩定的 MoE 底座。 在 DeepSeek 提出的無輔助損失負載平衡基礎上,加入專家偏置更新的餘弦衰減及序列級平衡;官方稱預訓練結束時最繁忙專家的負載只是平均值的一點零四倍,讓所有專家都能被強化學習充分利用。

5. 安全對齊。 另以同一預訓練檢查點訓練一個專門的安全對齊「老師模型」,再與大型強化學習老師以多老師在策略蒸餾(MOPD)合併;安全訓練採用「審慎對齊」(deliberative alignment)方法,把安全政策寫進模型的推理過程。官方表示會在技術報告公布安全評測結果,並開源內部安全評測。

三、日常應用場景

1. 開發者與技術團隊

官方基準表中,Beam 的 SWE-bench Verified 為八十點九、SWE Bench Pro v1 為六十五點五、Terminal-Bench 2.1 為八十點一、MCP Atlas 為七十八點七、BrowseComp(配合上下文管理)為七十七點四。這組分數主要面向「讀 repo、改程式、跑終端機、呼叫工具」的代理工作流。官方示範包括接駁 OpenCode 編寫 Gemma-4 微調筆記本,以及用公開資料建立紐約地鐵即時地圖。

2. 企業與隱私敏感行業

Apache 2.0 屬寬鬆授權,可商用、可修改、可在私有雲、本地機房以至離線環境部署。對銀行、保險、律師行及醫療機構而言,代碼與文件可留在自己的機房,而不必傳送到第三方 API。不過要留意:五千零一億參數以每參數一字節粗略估算,單是權重已約五百 GB,實際部署通常需要多卡伺服器或量化版本,成本須按實際負載計算。

3. 一般用戶

Beam 本身不是消費級聊天應用;一般用戶較可能透過分發夥伴的平台或第三方工具間接接觸它。官方表示 Reflection 亦會以自家 API 平台提供服務。

4. 香港與亞洲市場視角

過去一年,開放權重前沿大多由中國模型主導——官方比較表亦以 GLM 5.2/5.3、Kimi K3、Qwen 3.8 Max 及 DeepSeek V4.1 Flash 作對照。其中 Kimi K3 的 Terminal-Bench 2.1 為八十八點三、DeepSeek V4.1 Flash 為九十點六,均高於 Beam。對有美資背景、須回應客戶或監管機構「模型來源」查詢的香港企業(例如外資銀行、跨國專業服務公司),一個美國出品、Apache 2.0 授權的開放權重模型,多了一個合規上較易解釋的選項;而本地團隊亦可以在同一套私有部署架構中,按任務並用中美不同的開放模型。

四、專業評價與潛在考量

優勢

  • 授權清晰:Apache 2.0 可商用,比部分附加使用條款的開放模型更易進入企業採購流程。
  • 算力效率:只啟用二百三十億參數,官方稱高階推理題目上表現接近 GLM-5.2,但推理算力只需約三分一至四分一;與二萬億參數級別模型相比,差距更大。
  • 工程透明度高:發布文已詳列訓練規模、故障處理及資料處理方法,並承諾公開技術報告與安全評測。

需要留意的地方

  • 權重尚未公開:目前只有官方公布的分數,外界未能獨立重測;算力比較屬官方以「二乘啟用參數乘生成詞元」的估算,不計預填與服務開銷,並非實測成本。
  • 原始能力未到頂:官方亦承認 Kimi K3 等模型仍然領先,部分基準更落後於 DeepSeek V4.1 Flash。
  • 只支援文字:需要讀圖、讀掃描文件的工作流,須另配 OCR 或多模態模型。
  • 硬件門檻:總參數五千零一億,自行部署的記憶體與 GPU 需求遠高於二百三十億啟用參數給人的印象。

結語

Beam 是美國陣營少數以「前沿規模、寬鬆授權、完整工具鏈」一併推出的開放權重模型,重點不在全面超越中國對手,而在以較低推理算力提供足以應付程式與代理工作的能力。權重預計本月內公開,屆時第三方重測與量化版本的表現,將決定它能否成為企業私有部署的主力選擇。

如需在香港把這類開放權重模型部署在自己的機房、確保數據不出境,可參考 YSK Limited 的企業私有 LLM 全託管(年費 HK$88,000 起,https://ysk.hk/services/ai-automation);若想先在本機以 OpenAI 相容介面試用 Hugging Face 權重,可參考 MIT 開源的 YSK Omni v1.0.2(預設埠 3850,GGUF 走 llama-server、safetensors 走 vLLM,https://ysk.hk/products/ysk-omni)。


參考來源

  1. Reflection AI 官方:Introducing Beam: Reflection’s 501B open-weight model(2026-10-05)— https://reflection.ai/blog/introducing-beam
  2. Reflection AI 官方新聞室 — https://reflection.ai/news
  3. 彭博:Nvidia-Backed Reflection Unveils Open AI Model, Taking on China(2026-10-05)— https://www.bloomberg.com/news/articles/2026-10-05/nvidia-backed-reflection-unveils-open-ai-model-taking-on-china
  4. 發現來源:Bloomberg Technology RSS

延伸閱讀 · 相關服務與產品