Reflection AI 在 10 月 5 日發表首款旗艦開放權重模型 Beam,總參數 5,010 億、每次推論僅啟用 230 億,並採用 Apache 2.0 授權。這是美國陣營目前少見、直接對標 GLM-5.2 等中國開放模型的大型作品,官方更強調以 3 到 4 倍較低的推論運算量達到相近成績。
Beam 是什麼:501B 稀疏混合專家模型
根據 Reflection 官方部落格,Beam 是純文字的稀疏混合專家(MoE)模型,共 52 層,總參數 5,010 億、啟用參數 230 億。預訓練使用 23.8 兆個 token,資料來自網路與授權資料集,在 6,144 顆 NVIDIA GB300 NVL72 GPU 上不到 4 週完成,官方並公布預訓練有效運算比率(goodput)達 92.3%。上下文長度訓練時為 256K,經中期訓練後可延伸到 100 萬 token。
後訓練:逾億次 RL 展開、13 億個沙盒
Beam 的另一個重點是高運算量的強化學習。官方指出,RL 階段在 10,500 顆 GB300 上跑了 4 週,累計超過 1 億次 rollout,涵蓋約 100 萬個程式、代理與 STEM 任務環境,訓練與評分過程使用約 13 億個沙盒,同時最高可支撐 17 萬個並行沙盒。這套做法明顯朝向程式開發與代理工作流程,而非一般聊天。
成績單:程式與代理任務表現亮眼
官方公布的成績包括 Terminal Bench v2.1 80.1、SWE-bench Verified 80.9、SWE Bench Pro v1 65.5、SWE Bench Pro v2-Hard 77.2、SWE-bench Multilingual 78.0,以及 DeepSWE v1.1 44.4。Unite.AI 整理的數據另列出 AIME 2026 97.8、GPQA Diamond 90.5、Humanity’s Last Exam(不使用工具)36.2。這些數字目前都來自 Reflection 自行公布,尚無獨立第三方複測。
在比較對象上,Reflection 表示 Beam 在進階推理基準上可與 Z.ai 的 GLM-5.2 相當,但推論運算量只要三到四分之一。依 Unite.AI 的整理,Beam 在程式與代理任務上接近 Qwen 3.8-Max,原始能力則仍落後 Kimi K3。換句話說,Beam 的賣點是效率,而不是全面超越最強的中國模型。
權重何時開放:十月內,目前先開放候補名單
目前外界還拿不到完整權重。Reflection 表示模型仍在進行最後的紅隊測試與評估,現階段僅提供搶先體驗的候補登記,權重、技術報告與模型卡預計在 10 月稍後釋出,TechCrunch 報導將透過雲端大廠與新興算力雲端服務商提供。官方這次未公布 API 定價,實際部署成本得等權重與供應商報價出爐才能評估。
背後的資金與算力:NVIDIA 撐腰、估值 250 億美元
Reflection 成立於 2024 年,由兩位前 Google DeepMind 研究員創辦,投資人包括 NVIDIA、Sequoia 與 Lightspeed。TechCrunch 指出,公司在 4 月以 250 億美元投前估值募資,累計募資約 47 億美元,並與 SpaceX 簽下合計逾 70 億美元的算力協議,另與 Nebius 達成 10 億美元合作,硬體以 NVIDIA GB300 為主,合約期間至 2029 年。對想在企業、主權 AI 與開發者市場提供可客製化模型的 Reflection 而言,Beam 是第一次拿出足以支撐這些資金的成品。
對開發者的意義
如果權重如期以 Apache 2.0 釋出,企業將首次能在美系開放模型中選到走程式與代理路線、又有商用友善授權的大型選項,且 230 億的啟用參數讓自行部署的成本相對可控。不過在權重公開、獨立評測與實際價格出現之前,Beam 的效率優勢仍屬官方說法,值得持續觀察接下來兩到三週的後續發展。
資料來源
Reflection AI:Introducing Beam|TechCrunch|Unite.AI





