先看证据
把机制串起来
MoE(混合专家)模型会按 token 路由到部分专家,因此总参数量不等于每个 token 都要计算的参数量;但推理成本也受生成长度、注意力计算和服务开销影响。强化学习中的 rollout,是模型在任务环境里尝试解题并收集结果;异步训练则允许采样、训练和部署不同步,必须处理新旧策略之间的差异。
架构采用局部与全局注意力交替,并以细粒度路由专家扩大模型容量;每个 token 激活 23B 参数,而不是全部 501B。专家负载均衡以 DeepSeek-V3 的无辅助损失方法为基础,通过余弦衰减专家偏置更新,降低训练后期反复调整路由的幅度;官方称最忙专家负载仅为平均值的 1.04 倍。为控制 52 层网络的残差尺度,训练结合深度缩放、SandwichNorm、注意力门控和 FP32 残差累加,代价是增加训练实现与数值管理复杂度。RL 采用完全异步策略梯度,每个 token
['适合代码、推理和企业智能体任务的评测试用', '按难度调节reasoning effort,控制回答长度与算力', '3至4倍优势不等于端到端延迟或账单降低同倍数', '公告时权重仍在红队测试,尚不能自行部署']
开放权重发布,模型却还不能下载
Reflection AI于2026年10月5日发布Beam,这是公司首个开放权重模型,面向企业代码、推理和智能体任务。它是一个文本模型,采用稀疏混合专家架构,总参数5010亿,每个token激活约230亿参数。Reflection把它定位为开放模型前沿的竞争者,也明确承认Kimi K3在原始能力上仍领先。
这次发布的落差在于,“开放权重”描述的是计划中的交付方式,而非当下的使用状态。公告时Beam仍在最终红队测试,早期访问需要排队,Apache 2.0权重、技术报告、模型卡和开发者工具都计划稍后发布。因此,眼下企业面对的不是一个已经可以自行部署的候选模型,而是一组值得等待验证的性能与效率主张。
参数规模与每次推理的计算量不是一回事
Beam的关键架构数字容易被混为一谈:501B是总参数量,23B是每个token激活的参数量。稀疏MoE只调用部分专家参与单次计算,这为“模型很大、推理计算相对少”的设计提供了基础,但并不意味着部署只需承担23B模型的全部成本。专家权重仍要被承载,具体内存、吞吐和服务成本还取决于实现与硬件配置;现有材料没有给出这些端到端数据。
Reflection称,Beam在推理基准上接近GLM-5.2,同时使用少3至4倍的推理计算。这个倍数不是线上延迟或账单的保证:官方估算依据包括激活参数和生成token数,并排除了prompt prefill、随上下文变化的attention计算以及服务开销。对技术负责人来说,这更适合作为待复核的计算量指标,而不是采购模型服务时可直接套用的成本折扣。
训练规模解释了它为何强调智能体任务
Beam的效率叙事并不只靠MoE架构。Reflection称,预训练使用了23.8万亿个token,数据来自网络、公共来源和专有授权数据集;数据整理过程中移除了约95%的原始互联网token,同时保留约1.8万亿个传统过滤可能丢弃的高质量token。公司还称,预训练在6144张NVIDIA GB300 NVL72 GPU上不到四周完成,之后通过midtraining把有效上下文扩展到1M token。
更突出的投入在强化学习阶段:团队报告使用约10,500张GB300 GPU运行四周,生成超过1亿次rollout,并在近百万个代码、智能体和STEM环境中训练与评分,涉及约13亿个sandbox。最大rollout上下文是256K token,这与后来扩展出的1M有效上下文不是同一个训练口径。Reflection还称,长度惩罚让模型倾向于用更少token完成任务,浏览能力也在没有浏览任务参与RL的情况下得到提升;这提示训练可能产生跨任务迁移,但现有材料不足以判断迁移的范围与稳定性。
基准成绩支持“接近”,不支持全面打平
Beam公布的成绩呈现出有竞争力、但并非处处领先的图景。在AIME 2026上,Reflection给出的Beam成绩为97.8,GLM-5.2为99.2;HLE无工具成绩分别为36.2和40.5;GPQA Diamond分别为90.5和91.2。Terminal Bench v2.1上Beam为80.1,接近GLM-5.2的81.0,但DeepSeek V4.1 Flash和Kimi K3分别达到90.6和88.3。SWE-bench Verified上,Beam为80.9,高于材料列出的Nemotron 3 Ultra的70.7。
这些数字可以支持“部分项目接近强力对手”,却不能证明整体能力相同,更不能证明计算优势在所有任务上成立。成绩来自Reflection公布的表格,部分竞品数据由Artificial Analysis和DataCurve提供;TechCrunch指出相关性能主张尚未经过独立验证。比较时还要核对任务版本、工具条件和评测设置,否则单个分数既可能高估能力,也可能掩盖模型在特定工作流中的短板。
企业现在该验证什么,而不是先押注什么
对于正在评估代码或智能体模型的团队,Beam的价值要等权重发布后才能落到实际工作负载上。优先测试的不是单一基准分,而是相同任务下的成功率、生成token数、延迟、上下文长度和硬件占用,并把prompt prefill与服务成本计入。reasoning effort参数也值得按任务难度分层评估,因为它允许在较短回答和更长推理之间调整,但材料没有提供各档设置的成本—质量曲线。
部署判断还取决于尚未公开的内容:最终权重是否按计划以Apache 2.0发布,模型卡与技术报告如何界定数据和安全评估,以及企业环境中大规模推理的真实资源需求。Reflection称Beam仍在最终红队阶段,安全评估结果将放入技术报告,因而现阶段不能把安全性或合规性当作已验证结论。合理的做法是把Beam列为候选并设定复测门槛,等权重、完整报告和独立测试到位后,再决定它是否真能以更低的总成本承担生产任务。