先看证据
一款新模型,先带来供给变化
Reflection AI 于2026年10月5日公布 Beam,称它是公司的首款开放权重模型,面向编程、推理和智能体任务。Beam从头训练,采用总参数501B、每个 token 激活23B的稀疏混合专家架构;公司承诺稍后以 Apache 2.0 发布权重、技术报告和模型卡,但在公告时这些材料尚未交付。
这次发布值得读,不是因为 Beam 已经压过现有领先模型,而是因为一个此前长期隐身的美国团队终于给出了可供检验的训练与模型计划。Reflection称 Beam 可与 GLM 5.2 竞争,但材料也指出 GLM 5.3、Kimi K3、Qwen 3.8 Max 和 DeepSeek V4.1 Flash 总体仍领先。换句话说,Beam首先扩大了美国自研开放模型的选项,能力排名仍是待验证的问题。
稀疏激活不等于小模型
Beam每个 token 激活23B参数,说明一次计算只调用模型的一部分专家,而不是每次都使用全部501B参数。这种稀疏激活有助于控制计算量,但总参数规模仍然会影响模型权重的存储和部署安排。现有材料没有提供运行 Beam 所需的硬件门槛,因此不能把“23B激活”直接读成“23B级别即可部署”。
Reflection还称,Beam交错使用全局注意力与滑动窗口注意力。直观上,局部窗口让模型集中处理邻近内容,全局注意力则为跨较长文本的信息联系保留通路;这是一种计算和上下文处理之间的取舍,而非单纯追求更大的上下文数字。公告提到 midtraining 把“有效上下文长度”扩展到1M tokens,同时 RL 阶段最大上下文长度为256K。两种口径如何对应,公开信息尚未说明,不能据此认定当前使用窗口就是1M。
训练规模背后,是一座任务工厂
Reflection公布的训练数字显示,Beam预训练使用23.8T tokens,在不到四周内完成,期间使用6,144张 GB300 GPU。数据来自网页、公开资料和授权来源;团队还称用 OCR 处理数亿份 PDF,并通过筛选流程整理 STEM 文献。这条数据路径的重点不只是增加文本量,而是试图让科学资料进入后续训练所需的语料中。
更有辨识度的是 RL 阶段:Reflection称其持续四周,使用约10,500张 GB300,产生超过1亿条 rollout,并覆盖约100万个训练环境。代码、终端、科学、搜索和工具调用环境让模型能从任务结果和环境反馈中学习,而不只依赖静态文本。公司描述的系统会异步生成轨迹并更新模型,同时标记每条轨迹生成时所用的模型版本,以处理数据产生与策略更新之间的延迟。团队称系统能稳定使用超过一天前生成的交互数据,但这一点目前仍是公司披露,缺少公开独立复核。
榜单分数和效率说法各有边界
把公告中的成绩当作一张证据卡,能看出 Reflection 想证明什么:SWE-bench Verified 为80.9,Terminal Bench 2.1 为80.1,DeepSWE v1.1 为44.4。这些都是公司自报分数,技术报告和完整测试设置当时尚未公开,因此它们可以说明团队的目标和初步结果,却不能直接替代统一 harness 下的独立复测。尤其是编程智能体的成绩会受到推理设置、工具链和测试流程影响,单一分数不足以决定实际工程表现。
效率主张也要按口径理解。Reflection称,在部分推理基准上,Beam达到与 GLM 5.2 可比的成绩时,推理计算量少3至4倍;这个数字按生成 token 数估算前向计算,排除了提示词预填充、上下文相关注意力开销和服务端成本。它支持的是一种特定算法下的计算量比较,不等于实际延迟、硬件账单或服务价格下降同样幅度。外部观察者对 Beam 的位置也并不一致,有人看好它的 token 效率,也有人认为它仍落后于更新的领先模型。
对技术团队,先把它当作待验选项
Beam最值得技术负责人拆解的部分,可能不是501B这个总参数数字,而是它把大量环境、rollout 和异步 RL 训练放进同一套工程流程。对正在建设代码或工具型智能体的团队,这提供了一个具体问题:当任务反馈可程序化、环境能规模化运行时,训练吞吐和数据时效能否比单纯扩大预训练更直接地改善任务表现?Reflection的披露让这个问题有了可讨论的实例,但尚不足以证明这套做法的投入产出。
实际评估应等权重和许可证文本发布后再开始,并把模型放进团队自己的代码库、工具链和延迟约束中测试。记录的不应只有基准分数,还应包括达到目标表现所需的生成长度、重试次数、硬件资源和上下文配置。若只需要美国训练来源、且计划自行审查或部署,Beam可能值得纳入候选;若决策依据是“领先模型”或“三至四倍更便宜”,现有证据还不够。开放权重承诺、独立可复现成绩和真实部署成本,是三个不同的验收条件。