Reflection AI推出专为编码和智能体任务设计的开源权重模型Beam。该模型拥有5010亿参数,采用混合专家(MoE)架构,每次推理仅激活230亿参数,旨在降低响应成本。公司计划于本月下旬以Apache 2.0许可证发布其权重,允许开发者下载并在本地硬件运行。

性能与能效表现

在基准测试中,Beam并未在原始得分上领跑开源领域。在针对命令行工作的Terminal Bench v2.1测试中,Beam得分为80.1,低于GLM 5.2(81.0)、Kimi K3(88.3)及DeepSeek V4.1 Flash(90.6)。在DeepSWE v1.1测试中,Beam得分为44.4,虽略高于GLM 5.2的44.0,但较DeepSeek V4.1 Flash仍有显著差距。

Beam的核心优势在于能效。Reflection表示,Beam在高级推理基准测试中的表现与GLM 5.2相当,但推理算力消耗仅为后者的三分之一至四分之一。需注意,该算力数据基于“活跃参数两倍乘以平均生成令牌数”的公式估算,未包含提示词处理、注意力机制开销及服务端负载等成本,仅供参考。实际推理成本取决于用户的提示词复杂度及硬件配置。

训练过程与涌现能力

Beam经历了为期四周的强化学习训练。在此期间,Reflection调用了近100万个训练环境,使用约13亿个沙箱进行评分,并动用约10,500块NVIDIA GB300 GPU生成了超过1亿次尝试。公司指出,训练结束时模型得分仍在持续攀升,表明训练尚未完全达到平稳阶段。

训练过程中,Beam展现出超出预设任务范畴的能力。即便在未包含浏览任务的训练阶段,其浏览能力得分依然上升;获得网络访问权限后,模型能主动搜索查询其他大语言模型,并调用OCR服务读取文档。这种对智能体极具价值的行为,是在赋予网络权限前被观察到的。

安全评估与发布计划

目前,Beam仍处于最终的红队测试和评估阶段。Reflection从相同初始检查点训练了一个独立的安全与对齐模型,并通过蒸馏技术将其与主模型结合。公司计划在发布权重的同时,公开安全技术报告并开源内部构建的安全测试工具。现阶段,Beam仅向特定用户群体提供有限名额的早期访问资格。