Hasty Briefsbeta

双语

Beam: Reflection's 501B open-weight model

9 hours ago
  • Beam 是一个开放权重的稀疏混合专家模型,总参数达5010亿,激活参数230亿,针对编码、推理和智能体任务进行了优化。
  • 该模型在23.8万亿高质量token上进行了预训练,并使用10.5K块NVIDIA GB300 GPU进行了为期四周的大规模强化学习训练,生成了超过1亿次 rollout(采样轨迹)。
  • Beam 在编码和智能体基准测试上取得了与 GLM-5.2 等前沿开放模型相媲美的性能,并接近 Qwen 3.8-Max,同时在推理任务上减少了3–4倍的推理计算量。
  • 该模型具有可控的推理努力参数,允许用户根据任务需求在推理深度和token使用量之间进行权衡,以实现特定任务的效率。
  • 强化学习训练培养了可泛化的智能体能力,例如浏览和工具使用,即使没有在这些领域进行显式训练。
  • 先进的基础设施支持全异步执行、高弹性、高效的训练器打包和稳健的奖励完整性,使得大规模稳定训练成为可能。
  • 预训练强调精选数据质量,包括专有许可数据集,并实现了稳定的MoE优化,专家利用率接近完美。
  • 中期训练将上下文长度扩展到100万token,并通过让模型接触富含推理的长篇文档,为强化学习奠定了坚实基础。
  • 安全对齐采用了多教师蒸馏和审慎对齐技术,以强制执行规则、品质和主动交互风格。
  • 该模型将于本月晚些时候以Apache 2.0许可证发布,并提供完整的文档和生态系统集成。