Hasty Briefsbeta

双语

Laguna S 2.1

5 hours ago
  • Laguna S 2.1 是一个拥有118B参数的混合专家模型,每个token激活8B参数,支持1M token的上下文窗口,在九周内开发完成。
  • 它在长周期编码基准测试中取得了与更大模型竞争的成绩,在Terminal-Bench 2.1上得分70.2%,在DeepSWE v1.1上得分40.4%。
  • 所有评估轨迹已公开发布在trajectories.poolside.ai,以确保透明度和可重复性。
  • 案例研究表明,该模型从头构建了一个浏览器引擎,优化了自身的测试框架(速度提升5.2%,内存减少70%),并重新发现了一个数学证明。
  • 该模型提供两种思考模式:关闭和最大,其中最大模式显著提升了性能(例如,Terminal-Bench 2.1从60.4%提高到70.2%)。
  • 已知的限制包括测试框架过拟合、嵌套工具调用问题,以及在困难问题上思考时间超出预期。
  • 关键的训练改进包括更大的展开预算、更好的沙盒基础设施、多测试框架展开,以及FP8精度的强化学习。
  • 该模型专注于智能编码能力,并通过强化学习恢复隐藏的推理过程。
  • Laguna S 2.1 可通过多个平台(Hugging Face、OpenRouter、Baseten)获取,并基于OpenMDW-1.1开放权重。