Hasty Briefsbeta

双语

AutoResearchExam: Measuring agents' ability to improve and generalize

21 days ago
  • AutoResearchExam是一个包含29个开放式机器学习研究任务的基准测试,用于衡量代理在24小时内提高私有测试分数的速度。
  • 该评估将可见进展(验证分数)与泛化能力(隐藏测试AUARC)分开,以检测过拟合。
  • 代理优化验证分数并接收反馈,但从未看到隐藏测试分数,以AUARC作为主要指标。
  • 分析显示模型在24小时内持续改进,存在不同的泛化差距和超参数调整策略。
  • 提交数量本身与更高分数无关;研究步骤的质量更为重要。
  • 从先前轨迹提供研究提示可提升较短运行中的性能,特别是对于Claude Opus 5。
  • Terminus 2框架提供了跨模型的一致评估,与原生框架相比保持了排名。