AutoResearchExam: Measuring agents' ability to improve and generalize
21 days ago
- AutoResearchExam是一个包含29个开放式机器学习研究任务的基准测试,用于衡量代理在24小时内提高私有测试分数的速度。
- 该评估将可见进展(验证分数)与泛化能力(隐藏测试AUARC)分开,以检测过拟合。
- 代理优化验证分数并接收反馈,但从未看到隐藏测试分数,以AUARC作为主要指标。
- 分析显示模型在24小时内持续改进,存在不同的泛化差距和超参数调整策略。
- 提交数量本身与更高分数无关;研究步骤的质量更为重要。
- 从先前轨迹提供研究提示可提升较短运行中的性能,特别是对于Claude Opus 5。
- Terminus 2框架提供了跨模型的一致评估,与原生框架相比保持了排名。