Hasty Briefsbeta

双语

ARC-AGI Leaderboard

4 hours ago
  • ARC-AGI-3 衡量AI代理在新型交互环境中即时适应的能力,这是从早期被动流体智力测试演变而来的。
  • 排行榜散点图展示了每项任务的成本与性能之间的关系,强调效率作为智力的关键衡量标准。
  • 图中绘制了三类数据:推理系统趋势线(显示推理时间的影响)、基础大语言模型(单次推理)以及Kaggle系统(严格成本限制下的竞赛级提交)。
  • 仅显示运行成本低于10,000美元的系统;不完整的测试输出被视为错误,预览结果非官方。