ARC-AGI Leaderboard5 hours agohttps://arcprize.org/leaderboardARC-AGI-3 衡量AI代理在新型交互环境中即时适应的能力,这是从早期被动流体智力测试演变而来的。排行榜散点图展示了每项任务的成本与性能之间的关系,强调效率作为智力的关键衡量标准。图中绘制了三类数据:推理系统趋势线(显示推理时间的影响)、基础大语言模型(单次推理)以及Kaggle系统(严格成本限制下的竞赛级提交)。仅显示运行成本低于10,000美元的系统;不完整的测试输出被视为错误,预览结果非官方。