Hasty Briefsbeta

双语

Is AI Progress Real? Four Independent Metrics Show It

a day ago
  • AI基准测试的进步常常面临诸如数据污染、饱和度和奖励黑客等挑战,使得难以区分真实进展与针对特定测试的优化。
  • 四项独立指标显示,自2025年底开始AI能力出现急剧加速,与Grok 4.1、Gemini 3、Claude Opus 4.5和GPT-5.2等模型的发布时间吻合。
  • METR的时间范围指标在不到两年内从4分钟增长到12小时,表明前沿模型在任务执行方面取得快速进展。
  • TrackingAI的线下认知测试显示,AI系统在大约两年内从表现优于不到10%的人类,发展到超越44人中除1人外的所有参与者。
  • Humanity's Last Exam的分数在一年内从2.7%跃升至53%,这反映了达到博士水平知识所需计算能力的指数级增长。
  • 抽象推理测试ARC-AGI-2的分数在停滞15个月后于2025年底激增,像GPT-5.2这样的模型在几周内就达到了53%的得分。
  • 四种复合机制驱动了这种进步:预训练效率提升、可验证奖励的强化学习、系统优化工程以及AI自我改进带来的飞轮效应。
  • 数据枯竭、性能可靠性差距以及像ARC-AGI-3(包含交互推理)这样的新基准测试等挑战可能会减缓未来的进展速度。
  • 这种类似于气候科学'曲棍球杆曲线'的多指标测试方法,通过多样化的独立指标印证了AI加速发展,表明存在真实且不断加速的进步趋势。