Hasty Briefsbeta

双语

METR introduces Expenditure Horizon metric

8 hours ago
  • 提出“支出视界”作为衡量AI优化能力的一个指标,定义为人类比AI更具成本效益的预算阈值。
  • 使用NanoGPT加速运行数据说明方法:人工努力成本约为每提升1%花费2500美元,而模型代理运行显示前沿模型的支出视界在0到3300美元之间。
  • 该方法通过提供连续分数并纳入劳动力和计算成本,弥补了二元基准的局限性。
  • 发现代理优化曲线通常呈L形,与人类相比代理呈现递减回报,且该方法最适用于劳动回报平滑的问题。
  • 讨论局限性:仅衡量自主优化能力,依赖均匀回报,并可能受训练数据污染或先前代理工作影响。