Hasty Briefsbeta

双语

The next big breakthrough will be AIs learning on the job

17 hours ago
  • 实验室认为,通过在多样化强化学习环境中对数百万可验证任务进行训练,AI将发展出通用问题解决能力,从而走向通用人工智能(AGI)。
  • 数据效率低下和缺乏持续学习的问题可以通过规模扩展来克服,类似于大语言模型的突破。
  • 如果上下文窗口变得任意大,上下文学习可能会取代权重更新。
  • 可磨性(在确定性模拟器中并行运行)与可验证性同等重要;计算机使用方面的缓慢进展凸显了这一点。
  • 在无法建立可验证模拟器的现实领域(如商业或政治),样本效率至关重要。
  • 强化学习与验证性奖励(RLVR)的泛化能力可能无法扩展到长期或现实任务;短视训练不能保证长期性能。
  • 持续学习需要更新权重而不仅仅是积累上下文;当前的在线学习样本效率低下。
  • 在线策略自蒸馏(OPSD)允许在没有可验证奖励的情况下将会话学习蒸馏到权重中。
  • “梦境”(利用自建模拟器进行测试时训练)可以提供大量模拟样本用于学习。
  • 到2027年,RLVR将创建出有能力的智能体,然后通过持续学习从现实部署中学习,从而在所有任务上取得改进。