Hasty Briefsbeta

双语

Learning to solve hard problems in RL for LLMs by never giving up

11 hours ago
  • 马太效应描述了强化学习如何根据初始能力按比例提升任务性能,从而偏向容易的问题而非困难的问题。
  • 原因是信号效率:由于罕见的错误完成,大量计算被浪费在容易的问题上,而不仅仅是困难问题采样不足。
  • “永不放弃”(NGU)通过使用较小的k值处理容易的问题,并对困难问题重新采样直至解决,从而重新分配计算资源。
  • NGU在数学和代码基准测试上优于标准GRPO,尤其是在最难的子集上,且不损害容易问题的性能。
  • NGU对可塑性问题具有鲁棒性;模型能从早期的糟糕样本中恢复过来。
  • 局限性包括潜在的策略偏差过时问题,以及在主要困难问题分布上效果有所降低。