Learning to solve hard problems in RL for LLMs by never giving up
11 hours ago
- 马太效应描述了强化学习如何根据初始能力按比例提升任务性能,从而偏向容易的问题而非困难的问题。
- 原因是信号效率:由于罕见的错误完成,大量计算被浪费在容易的问题上,而不仅仅是困难问题采样不足。
- “永不放弃”(NGU)通过使用较小的k值处理容易的问题,并对困难问题重新采样直至解决,从而重新分配计算资源。
- NGU在数学和代码基准测试上优于标准GRPO,尤其是在最难的子集上,且不损害容易问题的性能。
- NGU对可塑性问题具有鲁棒性;模型能从早期的糟糕样本中恢复过来。
- 局限性包括潜在的策略偏差过时问题,以及在主要困难问题分布上效果有所降低。