First experimental evidence of recursive self-improvement (RSI)
17 hours ago
- AIDE²系统首次实验证明递归自改进(RSI)。
- AIDE²具有两个自回归循环:内循环优化代码,外循环优化框架。
- 外循环发现了七项超越基线的改进,包括新的搜索策略和内存系统。
- 发现的代理能够泛化到未见过的基准测试,性能优于手工调优的代理。
- 涌现现象:外循环通过提示和基于规则的检查降低了奖励黑客率。
- AIDE²处于RSI阶梯的第一级;自改进效率超过了手动研发。
- 自动研究比经典超参数调优收敛更快,成本效率更高,泛化能力更强。
- 讨论为何RL对LLM突然有效:更好的基础模型和找到正确的流程。
- 作者对RL的看法发生转变:从悲观到乐观,归因于RLHF和O1推理。
- 解释:RLHF需要RL的原因在于自回归采样是不可微的。