Dream-RSI: Recursive Self-Improvement through Evolving Worlds
3 hours ago
- 递归式自我改进对自主AI代理至关重要,但受到有效探索策略的瓶颈制约。
- 当前系统面临固定策略难以适应以及大规模元搜索空间上昂贵的在线策略优化问题。
- Dream-RSI引入了一个轻量级编排层,使探索变得显式且可编程,无需修改底层编码代理。
- 它利用从历史发现树构建的重放模拟器,为完善探索策略提供即时、低成本的离线反馈。
- 改进后的策略重新部署到线上以推动进一步发现,形成自我改进循环,持续扩展模拟器池。
- Dream-RSI在算法工程、数学优化和GPU内核工程方面实现了具有竞争力或更优的发现质量,同时降低了发现成本。