RLVR might be disproportionately bad at science
17 hours ago
- 对于科学发现而言,RLVR(强化学习验证循环)是低效的,因为科学验证循环可能跨越数十年甚至数百年,而更优秀理论往往在初始预测表现更差。
- 哥白尼与托勒密、海王星与祝融星搜寻等历史案例表明,事前判断研究纲领的进步性或退步性几乎是不可能的。
- 科学突破需要特定偏好、长期投入以及多重并行研究议程,而强化学习循环难以轻易复现这些条件。
- 并行发现(如达尔文与华莱士)揭示,科学进步依赖累积性间接证据与辅助直觉,而不仅仅是可验证的预测。
- 强化学习之所以失败,是因为科学涉及对目标(奖励函数)本身的修正,而非仅在固定目标内优化——这违背了非循环性与认知主权等原则。