Fixing GRPO's credit assignment problem without evaluating every step
5 hours ago
- GRPO 为所有策略令牌分配统一的轨迹级优势,未能区分关键决策与次要决策。
- ProVer 使用智能体判断器对比成功与失败的轨迹,并识别可能负责的片段。
- ProVer 通过估计片段前后终端成功率差异的优势来验证所提出的片段。
- 对于所提出片段内的令牌,将正优势估计纳入 GRPO 优势中。
- 在 ALFWorld、WebShop 和 SearchQA 上,ProVer 相较于 GRPO 在 Qwen3.5-2B 和 Qwen3.5-4B 上分别实现了 9.91% 和 7.12% 的相对提升。
- 即使在缺乏前沿规模的判断器模型的情况下,信息化的片段选择也能以适度的额外生成开销改进策略训练。