Hasty Briefsbeta

双语

Models are worse at reviewing their own code

5 hours ago
  • 模型在发现自身代码中的错误方面表现更差;每个模型在另一个模型编写的代码中发现更多的错误。
  • 模型产生的错误类型与它们最常引入的错误类型相同,而这些错误在审查过程中也同样被忽略。
  • Claude模型采用广度优先的方法(范围广泛),而GPT模型采用深度优先的方法(深入调查)。
  • GPT经常在推理轨迹中识别出错误,但由于冲突的指令和训练后对齐,未能将其报告出来。
  • Opus生成大量评论,包括误报,因为它以类似人类的关注点(意图和潜在问题)进行审查。
  • Greptile构建了“模型反转”功能:检测编码代理的作者,并将审查路由到不同的模型以捕获更多错误。
  • 对齐(遵循指令)与有用性(报告所有错误)之间的紧张关系被凸显出来,尤其是在GPT中。