6 hours ago
- 模型在发现自身代码中的错误方面表现更差;每个模型在另一个模型编写的代码中发现更多的错误。
- 模型产生的错误类型与它们最常引入的错误类型相同,而这些错误在审查过程中也同样被忽略。
- Claude模型采用广度优先的方法(范围广泛),而GPT模型采用深度优先的方法(深入调查)。
- GPT经常在推理轨迹中识别出错误,但由于冲突的指令和训练后对齐,未能将其报告出来。
- Opus生成大量评论,包括误报,因为它以类似人类的关注点(意图和潜在问题)进行审查。
- Greptile构建了“模型反转”功能:检测编码代理的作者,并将审查路由到不同的模型以捕获更多错误。
- 对齐(遵循指令)与有用性(报告所有错误)之间的紧张关系被凸显出来,尤其是在GPT中。