Perfectly Hitting the Wrong Target: The Story of an AI Code Review Benchmark21 days agohttps://shrsv.hexmos.com/post/perfectly-hitting-the-wrong-target人们常将基准测试视为权威且客观的,但若不加以审视,可能缺乏深度。作者批评了AI代码审查基准测试的方法论,认为其缺乏明确的问题定义,并将AI代码审查分割为两个问题:人类辅助与机器验证。以人为中心的代码审查优先考虑建议,以优化有限的注意力;而以机器为中心的代码审查则强调为修复代理进行详尽分析。论文承认了诸如审查者不完善和古德哈特定律等挑战,但可能过度强调与人类审查者的一致性等代理指标,而非减少生产故障等实际结果。更多...