Hasty Briefsbeta

双语

Atrocious AI-Written Tests

a day ago
  • 作者因为测试数量庞大而停止审阅,但在一次注释变更导致测试失败后,不得不进行调查。
  • 那个失败的测试正在用正则表达式扫描源文件中关键词'wall-clock',显示出脆弱且无意义的断言行为。
  • 许多测试没有运行任何生产代码,例如检查状态数组不包含'failed'或'cancelled',却没有测试任何实际逻辑。
  • 一些测试是生产代码的镜像而非测试,因此它们只验证重复逻辑本身的一致性。
  • 断言静态配置值的测试价值很低:它们只在配置变化时失败,并不能防止真正的回归。
  • 测试精确的提示标题是误导性的,因为提示对模型输出的影响是非确定性的;评估是更好的机制。
  • AI代理倾向于在代码变更时添加低价值测试,即使这些测试不能提供有意义的保障。
  • 在总共6,429个测试中,有404个是低价值的;它们并没有显著减慢测试套件的速度,但导致了令人困惑的失败,并侵蚀了对测试套件的信任。