- 作者对LLM代码助手表达了怀疑,并非因为知识产权、生态或质量问题,而是基于科学证据质疑它们能否提高编码速度或质量。
- 一个关键问题是LLM代码助手的高错误率,类似于'实习生'产出错误代码,所提出的解决方案是进行彻底的代码审查。
- 实证研究表明有效的代码审查存在限制:不应超过1小时或每小时400行代码(LOC),以保持效率。
- 将这些审查限制应用于LLM生成的代码,意味着开发者每天最多只能审查几千行代码,这构成了生产力上限。
- 有证据表明,人类审查者在审查LLM生成的代码时效率较低——发现的缺陷更少且过于自信——相较于审查人类编写的代码。
- 支持者常推崇LLM助手编写复杂代码(如Bash脚本),而这恰恰是最难审查的类型,加剧了审查问题。
- 为回应质疑,作者呼吁开展实证研究,探讨人类审查者检测LLM生成代码缺陷的能力,以及审查此类代码与人工代码的差异。
- 作者对支持者忽视这些问题、依赖轶事证据而非科学数据来探讨代码审查实践感到沮丧。