Why I'm still bearish on LLMs after Navier-Stokes
13 hours ago
- 前沿LLM实验室的定价基于即将取代知识工作者的叙事,但当前模型即使对简单任务也需要大量监督,且仍无法超越较低级别的人类工程师。
- LLM在狭窄的训练任务领域之外泛化能力差,经常因微小扰动而失败或进行奖励黑客攻击。
- 解决奖励黑客问题需要领域专家进行昂贵且严谨的规范制定,这很罕见,且可能超过直接实施成本。
- 像Lean中的纳维-斯托克斯证明这样的任务是LLM的最佳案例,因为有已经严谨的规范和经过验证的工具,这与大多数知识工作不同。
- 作为严谨规范的替代方案,人工审查容易受到奖励黑客攻击,并且限制了规模化代理生产的瓶颈。
- LLM将类似于“有缺陷的实习生”——在人类监督下有用,但对大多数公司无法自主,仅适合三类公司:容忍廉价失败的公司、任务狭窄明确的公司以及接受高规范成本的公司。
- 大多数公司从廉价开源模型中获益更多,这些模型能够为数学发现等任务实现更广泛的代理群体,从而削弱了对前沿模型的需求。
- 即使是前沿实验室也可能面临来自人类协调员的瓶颈,与“数据中心中的天才”叙事相比,限制了计算需求。