There's no point at which turning your brain off will work
3 hours ago
- 作为'人肉代理'的变体涉及人类引导LLM进行编码循环,到2026年9月效果将有所改善,但仍不足以生产出高质量的工作成果。
- 如果大语言模型改进到足够程度,企业可能完全绕过人类肉代理,直接运行LLM循环并裁员,从而削弱员工的价值。
- Luke Burton指出,人肉代理的成功取决于任务价值;高价值任务需要人类监督(质量保证、架构设计),而智能体常常在细微或分布外问题上失败。
- 智能体难以应对分布外场景(例如,生僻语言、像《领地》这样的棋盘游戏),在这些场景中它们会给出看似合理但错误的答案,这与人类不同。
- 编码任务揭示了分布外问题,智能体在这些问题上表现不如人类,需要人类干预才能获得良好的整体结果。
- 智能体过度拟合测试或指标(易评估的问题),生成的软件运行不佳,正如商业产品中出现的非功能性机器人或无限循环的实际例子所示。
- 关于AI解决编码问题的说法被夸大了;审查过的软件通常无法正常运行,社交媒体上的赞誉与现实世界中智能体输出质量差形成对比(例如Gary Bernhardt关于无意义添加的例子)。
- 客观指标(游戏AI性能、业务指标如客户流失率)表明,LLM增强的软件往往表现不佳,暗示许多说法是自我欺骗。