18 hours ago
- 智能被定义为样本效率——即流畅运行所需的数据量。
- 近期人工智能的进步源于数据和计算规模的扩展,而非样本效率的提升。
- 强化学习通过利用计算资源寻找优质数据,起到合成数据生成的作用。
- AI模型需要大量特定领域的专家数据才能具备胜任能力。
- 人类专家为每项技能生成定制化数据,每个领域涉及数百名专家。
- 开源模型仅落后前沿模型约4个月,表明数据是关键驱动力。
- 前沿AI模型在数十万亿到数百万亿个token上进行训练,是人类一生接触信息量的数百万倍。
- 人类的样本效率远高于AI——例如,青少年约20小时学会驾驶,而自动驾驶模型需要数量级更多的数据。
- 常见的反对观点(如进化、多模态数据、缩放定律)无法弥合样本效率差距。
- 对于自动化常见白领工作而言,样本效率可能并非关键,因为训练成本可分摊到数十亿次使用中。
- 长期计划是通过自动化AI研究本身来解决样本效率问题,但当前AI能否实现这一目标仍不清楚。