Is AI Reasoning Right for the Wrong Reasons?
2 hours ago
- 大型推理模型(LRM)可以解决数学证明等复杂问题,但它们生成的“思维链”可能并不反映实际的推理过程。
- 研究表明,许多推理标记是非因果或毫无意义的,模型即使使用错误或不相关的思维链也能得出正确答案。
- 争论的焦点在于LRM是真的推理还是依赖模式匹配和近似检索,一些专家认为将中间标记拟人化是不科学的。
- “一厢情愿的记忆术”概念解释了研究人员如何用类人术语标记人工智能过程,这可能会误导对模型工作方式的理解。
- 尽管存在未知,LRM在编码和数学等可验证领域中很有用,但在这些领域之外,其可靠性仍然存疑。