Why Large Language Models Fail at Tabular Prediction
6 hours ago
- LLM在许多任务上表现出色,但在表格数据预测上表现不佳,这推动了表格基础模型的发展。
- 测试了LLM失败的五个假设:噪声处理、CSV格式、分词、每查询测试点数和维度。
- 对照实验否定了前四个假设,但维度是决定性的。
- 与保持平稳或提升的传统模型不同,LLM的准确率随着维度增加而下降。
- 在二维空间中,LLM的行为类似于基于局部距离的方法(一致性高达91.6%),但在更高维度下,没有传统模型能重现其预测。
- LLM的能力随着维度增加而消失,这种消失方式无法被噪声污染的模型模仿,这解释了它在表格数据上相对于传统基准的失败。