TabPFN and TabICL vs. tuned XGBoost: the model that doesn't train won 14/14
4 hours ago
- TabPFN和TabICL,这些不在新数据上训练的表格基础模型,在Grinsztajn基准测试的14个数据集中大多数上优于调优后的XGBoost,优势可持续到32,000行。
- TabICL在准确率上赢得了14个数据集中的12个,在AUC上赢得了全部14个;而TabPFN(v2.2.1)在准确率上赢得11个,在AUC上赢得13个,对比对象是调优后的XGBoost。
- 关键优势不在于大幅提升准确率(平均约0.01),而在于消除了超参数调优,将大多数数据集的计算时间从几分钟缩短到不到一秒。
- 这些模型在处理宽表(例如包含419列的Bioresponse)时表现不佳,其中TabPFN性能显著下降,而TabICL虽然较慢但仍然最佳。
- 一个重大发现:被引用最多的模型TabPFN(v8.3.0)现在需要注册账户并接受许可协议才能下载,而TabICL仍在BSD许可下开放获取。
- 技术问题包括PyTorch由于版本不匹配而静默使用CPU而非GPU,以及OpenML API中断,这凸显了可复现性挑战。
- 局限性:仅测试了二分类,主表最多3,000行,超参数搜索限制为25种组合,且类别特征统一采用整数编码。