Why Large Language Models Fail at Tabular Prediction
arXiv 论文 2608.02412v1 研究前沿 LLM 在表格预测任务上的失败原因。在单次生成、无工具、无微调的纯推理设置下,系统评估五个假设:噪声/非线性数据、CSV 格式、数值分词、每查询测试点数、输入维度。受控实验否定了前四个,维度是决定性因素:在 31 个基准数据集上,LLM 是九种方法中唯一随维度增加准确率下降的,经典基线保持平稳或提升。
发展脉络
- 首次出现Why Large Language Models Fail at Tabular PredictionarXiv cs.LG
- 当前判断表格数据是行业中最常见的机器学习工作负载,LLM 在此类任务上的失败限制了其作为通用预测工具的适用性。这推动了表格基础模型领域的发展,但该研究表明通用 LLM 的局限,可能促使行业更关注专门针对表格数据的模型或混合方法。Agent Pulse · 分析
这篇 arXiv 论文(2608.02412v1)探讨了为什么大型语言模型在表格数据预测任务上表现不佳。作者在纯推理设置下(单次生成、无工具、无 agentic 脚手架、无微调)研究前沿 LLM,系统评估五个假设:处理噪声或非线性可分数据的能力、CSV 格式掩盖列结构、数值分词、每查询分类的测试点数量、输入维度。受控实验否定了前四个假设,而维度是决定性因素:在 31 个基准数据集上,LLM 是九种方法中唯一随维度增加准确率下降的,经典基线保持平稳或提升。行为分析表明,LLM 在低维数据上表现良好,但在高维数据上性能下降,可能因为注意力机制难以处理高维特征。
该研究通过受控实验排除了噪声、CSV 格式、分词和批量大小等因素,指出维度是 LLM 表格预测失败的关键。这暗示 LLM 的注意力机制在高维特征空间中可能无法有效捕捉特征交互,导致性能下降。未来可验证的信号包括:针对高维表格数据设计维度缩减或特征选择方法,或改进模型架构以处理高维输入。
表格数据是行业中最常见的机器学习工作负载,LLM 在此类任务上的失败限制了其作为通用预测工具的适用性。这推动了表格基础模型领域的发展,但该研究表明通用 LLM 的局限,可能促使行业更关注专门针对表格数据的模型或混合方法。
对于依赖表格数据预测的企业(如金融、医疗、零售),该研究提示通用 LLM 可能不适合高维表格预测,应评估专门模型或经典方法。这影响技术选型和投资决策,可能推动表格基础模型商业化。
未来研究可能探索维度缩减技术、特征选择或新的架构设计来提升 LLM 在高维表格数据上的表现。也可能出现结合经典机器学习与 LLM 的混合方法。可验证的信号包括:新论文提出针对高维表格的 LLM 改进,或基准测试中 LLM 在高维数据上的性能提升。