Why Large Language Models Fail at Tabular Prediction

2026年08月03日
  • 简介
    大语言模型(LLMs)已成为众多任务的默认工具,但在机器学习中最常见的一类工作负载——面向表格数据的预测分析上,却始终收效甚微。这一显著落差,构成了当前快速兴起的“表格基础模型”(tabular foundation models)领域的立论根基;然而,通用大语言模型为何在此类任务上表现不佳,其根本原因迄今仍未厘清。本研究在最纯粹的推理模式下考察了一个前沿大语言模型:即仅执行单次生成过程,输入提示(prompt)中完整包含全部训练数据与测试数据,且不借助任何外部工具、不采用智能体式(agentic)架构设计、也不进行任何微调。在此设定下,我们系统性地检验了五种可能的失败原因假说:(a)无法处理含噪声或非线性不可分的数据;(b)以线性化CSV格式表示数据,掩盖了列之间的结构关系;(c)数值型字段在分词(tokenisation)过程中被离散化处理;(d)单次查询中需分类的测试样本数量过多;(e)输入数据的维度(dimensionality)过高。通过受控实验,我们逐一证伪了假说(a)至(d)。相比之下,维度因素则起着决定性作用:我们在31个基准数据集上开展大规模随机线性投影实验,结果表明,在所比较的九种方法中,大语言模型是唯一一种随输入维度升高而准确率持续下降的方法;而所有经典基线模型的性能则保持稳定,甚至有所提升。进一步将大语言模型的行为表现与252种经配置的经典模型进行对比发现:当输入为二维时,该大语言模型的预测行为类似于一种基于局部邻域与距离的算法(在网格预测一致性指标上高达91.6%);但当维度升高后,没有任何一种经典模型——即便额外引入经过精细调优、且与维度相适应的噪声机制——能够复现其预测结果。我们并不声称已揭示其内部运作机制;我们的研究结果更为审慎地表明:大语言模型在表格预测任务上的能力会随维度升高而系统性衰减,而这种衰减模式无法被任何受噪声干扰的经典学习器所模拟。这便解释了为何大语言模型在其他领域表现卓越,却始终在表格数据任务上输给已有五十年历史的经典基线方法;至于其预测行为背后的具体机制,则仍是一个有待探索的开放问题。
  • 作者讲解
  • 图表
  • 解决问题
    为什么大型语言模型(LLMs)在标准、未经微调、无工具、单次推理的纯提示设置下,对结构化表格数据的预测分析任务(如分类/回归)表现远逊于传统机器学习方法(如随机森林、梯度提升树),尽管其在其他模态上极为成功?该问题聚焦于基础能力瓶颈,而非工程适配不足,是表征学习与大模型泛化机制交叉领域的新颖根本性问题。
  • 关键思路
    提出并验证‘维度灾难’(dimensionality collapse)是LLM处理表格数据失败的核心原因:LLM的预测能力随输入特征维度增加而系统性、独特性衰减,且该衰减无法被噪声、非线性、格式或tokenization等常见假设解释;其二维行为类似k-NN,但高维行为无法被任何经典模型(含噪声增强版)复现,表明其内部表征存在本质维度敏感性。
  • 其它亮点
    • 严格控制实验:使用前沿LLM(未微调、无工具、单次生成、全数据入prompt);• 系统证伪5个主流假设(噪声/非线性/CSV格式/数值tokenization/测试点数量),仅维度被证实为决定性因素;• 覆盖31个标准表格基准(如UCI、OpenML)与252种配置的经典模型(含带维度自适应噪声的变体);• 行为级对齐分析:2D时与k-NN网格预测高达91.6%一致,高维则完全无对应模型;• 代码未在摘要中提及开源,但实验设计高度可复现;后续关键方向:解码LLM表格表征的隐式维度压缩机制、构建维度鲁棒的表格式基础模型。
  • 相关研究
    Tabular Transformers (2021); SAINT: Improved Neural Networks for Tabular Data (2021); TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second (2022); Tree-LLM: Integrating Decision Trees with LLMs for Interpretable Tabular Learning (2023); TabLLM: Towards Foundation Models for Tabular Data (2023)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问