给 AI 几行客户资料,让它判断新客户会不会违约,这类表格模型已经不稀奇。问题是,它们往往只盯着一个指定答案。LimiX-2 想再往前一步:学习整张表里各字段如何相互关联,从而让同一个模型处理预测、补全缺失值,甚至发现变量间可能存在的因果结构。
它的关键训练方式是“上下文条件掩码建模”:故意遮住不同单元格,让模型结合当前表格里可见的少量样本,把内容猜回来。换句话说,它不只练习“根据客户资料预测违约”,也练习从收入、地区等字段反推其他未知信息。作者称,LimiX-2 仅用合成数据预训练,无需针对具体任务更新参数;在 TabArena、TALENT 和 BCCO 三组基准中超过现有表格基础模型及按数据集训练的模型,并以四分之一的参数量超过 TabFM。更值得关注的是,这套机制把表格模型从单项预测器推向通用关系建模;不过上述效果与因果结构恢复能力目前均来自论文作者的实验。