近日,稳准智能联合清华大学计算机系教授崔鹏发布新一代数据大模型LimiX-2,模型参数规模提升至400M。在TabArena、BCCO、TALENT三个国际主流结构化数据Benchmark(参照标准)中,LimiX-2总体Elo分数分别达到1935、1432和1506,均位于榜单前列,超过Google、SAP、Amazon等的同类模型。
Elo是衡量模型综合能力的排名指标。TabArena、BCCO、TALENT是国际主流结构化数据模型评测基准,覆盖多类任务,用于评估模型在不同数据集上的泛化能力和预测性能,已成为当前结构化数据基础模型竞争的重要评价依据。
据介绍,LimiX此次模型能力升级主要沿着三条技术路线推进:一是上下文机制网络CMNs(Contextual Mechanism Networks),作为预测依赖关系的系统,将建模重点从预先指定的目标变量,转向变量之间的相互关联;二是在预训练阶段升级自动化合成数据的生成引擎;三是进一步将模型参数规模扩大至400M。
LimiX团队提出上下文机制网络(CMNs),开拓出从“目标预测”走向“结构发现”的结构化数据建模新范式,是将上下文数据的全变量联合依赖作为建模对象,不仅关注变量取什么值,更着眼于发现变量如何相互关联、共同构成怎样的内在结构。这一转变重新确立了模型的学习目标。LimiX通过上下文条件掩码建模(CCMM),在不同观测模式下组织跨变量监督,将变量关系推断确立为明确的预训练目标。
LimiX 采用单元格级(Cell-Level)建模,以变量在各样本中的观测为基本表示单元,保留列身份、具体取值和缺失状态,支持跨变量、跨样本的信息交互。从数据表示、训练目标到网络计算,整体设计围绕联合依赖建模展开。
在训练数据方面,LimiX-2升级了大规模自动化合成数据的生成引擎。结构化数据大量存在于企业内部系统,很难像互联网文本一样被大规模公开获取,因此TabPFN、Mitra等表格基础模型也普遍使用合成数据进行预训练。LimiX-2 可以自动生成线性、非线性、多变量交互、周期变化和噪声扰动等不同分布的数据,让模型在进入真实企业之前,就接触更多的数据结构和变量关系。
截至2026年世界人工智能大会时,上一代LimiX已完成800余个跨行业、跨场景的公开数据集验证,并实现60余个真实场景落地。稳准智能首席科学家崔鹏表示:“LimiX-2 的发布和此次在Benchmark取得的成绩,是团队在结构化数据大模型方向持续探索的重要阶段性成果。我们仍将长期坚持这一技术路线,并不断提升模型对数据规律和变量因果关系的理解能力。未来将继续推动模型在因果智能方向上的发展,助力人工智能更快速地从预测走向决策。”