稳准智能发布400M参数结构化数据大模型LimiX-2,登顶三大国际Benchmark
LimiX-2 登顶三大结构化数据Benchmark
9月16日,稳准智能与清华大学计算机系崔鹏教授团队联合发布新一代结构化数据大模型 LimiX-2。该模型参数规模提升至400M,在 TabArena、BCCO 和 TALENT 三个国际主流结构化数据评测基准中,总体 Elo 分数分别达到1935、1432和1506,均位列榜首,超过 Google、SAP、Amazon 等国际科技公司的同类模型。

Elo 分数是衡量模型综合能力的排名指标,广泛用于机器学习模型的横向对比。TabArena、BCCO 和 TALENT 覆盖回归、二分类、多分类等多种任务类型,评估模型在不同数据集上的泛化能力和预测性能,已成为当前结构化数据基础模型竞争的核心评价标准。值得注意的是,LimiX-2 在 TabArena 上的回归、二分类和多分类三项子任务中,Elo 分数均为最优。

从“预测目标”到“发现结构”:CMNs 新范式

LimiX-2 的核心突破在于提出了一种名为上下文机制网络(Contextual Mechanism Networks, CMNs)的新建模范式。传统结构化数据模型(如 PFNs)通常以“给定输入,预测指定目标变量”为核心任务,而 CMNs 将建模对象从单一目标扩展为所有变量之间的联合依赖关系。

这意味着模型不再只关心“Y 是多少”,而是试图理解“X₁、X₂、…、Xₙ 之间如何相互关联,共同构成怎样的内在结构”。这种转变重新定义了学习目标:LimiX-2 通过上下文条件掩码建模(Contextual Conditional Masked Modeling, CCMM),在预训练阶段显式地将“推断变量间关系”作为优化目标。
具体来说,模型会在不同观测模式下(例如某些变量缺失、某些被遮蔽),组织跨变量的监督信号。通过多种条件预测任务的联合约束,模型逐步构建出对全变量依赖结构的稳定表达。这使得它不仅能完成传统预测任务,还能为更高阶的数据理解(如因果推断)提供基础。
Cell-Level 建模:保留数据原始信息
为了支撑 CMNs 的设计理念,LimiX-2 采用了单元格级(Cell-Level)的数据表示方式。传统表格模型常将整列或整行作为处理单元,容易丢失细粒度信息。而 LimiX-2 以“每个变量在每个样本中的观测值”为基本单元,同时保留三重信息:
- 列身份(即变量名或语义角色)
- 具体取值(数值、类别等)
- 缺失状态(是否观测到)
这种表示允许模型在计算过程中进行跨变量、跨样本的信息交互。例如,一个样本中缺失的温度值,可能通过其他样本中温度与湿度、气压的关联模式被合理推断。从数据表示、训练目标到网络架构,整个系统都围绕“联合依赖建模”这一核心展开。
在此框架下,分类、回归、缺失值填补等任务被统一视为对同一底层数据模型的“不同查询方式”。更重要的是,这种对变量联合分布的建模,为结合因果假设开展因果骨架发现(causal skeleton discovery)提供了统计基础——这正是传统黑箱预测模型难以做到的。
合成数据引擎升级:模拟真实企业数据复杂性
结构化数据大多存在于企业内部系统(如ERP、MES、SCADA),不像互联网文本那样可公开获取。因此,包括 TabPFN、Mitra 在内的主流表格基础模型普遍依赖合成数据进行预训练。
LimiX-2 升级了其自动化合成数据生成引擎,能够模拟更丰富的数据生成机制,包括:
- 线性与非线性关系
- 多变量高阶交互
- 周期性变化(如季节性、昼夜节律)
- 各类噪声扰动(测量误差、随机缺失等)
这些合成数据虽非真实业务数据,但覆盖了真实世界中常见的变量关系模式。这让模型在接触真实企业数据前,就已具备对复杂结构的先验理解,从而在少量微调甚至零样本情况下快速适应新场景。
Scaling Law 再验证:参数增至400M
继2023年11月稳准智能首次提出“结构化数据基础模型遵循 Scaling Law”后,LimiX-2 再次沿着这一技术路线推进,将参数规模扩大至400M。这一扩增并非简单堆砌参数,而是为了在更大尺度上验证 CMNs 范式的有效性。
更大的模型容量有助于更精细地刻画高维变量间的复杂依赖,尤其在因果关系的稳定表达上更具优势。实验表明,随着模型规模增长,LimiX 系列在泛化能力、鲁棒性和结构发现准确性上均呈现持续提升趋势。
因果发现能力显著领先
除了在传统预测任务上表现优异,LimiX-2 在因果发现(causal discovery)方面也取得技术突破。传统方法(如 PC 算法、GES)通常依赖强统计假设(如无隐变量、线性关系)或专家先验知识,在高维、噪声大的企业数据中效果有限。
LimiX-2 凭借其对变量联合分布的深度建模能力,在 Sachs、UF、Causal Chamber 等多个因果发现标准数据集上显著优于传统方法。它不需要预先指定因果方向,而是通过学习数据中的条件独立性结构,自动推断变量间的潜在因果骨架。
这一能力为后续的反事实推理和干预决策奠定了基础,标志着结构化数据 AI 正从“预测”向“决策”演进。
已落地60余个真实场景
截至2026年世界人工智能大会,上一代 LimiX 模型已完成800余个公开数据集的跨行业验证,并在60多个真实业务场景中落地应用。典型场景包括:
- 半导体制造中的工艺参数优化
- 工业设备的故障预测与健康管理
- 电网负荷与新能源发电预测
- 建筑与数据中心的能耗优化
- 材料科学中的成分-性能关系建模
这些应用共同验证了 LimiX 的核心价值:用一个通用基础模型替代过去“一任务一模型”的碎片化开发模式,大幅降低企业AI应用门槛。
结构化数据大模型进入“GPT-3时刻”
当前,结构化数据基础模型赛道正加速发展,国际竞争日益激烈。Google、Amazon、SAP 等公司纷纷加大投入,而以 LimiX 为代表的中国团队则探索出一条以产业场景驱动模型迭代的技术路径。
稳准智能首席科学家崔鹏表示:“LimiX-2 的发布和此次 Benchmark 成绩,是团队在结构化数据大模型方向持续探索的重要阶段性成果。我们仍将长期坚持这一技术路线,并不断提升模型对数据规律和变量因果关系的理解能力。未来,我们将继续推动模型在因果智能方向上的发展,助力人工智能更快速地从预测走向决策。”
相关技术报告《LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence》已公开于 arXiv,代码和模型也已在 GitHub、Hugging Face 和 ModelScope 开源。