产品派
返回

LimiX-2在三项结构化数据基准测试中夺得第一

AI量子位2026/9/18 20:22:47
AI 导读

结构化数据基础模型赛道正吸引Google、Amazon和SAP等巨头参与。9月15日,SAP发布TabPFN-3.5;次日,稳准智能联合清华团队推出400M参数的LimiX-2,在TabArena、TALENT、BCCO三项国际基准测试的二分类、多分类和回归任务中均获第一,领先Google TabFM、TabPFN、TabICL、Mitra等模型。

LimiX-2的目标并非只提高单一结果的预测准确率,而是让模型直接学习结构化数据中的变量关系、条件依赖和生成机制。与主要处理文本、代码等已被人类语义化信息的大语言模型不同,LDM面向制造、科研等场景中的高维数据,关注温度、压力、转速、设备状态等变量如何共同变化。

如果把生产数据先转换为文本,细粒度差异可能在信息压缩中丢失,进而影响精度、良率和风险判断。LDM则试图从原始变量关系出发理解真实世界,因此被视为与LLM互补的基础模型路线。

近两年,Google推出表格数据基础模型TabFM,Amazon发布用于跨表格、跨任务迁移的Mitra;SAP此前推出SAP-RPT-1,并收购TabPFN背后的Prior Labs,投入超过10亿欧元扩建相关团队。TabPFN-3.5 Plus也已进入SAP AI Core,用于现金流预测、付款延迟、供应商风险和客户流失等任务。

稳准智能首席科学家、清华大学计算机系崔鹏教授长期研究结构化数据与因果智能。团队去年发布国内首个结构化数据基础模型LimiX,此次LimiX-2延续了对Scaling规律和因果建模的探索,但没有沿用仅围绕目标变量进行预测的传统PFN思路。

LimiX-2提出上下文机制网络(CMNs),将学习对象从“预测Y”扩展到理解X、Y及其他变量共同形成数据的机制;同时通过上下文条件掩码建模(CCMM)和自动化合成数据引擎,不断遮蔽并预测不同变量,使模型学习条件依赖和联合结构。

在表示层面,LimiX将建模粒度下沉到Cell-Level,以单元格保留列身份、取值和缺失状态,并支持跨变量、跨样本交互。分类、回归和缺失值填补因此可视为对同一数据模型的不同查询,相关能力也为结构发现和因果骨架发现提供基础。

评测结果显示,LimiX-2在TabArena分类任务按Elo排名的四项指标均居首,Elo达到1917,并领先TabFM+。这表明该团队希望通过CMNs、CCMM和Cell-Level表示,建立从学习目标、训练机制到数据表示的完整结构化数据建模范式。

结构化数据基础模型因果智能LimiX-2

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文