稳准智能发布 LimiX-2 结构化数据基础模型,在三大基准测试登顶
中国团队稳准智能发布 400M 参数的结构化数据基础模型 LimiX-2,改以「学变量关系」而非「预测目标」为训练目标,在三大国际基准登顶,也说明 LDM 正成为大厂争夺的新战场。
LDM(Large Data Model,结构化数据基础模型)瞄准生产侧核心痛点:让基础模型直接学习不同结构化数据中的变量关系、条件关系与生成机制。Google、Amazon、SAP 等巨头刚入场布局,中国团队稳准智能已用 400M 参数的 LimiX-2 在三个国际基准上拿下多项第一。
正文摘录
LDM (Large Data Model),即 结构化数据基础模型 ,其瞄准的是生产侧的核心痛点:即如何让基础模型直接学习不同结构化数据中的变量关系、条件关系和生成机制。 像咱熟悉的美国 Google、Amazon ,德国企业软件巨头SAP等玩家纷纷下场布局~ 不过,谁成想呢,巨头们刚涌进LDM抢位,一支中国团队已经先把榜首坐成了「固定席位」。 9月15日,德国软件巨头SAP抢发TabPFN-3.5,几小时后(9月16日),一支由 清华博士 组成的团队,用一个400M参数的结构化数据基础模型—— 直接拿下了TabArena、TALENT、BCCO三个国际主流基准测试中二分类、多分类、回归等各项任务的 「第一」 ,呈现断层领先: 不卖关子,这个把谷歌等一众大厂按在地上摩擦的,就是「稳准智能」刚刚发布的: LimiX-2 。 去年他们发布的国内首个结构化数据基础模型LimiX已经上演过很长一段时间的霸榜大戏,但此后团队也没有追着榜单追赶,而是继续往底层技术和模型储备里扎。 在这家中国团队看来,真正重要的, 从来不是拿下一次第一,而是每到关键节点,都有能力重新回到第一。 而作为国内首个结构化数据通用大模型,LimiX啃下的,正是数据背后最值钱也最难找的「因果规律」。 相比TabPFN这类偏目标预测的行级建模路线,LimiX-2把 面向变量关系建模 前置为核心目标,学习跨变量、跨样本的联合依赖结构。 此外,其还自建了一套高质量 自动化数据合成引擎 ,先让模型见过足够复杂的数据世界,再去处理真实任务。 过去几年,LLM已经吃透了文本、语音、视频,但一碰到工业生产、科学研究等应用侧真正拿来做决策的场景,对因果关系、准确性和稳定性的要求会陡然提高,这也让LDM的价值开始越来越清晰。