行业新闻

蚂蚁统一宽表系统 OmniTable 获 VLDB 2026 工业最佳论文

OmniTable 用统一宽表重构 PB 级语料处理流程,大幅缩短数据准备周期,是工程层面对大模型训练效率的务实改进。

蚂蚁集团推出统一宽表系统 OmniTable,用于管理 PB 级大模型训练数据。它将同一数据域组织成逻辑宽表,统一特征定义与依赖,将异常隔离到记录级。在真实任务中,端到端周期从约 14 天缩至 2.5 天,手工步骤从 45 步降至 12 步。

正文摘录

还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 训练一个大模型之前,语料要经过解析、清洗、去重、质量评分、Token 化和样本组装。规模来到 PB 级,工程团队每天面对的不止算力账单,还有数百张表、不断增加的特征,以及少数几条就可能让整批任务重跑的异常数据。 今年的 VLDB 工业赛道最佳论文,关注的正是大模型训练中非常重要,但也常被忽视的环节——数据准备。论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》介绍了一套由蚂蚁集团研发的统一宽表系统 OmniTable。 (图说:蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获评 VLDB 2026 工业赛道最佳论文,9 月 1 日在波士顿举行的大会上获颁奖项。) 论文链接:https://www.vldb.org/pvldb/vol19/p4276-fu.pdf 论文披露,OmniTable 已在生产环境管理超过 35 PB、3050 亿条以上的大模型训练数据,覆盖 Web、代码、PDF 和 SFT 等数据域。在一项真实 SFT 数据准备任务中,端到端周期从约 14 天缩短到 2.5 天,手工操作步骤从 45 步降至 12 步。 这个结果并非来自一台更快的机器。OmniTable 改了数据工程师组织数据和特征的方式:同一数据域在上层呈现为一张逻辑宽表,底层继续按数据规模、访问方式和计算引擎拆分;特征也从脚本中的临时计算,变成带有定义、版本、依赖和血缘的系统资产。

阅读原文(qbitai.com)→

行业新闻量子位的朋友们2026-09-02原文

相关内容