还在为大模型洗数据熬夜?
蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 量子位的朋友们 2026-09-02 14:20:17 来源: 量子位 蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文 训练一个大模型之前,语料要经过解析、清洗、去重、质量评分、Token 化和样本组装。
规模来到 PB 级,工程团队每天面对的不止算力账单,还有数百张表、不断增加的特征,以及少数几条就可能让整批任务重跑的异常数据。
今年的 VLDB 工业赛道最佳论文,关注的正是大模型训练中非常重要,但也常被忽视的环节——数据准备。
论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》介绍了一套由蚂蚁集团研发的统一宽表系统 OmniTable。
(图说:蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获评 VLDB 2026 工业赛道最佳论文,9 月 1 日在波士顿举行的大会上获颁奖项。
)
🔗 原始来源
如果你要核对细节,可以再看原文: 量子位原文链接
AI热榜