郭震 AI公众号:郭震AI

实时 AI 消息

英伟达开源Kumo Tabular,表格预测进入基础模型时代

英伟达正式开源面向表格数据的Kumo Tabular基础模型,给定一张带标签的表格即可在单次前向传播中预测新行标签,无需训练、调参或特征工程。模型提供三种规模,仅用人工合成数据预训练,并在TabArena、BeyondArena、TALENT和ScoringBench四个基准上排名第一。

发布时间
英伟达开源Kumo Tabular,表格预测进入基础模型时代
图源: huggingface.co

英伟达9月29日通过Hugging Face博客发布Kumo Tabular,这是一款面向表格数据的开源基础模型,属于英伟达Kumo Structured模型集合。给定一张带有标签行的表格,它能在单次前向传播中完成对新行的预测,分类与回归共用同一套流程,既不需要重新训练,也不需要特征工程或超参数搜索。模型权重托管在Hugging Face,配套代码开源在英伟达的structured-data-models仓库中。

这套做法借鉴的是大语言模型的上下文学习。表格同样可以被当成上下文:模型先去理解每个单元格在所属列中的含义,再理解同一行各列如何相互作用,最后把带标签的上下文行与待预测行关联起来,输出类别概率或数值结果。Kumo Tabular因此是一台围绕表格结构搭建的Transformer,用到列注意力、行注意力与上下文注意力,这一技术路线由TabICL与TabPFN等工作提出。

规格方面,模型提供2800万到2.15亿参数三个规模,只用人工合成数据完成预训练,并以OpenMDW-1.1许可证发布,允许商业使用。英伟达把开源权重与开源库一并放出,还附带可以直接试用的Demo,姿态与只发论文、不放权重的实验室工作明显不同。

在性能表述上,英伟达称Kumo Tabular在TabArena、BeyondArena、TALENT和ScoringBench四个表格基准上均排名第一,并把这次发布称为表格预测在准确率与效率上的新前沿。这些说法来自厂商自述,博客同时也列出了Limitations一节,说明模型存在适用边界。

对产业界而言,值得关注的不是榜单,而是工作方式的改变。表格数据是机器学习的骨干:客户记录、交易流水、传感器日志、理赔与订单都躺在表里,预测流失、违约、需求与价格是最常见的任务。过去二十年,这类工作默认交给梯度提升树,效果稳定,但每个新问题都要重新收集标签、构造特征、调参、验证,再部署一个对表格几乎一无所知的模型。

如果基础模型路线成立,这些环节会被压缩成一次推理。但表格场景的数据规模、缺失模式与合规约束差异极大,实际落地仍需要与传统提升树方案做逐案对比,尤其是在数据稀缺或强解释性要求的场景里,基础模型未必是默认答案。

下一步值得观察两点:一是企业是否会把这套模型接入既有的MLOps流程,二是四项基准上的领先能否在真实业务数据上复现。表格基础模型的竞争正在升温,英伟达用合成数据预训练加开源权重的方式,把这场竞争从论文层面推向工程层面。

为什么重要

表格数据是企业AI中规模最大、最容易被忽视的一环。Kumo Tabular把“免训练推理”的思路从文本搬到表格,若基准优势在真实业务数据上成立,传统特征工程与调参流程的价值将被重新定价。

微博邮件

NVIDIAOpen SourceFoundation ModelTabular Data
返回实时消息

附近消息

全部