实时 AI 消息
英伟达开源Kumo Tabular,表格预测进入基础模型时代
英伟达正式开源面向表格数据的Kumo Tabular基础模型,给定一张带标签的表格即可在单次前向传播中预测新行标签,无需训练、调参或特征工程。模型提供三种规模,仅用人工合成数据预训练,并在TabArena、BeyondArena、TALENT和ScoringBench四个基准上排名第一。

英伟达9月29日通过Hugging Face博客发布Kumo Tabular,这是一款面向表格数据的开源基础模型,属于英伟达Kumo Structured模型集合。给定一张带有标签行的表格,它能在单次前向传播中完成对新行的预测,分类与回归共用同一套流程,既不需要重新训练,也不需要特征工程或超参数搜索。模型权重托管在Hugging Face,配套代码开源在英伟达的structured-data-models仓库中。
这套做法借鉴的是大语言模型的上下文学习。表格同样可以被当成上下文:模型先去理解每个单元格在所属列中的含义,再理解同一行各列如何相互作用,最后把带标签的上下文行与待预测行关联起来,输出类别概率或数值结果。Kumo Tabular因此是一台围绕表格结构搭建的Transformer,用到列注意力、行注意力与上下文注意力,这一技术路线由TabICL与TabPFN等工作提出。
规格方面,模型提供2800万到2.15亿参数三个规模,只用人工合成数据完成预训练,并以OpenMDW-1.1许可证发布,允许商业使用。英伟达把开源权重与开源库一并放出,还附带可以直接试用的Demo,姿态与只发论文、不放权重的实验室工作明显不同。
在性能表述上,英伟达称Kumo Tabular在TabArena、BeyondArena、TALENT和ScoringBench四个表格基准上均排名第一,并把这次发布称为表格预测在准确率与效率上的新前沿。这些说法来自厂商自述,博客同时也列出了Limitations一节,说明模型存在适用边界。
对产业界而言,值得关注的不是榜单,而是工作方式的改变。表格数据是机器学习的骨干:客户记录、交易流水、传感器日志、理赔与订单都躺在表里,预测流失、违约、需求与价格是最常见的任务。过去二十年,这类工作默认交给梯度提升树,效果稳定,但每个新问题都要重新收集标签、构造特征、调参、验证,再部署一个对表格几乎一无所知的模型。
如果基础模型路线成立,这些环节会被压缩成一次推理。但表格场景的数据规模、缺失模式与合规约束差异极大,实际落地仍需要与传统提升树方案做逐案对比,尤其是在数据稀缺或强解释性要求的场景里,基础模型未必是默认答案。
下一步值得观察两点:一是企业是否会把这套模型接入既有的MLOps流程,二是四项基准上的领先能否在真实业务数据上复现。表格基础模型的竞争正在升温,英伟达用合成数据预训练加开源权重的方式,把这场竞争从论文层面推向工程层面。
为什么重要
表格数据是企业AI中规模最大、最容易被忽视的一环。Kumo Tabular把“免训练推理”的思路从文本搬到表格,若基准优势在真实业务数据上成立,传统特征工程与调参流程的价值将被重新定价。
附近消息
全部09/30 00:55
白宫推出 AI 聊天机器人 America.gov,谷歌 Gemini 参与
美国总统特朗普 9 月 29 日宣布白宫推出 AI 聊天机器人 America.gov,旨在帮助民众更便捷地查找政府服务与信息。谷歌确认参与并提供 Gemini 模型,但外界担忧大语言模型的幻觉问题会给依赖该入口办理福利、签证和报税的民众带来实际风险。
09/29 21:53
玛丽莎·梅耶尔推出 Dazzle:一款完全基于相册的 AI 个人助理
前雅虎 CEO 玛丽莎·梅耶尔推出了一款名为 Dazzle 的 AI 个人助理,它的信息来源完全来自用户的手机相册。TechCrunch 报道称,梅耶尔押注的是:相比收件箱,你的相册里装着更多关于你生活的信息。
09/29 21:47
Meta 将 AI 智能体 Muse 扩展至小微企业
Meta 正在把旗下 AI 智能体 Muse 的适用范围扩展到小微企业,该公司表示,Muse 可以帮助店主经营业务并寻找新客户。对 Meta 来说,这既是对其庞大商家生态的进一步服务,也是一次把 AI 能力变成商家日常工具的尝试。
09/29 20:30
Reco 完成 5500 万美元融资,智能体安全赛道持续升温
AI 智能体安全公司 Reco 完成 5500 万美元新融资,延续了今年 2 月的 3000 万美元融资,公司累计融资额达到 1.4 亿美元。随着企业把能够自主行动的智能体接入生产环境,智能体安全正成为安全创业公司密集涌入的赛道。