NVIDIA 发布开源表格基础模型 Kumo Tabular,在 TabArena 等四项基准排名第一

NVIDIA 于 9 月 29 日发布开源表格基础模型 Kumo Tabular,无需训练、调参和特征工程,单次前向推理即可完成分类与回归预测,并在 TabArena、BeyondArena、TALENT、ScoringBench 四项基准上排名第一。

一句话看懂:NVIDIA 于 9 月 29 日发布开源表格基础模型 Kumo Tabular,无需训练、调参和特征工程,单次前向推理即可完成分类与回归预测,并在 TabArena、BeyondArena、TALENT、ScoringBench 四项基准上排名第一。

事件核心:发生了什么

Kumo Tabular 属于 NVIDIA Kumo Structured 模型系列,权重已上线 Hugging Face,代码托管在 NVIDIA 的 structured-data-models 仓库,采用允许商用的 OpenMDW-1.1 许可。模型只有 28M 到 215M 三个参数量级,走开源推理库,输入一张带标签的表格,直接输出新行的类别概率或数值预测。

它的思路接近大模型的上下文学习:预训练阶段只用了人工合成数据,推理时把已标注行当作上下文,不更新任何权重。架构上沿用 TabICL、TabPFN 一类的列注意力、行注意力与上下文注意力组合,缺失值无需填补,回归任务输出 999 个分位数,附带不确定性估计。

为什么重要

表格数据是企业机器学习的基本盘,客户记录、交易、订单、理赔几乎都以表格形态存在,过去二十年主要靠梯度提升树。问题在于每个新任务都要重新收集标签、做特征工程、搜超参、验证、部署,模型对“表格”本身没有通用认知,每次都从零学。

Kumo Tabular 把这一流程压缩成一次前向推理,等于给表格预测引入“基础模型”范式。开源、可商用、覆盖分类与回归,对长期被闭源 AutoML 和云端 API 把持的表格赛道,是一次直接的路线竞争。

对用户/开发者/创作者的影响

对开发者,最直接的变化是表格任务的冷启动成本大幅下降:手头有几十到几百行带标签数据就能先跑一轮基线,不必先建特征管道和调参流程。28M 的版本对本地显存和算力要求不高,适合在边缘或中小规模环境里先验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

需要提醒的是,它替代的是“从零训练模型”这一步,不替代数据治理、标签质量判断和业务口径定义。合成数据预训练虽然规避了真实数据授权问题,但面对分布差异极大的行业表格(如金融风控、医疗记录)是否稳定,目前公开信息显示还需实测确认。用商用许可并不等于免合规,数据来源和下游用途仍要自行把关。

值得关注的后续

一是看社区在真实企业表格上的复现结果,尤其是缺失严重、类别极多、样本极少的场景是否仍保持领先;二是看竞品是否跟进,TabPFN、AutoGluon 等既有方案会不会加速开源或调整定价;三是看 NVIDIA 是否把它接入更完整的结构化数据工具链,以及与 GPU 推理栈的绑定程度。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 26308

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注