英伟达开源表格基础模型Kumo Tabular,四个基准排名第一且免特征工程

来源:互联网 时间:2026-09-30

A5站长网9月30日消息,英伟达发布开源表格基础模型Kumo Tabular,权重放在Hugging Face,代码放在GitHub主站,采用允许商用的OpenMDW-1.1许可。模型分三档,参数量从2800万到2.15亿,面向表格数据的分类与回归:给一张带标签行的表格,它直接给出新行的预测结果。

这套流程省掉了过去二十年反复出现的固定动作。企业用表格数据做流失、违约、需求与价格预测,长期依赖梯度提升树,每换一个业务问题就要重新收集标签、做特征工程、搜超参数、验证再部署。Kumo Tabular把大模型那套上下文学习搬到表格上:把带标签的行当上下文读进来,一次前向计算出结果,不训练、不调参、不做特征工程。

架构是围绕表格结构搭起来的Transformer。单元格先变成token,数值与类别值分别经过傅里叶特征编码,缺失值不必单独填补,模型自己处理。行向量靠列注意力与行注意力交替生成:列注意力顺着单列学习某个值在本列分布里的位置,计算代价随行数线性增长;行注意力用旋转位置编码区分列,最后每行压缩成固定向量,再由一个Transformer完成预测。

训练数据全部是合成的。英伟达用结构因果模型生成表格,从根到叶随机组合线性映射、小型神经网络、决策树与高斯过程,再刻意注入真实数据的毛病:多模式缺失、特征粗化导致相同特征行标签不一致、高基数类别列、重尾回归目标。三档模型分别见过约3500万、7100万与1.37亿张合成表。

效果上,英伟达称模型在TabArena、BeyondArena、TALENT与ScoringBench四个基准排名第一,TabArena的Elo得分1950,比LimiX-2这类基线快17倍,公司同时提醒超出训练范围的分布精度可能下降。对企业数据团队来说,真正值得留意的不只是榜单,而是那套每个新问题重做一遍的建模流程,第一次出现了可以绕开的路径。

相关文章

标签:

A5创业网 版权所有