AI 模型与平台
NVIDIA 发布用于表格预测的开放 Kumo Tabular 模型

NVIDIA 于 2026 年 9 月 29 日发布了 Kumo Tabular,这是一款用于表格分类和回归的开放基础模型,可在一次前向传播中预测新行的标签,无需训练、调优或特征工程。该模型完全在人工数据上进行预训练,提供三种规模,参数量从 2800 万到 2.15 亿不等。
Kumo Tabular 是 NVIDIA Kumo Structured 模型集合的一部分,依据 Hugging Face 博客上的公告。权重可从 模型在 Hugging Face 的列表 获取,遵循 OpenMDW 1.1 许可证,NVIDIA 表示该许可证允许商业使用,推理通过开源 structured-data-models 库 进行,该库在首次使用时下载权重,并提供 NVIDIA 评估中使用的预处理、集成以及多类别处理功能。
NVIDIA 将此次发布置于过去二十年企业表格任务(如流失、违约、需求和价格预测)依赖梯度提升树的背景下,每个新问题都需要进行标注、特征工程、调优、验证和部署的完整周期。公司表示,该模型将大语言模型的上下文学习模式应用于表格,读取标记表格作为上下文,直接预测新行的标签。
架构与上下文预测
Kumo Tabular 是围绕表格结构构建的 Transformer,使用列、行以及上下文注意力,正如 TabICL 和 TabPFN 中所提出的。为了预测标签,模型确定每个数值在其列中的含义、行内列之间的交互方式,以及已标记的上下文行与标签未知的查询行之间的关系。
在单元嵌入阶段,一组单元会被转换为一个 token。数值型和类别型数据通过傅里叶特征、学习频率的正弦和余弦,并为每种类型使用独立的权重。缺失值会被特殊处理,无需填补,且上下文中的每个 token 都会获得标签嵌入。随后,每行通过交替列注意力进行压缩,这是一种感应自注意力,其计算成本随行数线性增长,行注意力学习行特征之间的交互,并使用旋转位置区分列。四个可学习的 CLS token 与每行结合,作为最终的读出。
最终的 Transformer 在行嵌入上进行操作。上下文行相互注意,而查询行仅关注上下文行,因此每个预测仅依赖于上下文和该行本身,且上下文的键和值只计算一次并在后续预测中复用。查询行使用 Test-GQA,它在每次预测时缩小缓存。长度感知的注意力温度会根据键的数量的对数增长的因子对每个查询进行缩放,每个头部都有单独学习的系数,在推理表远长于典型训练表时保持注意力的锐利度。每个头部输出分类的类别概率或回归的 999 个分位数,从而得到点预测和不确定性估计。
在人工表格上的预训练
每个训练表格均通过六个步骤从结构因果模型中抽样。生成器为整个表格绘制配置,然后使用随机抽取的函数(包括线性映射、小型神经网络、树和高斯过程)在根到叶的随机因果图上链接隐藏变量。部分节点会成为数值或类别列,一个成为目标列,其余保持隐藏,类似于真实数据背后未测量的因果。后处理会关联列组、截断异常值并注入缺失值,树集成检查会剔除任何没有可学习信号的表格。
NVIDIA 表示,他们在生成器中加入了真实表格的不完美因素:数值会以多种模式缺失,一些特征被粗化,使得重复行的标签可能不一致,某些类别列拥有众多层级,回归目标可能呈重尾分布。训练采用交叉熵损失用于分类,分位数损失用于回归,两项任务分别以独立模型进行训练,且分为三个阶段:包含 1,024 行、最多 100 列的表格;上下文行数在 400 至 10,240 行之间变化;以及最终最多 60,000 行的上下文。Small、Medium、Large 三个变体分别使用约 3500 万、7100 万和 1.37 亿个人工表格进行训练。
NVIDIA 报告的基准结果
NVIDIA 报告称,他们在默认设置下使用全部三种规模在完整的 TabArena 排行榜上进行测试,该排行榜涵盖了调优的梯度提升树、AutoGluon 以及近期的表格基础模型,结果 Kumo Tabular 以 1950 的 ELO 分位居整体第一,并且在统一的单 RTX 6000 Pro 评估环境下运行速度比 LimiX-2 快 26 倍。公司表示,这三种规模在准确性‑效率的帕累托前沿上树立了新的技术水平。
在 BeyondArena 上,NVIDIA 报告称其 ELO 为 1418,Improvability 得分为 7.78%,位列该排行榜首位。在 TALENT 上,公司报告在分类准确率、分类对数损失和回归 RMSE 三项指标上整体排名第一,平均排名分别为 6.67、3.98 和 4.22。在 ScoringBench(用于预测分布的基准测试)上,NVIDIA 表示 Kumo Tabular-Large 与 Kumo Tabular-Medium 的平均排名分别位列第一和第二。
限制与可用性
Kumo Tabular 仅适用于数值列和类别列;文本、图像或时间戳可通过内置的预处理配方转换为特征。单次前向传播可覆盖最多 10 类,库通过纠错输出码将模型扩展至任意类别数。NVIDIA 提醒,若表格远超训练范围或查询行的分布与上下文行不同,准确率可能下降,并建议在部署前使用留出数据验证准确率和校准情况。
structured-data-models 包是 GPU 原生的,要求 Python 3.11 及以上、PyTorch 2.7 及以上,并推荐在 CUDA 工作负载下使用 cudf,以便数据帧操作保持在 GPU 上。该包提供 TabICLv2、KumoTabular、TabFM 等表格基础模型以及关系模型 KumoRelational 的参考实现,且仓库中由 NVIDIA 编写的代码采用 Apache 2.0 许可证。
NVIDIA 表示,Kumo Tabular 背后的训练配方和人工数据生成器将很快发布。












