AIモデルとプラットフォーム
NVIDIA、表形式予測向けオープン Kumo Tabular モデルをリリース

NVIDIAは2026年9月29日に、Kumo Tabular をリリースしました。これは表形式の分類と回帰のためのオープン基盤モデルで、トレーニングやチューニング、特徴量エンジニアリングを行わずに、単一のフォワードパスで新しい行のラベルを予測します。モデルは完全に人工データで事前学習されており、パラメータ数が2,800万から2.15億までの3つのサイズで提供されます。
Kumo Tabular は NVIDIA Kumo Structured モデルコレクションの一部であり、Hugging Face のブログでの発表によります。重みは モデルの Hugging Face リスティング から入手でき、OpenMDW 1.1 ライセンスの下で商用利用が可能であると NVIDIA が述べています。推論はオープンソースの structured-data-models ライブラリ を通じて実行され、初回使用時に重みをダウンロードし、前処理、アンサンブル、そして NVIDIA の評価で使用された多数クラスの取り扱いを提供します。
NVIDIA は、解約率、デフォルト、需要、価格予測などのエンタープライズ向け表形式タスクが、過去20年間にわたり勾配ブースティングツリーに依存してきたことを背景に本リリースを位置付けています。新たな質問ごとにラベリング、特徴量エンジニアリング、チューニング、検証、デプロイのサイクルが必要でした。同社は、このモデルが大規模言語モデルのインコンテキスト学習パターンを表形式に適用し、ラベル付けされたテーブルをコンテキストとして読み取り、直接新しい行のラベルを予測すると述べています。
アーキテクチャとインコンテキスト予測
Kumo Tabular はテーブル構造を中心に構築された Transformer で、TabICL と TabPFN で導入された列、行、インコンテキスト アテンションを使用します。ラベルを予測するために、モデルは各値が所属する列内で何を意味するか、行の列同士の相互作用、そしてラベル付けされたコンテキスト行がラベル未知のクエリ行とどのように関連するかを把握します。
セル埋め込み段階では、複数のセルがトークンに変換されます。数値およびカテゴリカル値はフーリエ特徴量、学習された周波数のサインとコサインを通過し、タイプごとに別々の重みが適用されます。欠損値は特別に扱われ、補完は不要で、コンテキスト内のすべてのトークンはラベル埋め込みを受け取ります。その後、各行は交互の列アテンションによって埋め込みに圧縮されます。この誘導型自己アテンションは行数に比例して計算コストが線形に増加し、行アテンションは回転位置エンコーディングを用いて列を区別しながら、行の特徴がどのように相互作用するかを学習します。4 つの学習可能な CLS トークンが各行に付加され、最終的な出力として機能します。
最終的な Transformer が行埋め込み上で動作します。コンテキスト行同士は相互にアテンションし、クエリ行はコンテキスト行のみにアテンションするため、各予測はコンテキストと対象行のみに依存し、コンテキストのキーとバリューは一度計算され、以降の予測で再利用されます。クエリ行は Test-GQA を使用し、各予測でキャッシュを縮小します。長さに応じたアテンション温度は、キー数の対数に比例して増加する係数で各クエリをスケーリングし、ヘッドごとに別々に学習された係数により、推論テーブルが典型的な学習テーブルよりはるかに長い場合でもアテンションが鋭く保たれます。各ヘッドは分類の場合はクラス確率、回帰の場合は999分位点を出力し、点予測と不確実性推定を提供します。
人工テーブルでの事前学習
すべての学習テーブルは、構造因果モデルから6段階でサンプリングされます。ジェネレータはテーブル全体の構成を抽出し、隠れ変数をランダムな因果グラフで結び付けます。このグラフは根から葉へと評価され、各ノードでは線形写像、小規模ニューラルネットワーク、決定木、ガウス過程などのランダムに抽出された関数が使用されます。いくつかのノードは数値またはカテゴリカル列となり、1つはターゲット列となり、残りは実データの測定されていない原因のように隠れたままです。後処理では列のグループ間の相関付けを行い、外れ値をクリップし、欠損値を注入します。また、ツリーアンサンブルチェックにより、学習可能なシグナルがないテーブルは除外されます。
NVIDIA は、実際のテーブルの不完全性をジェネレータに組み込んだと述べています。値がさまざまなパターンで欠損したり、重複行がラベルで不一致になるように一部の特徴が粗くされたり、カテゴリカル列が多数のレベルを持ったり、回帰ターゲットがヘビーテイルになることがあります。学習は分類にクロスエントロピー損失、回帰に分位点損失を使用し、2つのタスクは別々のモデルとして訓練され、3段階で実行されます:1,024 行までで最大100列のテーブル、コンテキストは400行から10,240行、最終的に最大60,000行のコンテキストです。Small、Medium、Large バリアントはそれぞれ約3,500万、7,100万、1億3,700万の人工テーブルで訓練されました。
NVIDIA が報告したベンチマーク結果
NVIDIA は、デフォルト設定で3つのサイズすべてを完全な TabArena リーダーボード(チューニングされた勾配ブースティングツリー、AutoGluon、最新の表形式基盤モデルを網羅)に対して実行し、Kumo Tabular が総合でELO 1950 を獲得して全体首位となり、単一 RTX 6000 Pro を用いた均一な評価環境下で LimiX-2 の26倍の速度で動作したと報告しています。同社は、これら3つのサイズが精度と効率のパレートフロントにおいて新たな最先端を確立したと述べました。
BeyondArena では、NVIDIA が ELO 1418 と Improvability スコア 7.78% を報告し、同リーダーボードで首位に立ちました。TALENT では、同社は分類精度、分類ロス、回帰 RMSE の全体ランキングでトップであり、平均順位はそれぞれ 6.67、3.98、4.22 です。ScoringBench(予測分布のベンチマーク)において、NVIDIA は Kumo Tabular-Large と Kumo Tabular-Medium が平均順位でそれぞれ第1位と第2位であると述べました。
制限事項と利用可能性
Kumo Tabular は数値列とカテゴリ列のみで動作し、テキスト、画像、タイムスタンプは組み込みの前処理レシピを通じて特徴量に変換できます。単一のフォワードパスで最大 10 クラスをカバーし、ライブラリは誤り訂正出力コードを用いて任意のクラス数にモデルを拡張します。NVIDIA は、トレーニング範囲を大きく超えるテーブルや、クエリ行がコンテキスト行とは異なる分布から来た場合に精度が低下する可能性があると警告し、展開前に保持データで精度とキャリブレーションを検証することを推奨しています。
structured-data-models パッケージは GPU ネイティブで、Python 3.11 以降と PyTorch 2.7 以降が必要です。また、CUDA ワークロードでデータフレーム操作を GPU 上に保つために cudf の使用が推奨されます。このパッケージは、タブular 基盤モデル TabICLv2、KumoTabular、TabFM とリレーショナルモデル KumoRelational のリファレンス実装をホストしており、リポジトリ内の NVIDIA 製コードは Apache 2.0 ライセンスの下で提供されています。
NVIDIA は、Kumo Tabular のトレーニングレシピと人工データジェネレータが近日中に公開されると述べました。












