Modèles et plateformes d’IA
NVIDIA publie le modèle ouvert Kumo Tabular pour la prédiction tabulaire

NVIDIA a publié le 29 septembre 2026 Kumo Tabular, un modèle de fondation ouvert pour la classification et la régression tabulaires qui prédit les étiquettes des nouvelles lignes en un seul passage avant, sans entraînement, réglage ou ingénierie des caractéristiques. Le modèle a été pré‑entraîné entièrement sur des données artificielles et est disponible en trois tailles, de 28 millions à 215 millions de paramètres.
Kumo Tabular fait partie de la collection de modèles NVIDIA Kumo Structured, selon l’annonce sur le blog de Hugging Face. Les poids sont disponibles depuis la page du modèle sur Hugging Face sous la licence OpenMDW 1.1, que NVIDIA indique autoriser une utilisation commerciale, et l’inférence s’effectue via la bibliothèque open‑source bibliothèque structured-data-models, qui télécharge les poids lors de la première utilisation et fournit le prétraitement, l’ensemble, et la gestion de nombreuses classes utilisées dans les évaluations de NVIDIA.
NVIDIA situe cette sortie dans le contexte de deux décennies durant lesquelles les tâches tabulaires d’entreprise telles que la prédiction d’attrition, de défaut, de demande et de prix ont reposé sur des arbres à gradient boosté, chaque nouvelle question nécessitant son propre cycle d’étiquetage, d’ingénierie des caractéristiques, de réglage, de validation et de déploiement. L’entreprise affirme que le modèle applique le schéma d’apprentissage en contexte des grands modèles de langage aux tables, en lisant une table étiquetée comme contexte pour prédire directement les étiquettes des nouvelles lignes.
Architecture et prédiction en contexte
Kumo Tabular est un Transformer construit autour de la structure d’une table, utilisant l’attention par colonne, ligne et en contexte comme introduit dans TabICL et TabPFN. Pour prédire une étiquette, le modèle détermine ce que chaque valeur signifie dans sa colonne, comment les colonnes d’une ligne interagissent, et comment les lignes de contexte étiquetées se rapportent aux lignes de requête dont les étiquettes sont inconnues.
Lors de l’étape d’encodage des cellules, un groupe de cellules devient un jeton. Les valeurs numériques et catégorielles passent par des caractéristiques de Fourier, des sinus et cosinus de fréquences apprises, avec des poids séparés pour chaque type. Les valeurs manquantes sont traitées spécialement et ne nécessitent aucune imputation, et chaque jeton du contexte reçoit un encodage d’étiquette. Chaque ligne est ensuite compressée en un embedding grâce à une attention alternée par colonne, une auto‑attention induite dont le coût croît linéairement avec le nombre de lignes, avec une attention de ligne qui apprend comment les caractéristiques d’une ligne interagissent, en utilisant des positions rotatives pour distinguer les colonnes. Quatre jetons CLS apprenables se joignent à chaque ligne et servent de lecture finale.
Un Transformer final opère sur les embeddings de lignes. Les lignes de contexte s’attendent les unes aux autres tandis que les lignes de requête ne s’attendent qu’aux lignes de contexte, de sorte que chaque prédiction ne dépend que du contexte et de la ligne elle‑même, et les clés et valeurs du contexte sont calculées une fois et réutilisées pour les prédictions ultérieures. Les lignes de requête utilisent Test‑GQA, qui réduit le cache lu à chaque prédiction. Une température d’attention sensible à la longueur ajuste chaque requête par un facteur qui augmente avec le logarithme du nombre de clés, avec un coefficient appris séparément pour chaque tête, maintenant une attention nette lorsqu’une table d’inférence est bien plus longue qu’une table d’entraînement typique. Une tête produit des probabilités de classe pour la classification ou 999 quantiles pour la régression, fournissant une prédiction ponctuelle et une estimation d’incertitude.
Pré‑entraînement sur des tables artificielles
Chaque table d’entraînement est échantillonnée à partir d’un Modèle Causal Structurel en six étapes. Le générateur tire une configuration pour l’ensemble de la table, puis relie les variables cachées avec un graphe causal aléatoire évalué de la racine aux feuilles en utilisant des fonctions tirées aléatoirement à chaque nœud, incluant des cartes linéaires, de petits réseaux neuronaux, des arbres et des processus gaussiens. Certains nœuds deviennent des colonnes numériques ou catégorielles, un devient la cible, et le reste reste caché, comme les causes non mesurées derrière les données réelles. Le post‑traitement corrèle des groupes de colonnes, coupe les valeurs aberrantes et injecte des valeurs manquantes, et une vérification par ensemble d’arbres élimine toute table dépourvue de signal apprenable.
NVIDIA a indiqué qu’elle a intégré les imperfections des tables réelles dans le générateur : les valeurs disparaissent selon plusieurs schémas, certaines caractéristiques sont grossies de façon à ce que des lignes dupliquées puissent diverger sur leur étiquette, certaines colonnes catégorielles comportent de nombreux niveaux, et les cibles de régression peuvent avoir des queues lourdes. L’entraînement utilise une perte d’entropie croisée pour la classification et une perte de quantile pour la régression, les deux tâches étant entraînées comme modèles séparés, et se déroule en trois étapes : tables de 1 024 lignes et jusqu’à 100 colonnes, contextes variant de 400 à 10 240 lignes, puis finalement des contextes allant jusqu’à 60 000 lignes. Les variantes Small, Medium et Large ont vu respectivement environ 35 millions, 71 millions et 137 millions de tables artificielles.
Résultats de référence rapportés par NVIDIA
NVIDIA indique avoir exécuté les trois tailles avec les paramètres par défaut sur le tableau complet du classement TabArena, qui comprend des arbres à gradient boosté réglés, AutoGluon et les récents modèles de fondation tabulaires, et que Kumo Tabular se classe premier au classement général avec un ELO de 1950 tout en étant 26 fois plus rapide que LimiX‑2 dans un environnement d’évaluation uniforme avec un seul RTX 6000 Pro. L’entreprise a déclaré que les trois tailles établissent un nouvel état de l’art sur le front Pareto précision‑efficacité.
Sur BeyondArena, NVIDIA rapporte un ELO de 1418 et un score d’améliorabilité de 7,78 %, se plaçant premier sur ce classement. Sur TALENT, l’entreprise rapporte le meilleur classement global en précision de classification, perte logarithmique de classification et RMSE de régression, avec des rangs moyens de 6,67, 3,98 et 4,22, respectivement. Sur ScoringBench, un benchmark pour les distributions prédictives, NVIDIA a indiqué que Kumo Tabular-Large et Kumo Tabular-Medium occupent respectivement la première et la deuxième place en rang moyen.
Limitations et disponibilité
Kumo Tabular ne fonctionne qu’avec des colonnes numériques et catégorielles ; le texte, les images ou les horodatages peuvent être transformés en caractéristiques grâce à des recettes de prétraitement intégrées. Un seul passage avant couvre jusqu’à 10 classes, et la bibliothèque étend le modèle à un nombre quelconque de classes à l’aide de codes de sortie correcteurs d’erreurs. NVIDIA avertit que la précision peut se dégrader sur des tables bien au‑delà des plages d’entraînement ou lorsque les lignes de requête proviennent d’une distribution différente de celle des lignes de contexte, et elle recommande de valider la précision et l’étalonnage sur des données de validation avant le déploiement.
Le package structured-data-models est natif GPU, nécessite Python 3.11 ou une version ultérieure ainsi que PyTorch 2.7 ou ultérieur, et recommande cudf pour les charges de travail CUDA afin que les opérations de dataframe restent sur le GPU. Il héberge des implémentations de référence des modèles de base tabulaires TabICLv2, KumoTabular et TabFM ainsi que du modèle relationnel KumoRelational, et le code rédigé par NVIDIA dans le dépôt est sous licence Apache 2.0.
NVIDIA a indiqué que la recette d’entraînement et les générateurs de données artificielles derrière Kumo Tabular seront publiés bientôt.












