Modelli e piattaforme di IA
NVIDIA rilascia il modello Open Kumo Tabular per la previsione tabellare

Il 29 settembre 2026 NVIDIA ha rilasciato Kumo Tabular, un modello di base aperto per la classificazione e regressione tabellare che prevede le etichette di nuove righe in un unico passaggio in avanti, senza addestramento, messa a punto o ingegneria delle caratteristiche. Il modello è stato preaddestrato interamente su dati artificiali ed è disponibile in tre dimensioni, da 28 milioni a 215 milioni di parametri.
Kumo Tabular fa parte della collezione di modelli NVIDIA Kumo Structured, secondo l’annuncio sul blog di Hugging Face. I pesi sono disponibili da l’elenco Hugging Face del modello sotto licenza OpenMDW 1.1, che NVIDIA ha dichiarato consenta l’uso commerciale, e l’inferenza avviene tramite la libreria open source la libreria structured-data-models, che scarica i pesi al primo utilizzo e fornisce la preelaborazione, l’ensemble e la gestione di molte classi usate nelle valutazioni di NVIDIA.
NVIDIA inquadra il rilascio nel contesto di due decenni in cui le attività tabellari aziendali, come la previsione di churn, default, domanda e prezzo, si sono basate su alberi potenziati dal gradiente, con ogni nuova domanda che richiedeva un proprio ciclo di etichettatura, ingegneria delle caratteristiche, messa a punto, validazione e distribuzione. L’azienda afferma che il modello applica il pattern di apprendimento in contesto dei grandi modelli linguistici alle tabelle, leggendo una tabella etichettata come contesto per prevedere direttamente le etichette delle nuove righe.
Architettura e previsione in contesto
Kumo Tabular è un Transformer costruito attorno alla struttura di una tabella, che utilizza l’attenzione per colonna, riga e in contesto come introdotto in TabICL e TabPFN. Per prevedere un’etichetta, il modello stabilisce il significato di ogni valore all’interno della sua colonna, come le colonne di una riga interagiscono e come le righe di contesto etichettate si relazionano alle righe di query le cui etichette sono sconosciute.
Nella fase di embedding delle celle, un gruppo di celle diventa un token. I valori numerici e categorici passano attraverso caratteristiche di Fourier, seni e coseni di frequenze apprese, con pesi separati per ciascun tipo. I valori mancanti sono trattati in modo speciale e non richiedono imputazione, e ogni token nel contesto riceve un embedding di etichetta. Ogni riga viene quindi compressa in un embedding mediante attenzione alternata per colonna, un’auto‑attenzione indotta il cui costo cresce linearmente con il numero di righe, con attenzione per riga che apprende come interagiscono le caratteristiche di una riga, usando posizioni rotazionali per distinguere le colonne. Quattro token CLS apprendibili si uniscono a ciascuna riga e fungono da lettura finale.
Un Transformer finale opera sugli embedding delle righe. Le righe di contesto si attendono reciprocamente, mentre le righe di query attendono solo le righe di contesto, così ogni previsione dipende solo dal contesto e dalla riga stessa, e le chiavi e i valori del contesto vengono calcolati una volta e riutilizzati per previsioni successive. Le righe di query usano Test-GQA, che riduce la cache letta da ogni previsione. Una temperatura di attenzione sensibile alla lunghezza scala ogni query di un fattore che cresce con il logaritmo del numero di chiavi, con un coefficiente appreso separatamente per ciascuna testa, mantenendo l’attenzione nitida quando una tabella di inferenza è molto più lunga di una tipica tabella di addestramento. Una testa produce probabilità di classe per la classificazione o 999 quantili per la regressione, fornendo una previsione puntuale e una stima di incertezza.
Pre‑addestramento su tabelle artificiali
Ogni tabella di addestramento è campionata da un Modello Causale Strutturale in sei passaggi. Il generatore estrae una configurazione per l’intera tabella, quindi collega le variabili nascoste con un grafo causale casuale valutato dalla radice alle foglie usando funzioni estratte casualmente in ogni nodo, includendo mappe lineari, piccole reti neurali, alberi e processi Gaussiani. Alcuni nodi diventano colonne numeriche o categoriche, uno diventa il target e il resto rimane nascosto, come le cause non misurate dietro i dati reali. Il post‑processing correla gruppi di colonne, taglia gli outlier e inserisce valori mancanti, e un controllo a ensemble di alberi scarta qualsiasi tabella priva di un segnale apprendibile.
NVIDIA ha dichiarato di aver incorporato le imperfezioni delle tabelle reali nel generatore: i valori mancano in diversi schemi, alcune caratteristiche sono approssimate in modo che righe duplicate possano discordare sulla loro etichetta, alcune colonne categoriche hanno molti livelli e i target di regressione possono avere code pesanti. L’addestramento utilizza una perdita di cross‑entropy per la classificazione e una perdita di quantile per la regressione, con i due compiti addestrati come modelli separati, e si svolge in tre fasi: tabelle di 1.024 righe e fino a 100 colonne, contesti che variano da 400 a 10.240 righe, e infine contesti fino a 60.000 righe. Le varianti Small, Medium e Large hanno visto rispettivamente circa 35 milioni, 71 milioni e 137 milioni di tabelle artificiali.
Risultati dei benchmark riportati da NVIDIA
NVIDIA riferisce di aver eseguito tutte e tre le dimensioni con impostazioni predefinite contro l’intera classifica TabArena, che comprende alberi potenziati dal gradiente ottimizzati, AutoGluon e recenti modelli di base tabellari, e che Kumo Tabular si posiziona al primo posto complessivo con un ELO di 1950, risultando 26 volte più veloce di LimiX-2 in un contesto di valutazione uniforme con un singolo RTX 6000 Pro. L’azienda ha affermato che le tre dimensioni stabiliscono un nuovo stato dell’arte sul fronte Pareto accuratezza‑efficienza.
Su BeyondArena, NVIDIA segnala un ELO di 1418 e un punteggio di Improvability del 7,78%, posizionandosi al primo posto di quella classifica. Su TALENT, l’azienda riporta il ranking complessivo più alto per accuratezza di classificazione, log-loss di classificazione e RMSE di regressione, con ranghi medi rispettivamente di 6,67, 3,98 e 4,22. Su ScoringBench, un benchmark per le distribuzioni predittive, NVIDIA ha dichiarato che Kumo Tabular-Large e Kumo Tabular-Medium si classificano al primo e al secondo posto in termini di rango medio.
Limitazioni e disponibilità
Kumo Tabular funziona solo su colonne numeriche e categoriche; testo, immagini o timestamp possono essere trasformati in caratteristiche tramite ricette di pre‑processing integrate. Un singolo passaggio in avanti gestisce fino a 10 classi, e la libreria estende il modello a un numero arbitrario di classi mediante codici di output correttivi. NVIDIA avverte che l’accuratezza potrebbe degradarsi su tabelle molto al di fuori degli intervalli di addestramento o quando le righe di query provengono da una distribuzione diversa rispetto alle righe di contesto, e consiglia di convalidare accuratezza e calibrazione su dati di test prima del dispiegamento.
Il pacchetto structured-data-models è nativo GPU, richiede Python 3.11 o versioni successive e PyTorch 2.7 o successive, e raccomanda cudf per i carichi di lavoro CUDA affinché le operazioni sui dataframe rimangano sulla GPU. Ospita implementazioni di riferimento dei modelli di base tabulari TabICLv2, KumoTabular e TabFM insieme al modello relazionale KumoRelational, e il codice scritto da NVIDIA nel repository è rilasciato sotto licenza Apache 2.0.
NVIDIA ha dichiarato che la ricetta di addestramento e i generatori di dati artificiali alla base di Kumo Tabular saranno rilasciati a breve.












