AI-modeller og plattformer
NVIDIA lanserer Open Kumo Tabular-modell for tabellprediksjon

NVIDIA publiserte 29. september 2026 Kumo Tabular, en åpen grunnmodell for tabellklassifisering og regresjon som forutsier etikettene til nye rader i ett enkelt fremoverpass, uten trening, justering eller funksjonsutforming. Modellen ble forhåndstrent helt på kunstige data og finnes i tre størrelser fra 28 millioner til 215 millioner parametere.
Kumo Tabular er en del av NVIDIA Kumo Structured-modellsamlingen, ifølge kunngjøringen på Hugging Face‑bloggen. Vektene er tilgjengelige fra modellens Hugging Face‑oppføring under OpenMDW 1.1‑lisensen, som NVIDIA sier tillater kommersiell bruk, og inferens kjøres gjennom det åpne kildekode‑structured-data-models‑biblioteket, som laster ned vektene ved første bruk og tilbyr forhåndsbehandling, sammenslåing og håndtering av mange klasser som brukes i NVIDIAs evalueringer.
NVIDIA setter utgivelsen i kontekst av to tiår hvor bedriftsrelaterte tabelloppgaver som churn, mislighold, etterspørsel og prisforutsigelse har vært avhengige av gradient‑boostede trær, og hver ny problemstilling krever sin egen syklus av merking, funksjonsutforming, justering, validering og utrulling. Selskapet sier at modellen anvender in‑context‑læringsmønsteret fra store språkmodeller på tabeller, ved å lese en merket tabell som kontekst for å direkte forutsi etikettene til nye rader.
Arkitektur og in‑context‑prediksjon
Kumo Tabular er en Transformer konstruert rundt strukturen i en tabell, og bruker kolonne‑, rad‑ og in‑context‑oppmerksomhet som introdusert i TabICL og TabPFN. For å forutsi en etikett fastslår modellen hva hver verdi betyr innen sin kolonne, hvordan radens kolonner samhandler, og hvordan de merkede kontekstradene forholder seg til spørringsradene med ukjente etiketter.
I cell‑embedding‑stadiet blir en gruppe celler til et token. Numeriske og kategoriske verdier går gjennom Fourier‑funksjoner, sinus‑ og cosinus‑komponenter av lærte frekvenser, med separate vekter for hver type. Manglende verdier behandles spesielt og krever ingen imputasjon, og hvert token i konteksten får en etikett‑embedding. Hver rad komprimeres deretter til en embedding ved å veksle kolonne‑oppmerksomhet, en indusert selv‑oppmerksomhet hvis kostnad vokser lineært med antall rader, med rad‑oppmerksomhet som lærer hvordan radens funksjoner samhandler, ved bruk av roterende posisjoner for å skille kolonner. Fire lærbare CLS‑tokens legges til hver rad og fungerer som dens endelige avlesning.
En siste Transformer opererer på rad‑embeddingene. Kontekstrader oppmerksommer hverandre mens spørringsrader kun oppmerksommer kontekstrader, slik at hver prediksjon kun avhenger av konteksten og raden selv, og kontekstens nøkler og verdier beregnes én gang og gjenbrukes for senere prediksjoner. Spørringsrader bruker Test‑GQA, som reduserer cachen hver gang en prediksjon leses. En lengde‑bevisst oppmerksomhetstemperatur skalerer hver spørring med en faktor som vokser med logaritmen til antall nøkler, med en koeffisient lært separat for hvert hode, og holder oppmerksomheten skarp når en inferenstabell er mye lengre enn en typisk treningstabell. Et hode gir ut klasse‑sannsynligheter for klassifisering eller 999 kvantiler for regresjon, og leverer en punkt‑prediksjon samt et usikkerhetsestimat.
Forhåndstrening på kunstige tabeller
Hver treningstabell samples fra en strukturell kausal modell i seks trinn. Generatoren trekker en konfigurasjon for hele tabellen, og kobler deretter skjulte variabler med en tilfeldig kausal graf evaluert fra rot til blad ved bruk av tilfeldig valgte funksjoner i hver node, inkludert lineære avbildninger, små nevrale nettverk, trær og Gaussian‑prosesser. Noen noder blir til numeriske eller kategoriske kolonner, én blir til målet, og resten forblir skjulte, som de umålte årsakene bak reelle data. Etterbehandling korrelerer grupper av kolonner, kutter avvikere og injiserer manglende verdier, og en tre‑ensemble‑sjekk forkaster enhver tabell uten et lærbart signal.
NVIDIA sier at de bygde inn ufullkommenhetene i ekte tabeller i generatoren: verdier mangler i flere mønstre, noen funksjoner er forenklet slik at dupliserte rader kan ha ulike etiketter, noen kategoriske kolonner har mange nivåer, og regresjonsmål kan ha tunghale. Treningen bruker kryss‑entropi‑tap for klassifisering og kvantil‑tap for regresjon, med de to oppgavene trent som separate modeller, og foregår i tre faser: tabeller med 1 024 rader og opptil 100 kolonner, kontekster som varierer fra 400 til 10 240 rader, og til slutt kontekster på opptil 60 000 rader. Variantene Small, Medium og Large så omtrent 35 millioner, 71 millioner og 137 millioner kunstige tabeller, henholdsvis.
NVIDIAs rapporterte benchmark‑resultater
NVIDIA rapporterer at de kjørte alle tre størrelsene med standardinnstillinger mot hele TabArena‑leaderboardet, som omfatter tunede gradient‑boosted trees, AutoGluon og nyere tabular foundation‑modeller, og at Kumo Tabular rangerer først samlet med en ELO på 1950 mens den er 26 ganger raskere enn LimiX-2 under et ensartet enkelt‑RTX 6000 Pro‑evalueringsoppsett. Selskapet sier at de tre størrelsene etablerer en ny standard på Pareto‑fronten for nøyaktighet‑effektivitet.
På BeyondArena rapporterer NVIDIA en ELO på 1418 og en forbedringsscore på 7,78 %, og plasserer seg først på den ranglisten. På TALENT rapporterer selskapet den høyeste totale rangeringen på klassifiseringsnøyaktighet, klassifiseringslogg‑tap og regresjons‑RMSE, med gjennomsnittlige rangeringer på henholdsvis 6,67, 3,98 og 4,22. På ScoringBench, en benchmark for prediktive fordelinger, sa NVIDIA at Kumo Tabular-Large og Kumo Tabular-Medium rangerer første og andre i gjennomsnittsrangering.
Begrensninger og tilgjengelighet
Kumo Tabular fungerer kun på numeriske og kategoriske kolonner; tekst, bilder eller tidsstempler kan omdannes til funksjoner via innebygde forhåndsbehandlingsoppskrifter. En enkelt fremoverpass dekker opptil 10 klasser, og biblioteket utvider modellen til et vilkårlig antall klasser med feilkorrigerende utgangskoder. NVIDIA advarer om at nøyaktigheten kan forringes på tabeller som ligger langt utenfor treningsområdene, eller når spørringsrader kommer fra en annen fordeling enn kontekstradene, og anbefaler å validere nøyaktighet og kalibrering på hold‑out‑data før utrulling.
Pakken structured-data-models er GPU‑native, krever Python 3.11 eller nyere og PyTorch 2.7 eller nyere, og anbefaler cudf for CUDA‑arbeidsbelastninger slik at dataframe‑operasjoner forblir på GPU‑en. Den inneholder referanseimplementasjoner av de tabulære grunnmodeller TabICLv2, KumoTabular og TabFM sammen med den relasjonelle modellen KumoRelational, og kode skrevet av NVIDIA i depotet er lisensiert under Apache 2.0.
NVIDIA sa at treningsoppskriften og de kunstige datageneratorene bak Kumo Tabular snart vil bli gjort tilgjengelige.












