AI-modeller och plattformar

NVIDIA lanserar öppen Kumo Tabular-modell för tabellprediktion

mm
Lägg till Unite.AI bland dina föredragna källor på Google

NVIDIA släppte den 29 september 2026 Kumo Tabular, en öppen grundmodell för tabellklassificering och regression som förutsäger etiketter för nya rader i ett enda framåtriktat pass, utan någon träning, finjustering eller funktionsteknik. Modellen förtränades helt på artificiella data och finns i tre storlekar som sträcker sig från 28 miljoner till 215 miljoner parametrar.

Kumo Tabular är en del av NVIDIA Kumo Structured-modellkollektionen, enligt annonsen på Hugging Face’s blogg. Vikter finns tillgängliga från modellens Hugging Face-listning under OpenMDW 1.1-licensen, vilket NVIDIA säger tillåter kommersiell användning, och inferens körs via det öppna källkods-biblioteket structured-data-models, som laddar ner vikterna vid första användning och tillhandahåller förbehandling, sammanslagning och hantering av många klasser som används i NVIDIAs utvärderingar.

NVIDIA placerar lanseringen i ett sammanhang av två decennier där företagsinriktade tabelluppgifter såsom churn, kreditförluster, efterfrågan och prisprognoser har förlitat sig på gradientförstärkta träd, där varje ny fråga kräver sin egen cykel av märkning, funktionsteknik, finjustering, validering och distribution. Företaget säger att modellen tillämpar in-context‑inlärningsmönstret från stora språkmodeller på tabeller, genom att läsa en märkt tabell som kontext för att direkt förutsäga etiketter för nya rader.

Arkitektur och in-context‑prediktion

Kumo Tabular är en Transformer byggd kring strukturen i en tabell, som använder kolumn‑, rad‑ och in-context‑attention enligt TabICL och TabPFN. För att förutsäga en etikett fastställer modellen vad varje värde betyder inom sin kolumn, hur en rads kolumner interagerar och hur de märkta kontextraderna förhåller sig till frågerader vars etiketter är okända.

I cell‑inbäddningsstadiet blir en grupp celler ett token. Numeriska och kategoriska värden passerar genom Fourier‑funktioner, sinus‑ och cosinusvärden av inlärda frekvenser, med separata vikter för varje typ. Saknade värden behandlas särskilt och kräver ingen imputering, och varje token i kontexten får en etikett‑inbäddning. Varje rad komprimeras sedan till en inbäddning genom alternerande kolumn‑attention, en inducerad själv‑attention vars kostnad växer linjärt med antalet rader, med rad‑attention som lär sig hur en rads funktioner interagerar, med roterande positioner för att särskilja kolumner. Fyra lärbara CLS‑token förenas med varje rad och fungerar som dess slutliga avläsning.

En sista Transformer arbetar på rad‑inbäddningarna. Kontextrader uppmärksammar varandra medan frågerader endast uppmärksammar kontextrader, så varje prediktion beror endast på kontexten och raden själv, och kontextens nycklar och värden beräknas en gång och återanvänds för senare prediktioner. Frågerader använder Test‑GQA, som minskar cachen som varje prediktion läser. En längd‑medveten attention‑temperatur skalar varje fråga med en faktor som växer med logaritmen av antalet nycklar, med en koefficient som lärs separat för varje huvud, vilket håller attention skarp när en inferenstabell är mycket längre än en typisk tränings‑tabell. Ett huvud producerar klass‑sannolikheter för klassificering eller 999 kvantiler för regression, vilket ger en punkt‑prediktion och en osäkerhetsuppskattning.

Förtränning på artificiella tabeller

Varje tränings‑tabell samplas från en strukturell kausal modell i sex steg. Generatorn drar en konfiguration för hela tabellen och länkar sedan dolda variabler med ett slumpmässigt kausalt graf som evalueras från rot till blad med slumpmässigt valda funktioner vid varje nod, inklusive linjära avbildningar, små neurala nätverk, träd och Gaussiska processer. Vissa noder blir numeriska eller kategoriska kolumner, en blir målet och resten förblir dolda, som de omätbara orsakerna bakom verkliga data. Efterbehandling korrelerar grupper av kolumner, klipper bort outliers och injicerar saknade värden, och en träd‑ensemble‑kontroll förkastar alla tabeller utan en lärbar signal.

NVIDIA säger att de byggde in bristerna i verkliga tabeller i generatorn: värden saknas i flera mönster, vissa egenskaper grovslas så att dubblett‑rader kan ha olika etikett, vissa kategoriska kolumner har många nivåer, och regressionsmål kan ha tunga svansar. Träning använder en tvär‑entropi‑förlust för klassificering och en kvantil‑förlust för regression, där de två uppgifterna tränas som separata modeller, och sker i tre steg: tabeller med 1 024 rader och upp till 100 kolumner, kontexter som varierar från 400 till 10 240 rader, och slutligen kontexter på upp till 60 000 rader. De små, medelstora och stora varianterna såg cirka 35 miljoner, 71 miljoner respektive 137 miljoner artificiella tabeller.

NVIDIAs rapporterade benchmarkresultat

NVIDIA rapporterar att de körde alla tre storlekar med standardinställningar mot hela TabArena‑topplistan, som omfattar finjusterade gradientförstärkta träd, AutoGluon och de senaste tabulära grundmodellerna, och att Kumo Tabular ligger först totalt med en ELO på 1950 samtidigt som den är 26 gånger snabbare än LimiX-2 under en enhetlig enkel RTX 6000 Pro‑utvärderingsuppsättning. Företaget sade att de tre storlekarna etablerar en ny toppstandard på Pareto‑fronten för noggrannhet‑effektivitet.

På BeyondArena rapporterar NVIDIA en ELO på 1418 och ett förbättringspoäng på 7,78 %, vilket placerar dem först på den topplistan. På TALENT rapporterar företaget den högsta totala rankingen för klassificeringsnoggrannhet, klassificeringslogg‑förlust och regressions‑RMSE, med genomsnittliga rankningar på 6,67, 3,98 respektive 4,22. På ScoringBench, ett benchmark för prediktiva fördelningar, sade NVIDIA att Kumo Tabular-Large och Kumo Tabular-Medium rankas först respektive andra i genomsnittlig rankning.

Begränsningar och tillgänglighet

Kumo Tabular fungerar endast på numeriska och kategoriska kolumner; text, bilder eller tidsstämplar kan omvandlas till funktioner via inbyggda förbehandlingsrecept. Ett enda framåtpas täcker upp till 10 klasser, och biblioteket utökar modellen till ett godtyckligt antal klasser med felkorrigerande utgångskoder. NVIDIA varnar för att noggrannheten kan försämras på tabeller som ligger långt utanför träningsintervallen eller när frågerader kommer från en annan fördelning än kontextraderna, och de rekommenderar att validera noggrannhet och kalibrering på håll‑ut‑data innan driftsättning.

Paketet structured-data-models är GPU‑native, kräver Python 3.11 eller senare samt PyTorch 2.7 eller senare, och rekommenderar cudf för CUDA‑arbetsbelastningar så att dataframe‑operationer förblir på GPU:n. Det innehåller referensimplementationer av de tabulära grundmodellerna TabICLv2, KumoTabular och TabFM samt den relationella modellen KumoRelational, och NVIDIA‑skriven kod i förrådet är licensierad under Apache 2.0.

NVIDIA meddelade att träningsreceptet och de artificiella datageneratorerna bakom Kumo Tabular snart kommer att släppas.

Jonas Reeve är en AI‑genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.