Modele i platformy AI
NVIDIA udostępnia otwarty model Kumo Tabular do predykcji tabelarycznych

NVIDIA 29 września 2026 r. wydała Kumo Tabular, otwarty model podstawowy do klasyfikacji i regresji tabelarycznych, który przewiduje etykiety nowych wierszy w jednym przejściu w przód, bez potrzeby treningu, strojenia ani inżynierii cech. Model został wstępnie wytrenowany wyłącznie na sztucznych danych i dostępny jest w trzech rozmiarach, od 28 milionów do 215 milionów parametrów.
Kumo Tabular jest częścią kolekcji modeli NVIDIA Kumo Structured, zgodnie z ogłoszeniem na blogu Hugging Face. Wagi są dostępne w liście modelu na Hugging Face na licencji OpenMDW 1.1, którą NVIDIA twierdzi, że zezwala na komercyjne wykorzystanie, a wnioskowanie odbywa się za pośrednictwem otwarto‑źródłowej biblioteki structured-data-models, która przy pierwszym użyciu pobiera wagi i zapewnia przetwarzanie wstępne, zespołowanie oraz obsługę wielu klas wykorzystywaną w ocenach NVIDIA.
NVIDIA umiejscawia to wydanie w kontekście dwóch dekad, w których zadania tabelaryczne w przedsiębiorstwach, takie jak prognozowanie churnu, niewypłacalności, popytu i cen, opierały się na drzewach gradientowo‑wzmacnianych, przy czym każde nowe pytanie wymagało własnego cyklu etykietowania, inżynierii cech, strojenia, walidacji i wdrożenia. Firma twierdzi, że model stosuje wzorzec uczenia w kontekście, znany z dużych modeli językowych, do tabel, odczytując oznaczoną tabelę jako kontekst, aby bezpośrednio przewidywać etykiety nowych wierszy.
Architektura i predykcja w kontekście
Kumo Tabular jest transformatorem opartym na strukturze tabeli, wykorzystującym uwagę na kolumny, wiersze oraz w kontekście, jak przedstawiono w TabICL i TabPFN. Aby przewidzieć etykietę, model określa, co oznacza każda wartość w swojej kolumnie, jak kolumny wiersza współdziałają oraz jak oznaczone wiersze kontekstowe odnoszą się do wierszy zapytań, których etykiety są nieznane.
W etapie osadzania komórek grupa komórek zamienia się w token. Wartości liczbowe i kategoryczne przechodzą przez cechy Fouriera, sinusy i cosinusy wyuczonych częstotliwości, przy użyciu oddzielnych wag dla każdego typu. Brakujące wartości są traktowane specjalnie i nie wymagają imputacji, a każdy token w kontekście otrzymuje osadzenie etykiety. Następnie każdy wiersz jest kompresowany do wektora przy pomocy naprzemiennej uwagi kolumnowej, indukowanej samouwagi, której koszt rośnie liniowo wraz z liczbą wierszy, z uwagą wierszową uczącą się, jak cechy wiersza współdziałają, wykorzystując rotacyjne pozycje do odróżniania kolumn. Cztery uczące się tokeny CLS dołączają się do każdego wiersza i pełnią funkcję jego ostatecznego odczytu.
Końcowy transformator działa na osadzeniach wierszy. Wiersze kontekstowe zwracają uwagę na siebie nawzajem, podczas gdy wiersze zapytań zwracają uwagę wyłącznie na wiersze kontekstowe, tak że każda predykcja zależy tylko od kontekstu i samego wiersza, a klucze i wartości kontekstu są obliczane raz i ponownie wykorzystywane w kolejnych predykcjach. Wiersze zapytań używają Test‑GQA, które zmniejsza pamięć podręczną odczytywaną przy każdej predykcji. Temperatura uwagi zależna od długości skaluje każde zapytanie o czynnik rosnący wraz z logarytmem liczby kluczy, przy współczynniku uczonym osobno dla każdej głowy, utrzymując ostrość uwagi, gdy tabela inferencyjna jest znacznie dłuższa niż typowa tabela treningowa. Głowa wyjściowa generuje prawdopodobieństwa klas dla klasyfikacji lub 999 kwantyli dla regresji, dostarczając prognozę punktową oraz oszacowanie niepewności.
Wstępne uczenie na sztucznych tabelach
Każda tabela treningowa jest losowana z modelu przyczynowego strukturalnego w sześciu krokach. Generator tworzy konfigurację całej tabeli, a następnie łączy ukryte zmienne przy pomocy losowego grafu przyczynowego ocenianego od korzenia do liścia, używając losowo wybranych funkcji w każdym węźle, w tym map liniowych, małych sieci neuronowych, drzew i procesów Gaussa. Niektóre węzły stają się kolumnami liczbowymi lub kategorycznymi, jeden staje się zmienną docelową, a pozostałe pozostają ukryte, jak niezmierzone przyczyny rzeczywistych danych. Post‑processing koreluje grupy kolumn, odcina wartości odstające i wstrzykuje brakujące wartości, a kontrola zespołu drzew odrzuca każdą tabelę bez uczącego się sygnału.
NVIDIA poinformowała, że wbudowała niedoskonałości rzeczywistych tabel w generator: wartości znikają w kilku wzorcach, niektóre cechy są spłaszczane, tak aby duplikowane wiersze mogły mieć różne etykiety, niektóre kolumny kategoryczne mają wiele poziomów, a cele regresji mogą mieć ciężkie ogony. Trening wykorzystuje funkcję straty krzyżowej entropii dla klasyfikacji oraz stratę kwantylową dla regresji, przy czym oba zadania są trenowane jako oddzielne modele, i odbywa się w trzech etapach: tabele o 1 024 wierszach i maksymalnie 100 kolumnach, konteksty od 400 do 10 240 wierszy oraz ostatecznie konteksty do 60 000 wierszy. Warianty Small, Medium i Large przetworzyły odpowiednio około 35 milionów, 71 milionów i 137 milionów sztucznych tabel.
Zgłoszone wyniki benchmarków NVIDIA
NVIDIA podaje, że uruchomiła wszystkie trzy rozmiary z ustawieniami domyślnymi przeciwko pełnej liście rankingowej TabArena, obejmującej strojenie drzew gradientowo‑wzmacnianych, AutoGluon oraz najnowsze modele podstawowe dla danych tabelarycznych, i że Kumo Tabular zajmuje pierwsze miejsce ogólnie z wynikiem ELO = 1950, działając 26‑krotnie szybciej niż LimiX‑2 przy jednolitym zestawie oceny na pojedynczym RTX 6000 Pro. Firma stwierdziła, że trzy rozmiary ustanawiają nowy stan sztuki na frontzie Pareto dokładność‑wydajność.
Na BeyondArena NVIDIA podaje wynik ELO 1418 oraz wskaźnik poprawialności 7,78 %, zajmując pierwsze miejsce w tym rankingu. Na TALENT firma informuje o najwyższej łącznej pozycji w zakresie dokładności klasyfikacji, log‑loss klasyfikacji i RMSE regresji, ze średnimi pozycjami odpowiednio 6,67, 3,98 i 4,22. Na ScoringBench, benchmarku dla rozkładów predykcyjnych, NVIDIA stwierdziła, że Kumo Tabular‑Large i Kumo Tabular‑Medium zajmują pierwsze i drugie miejsce pod względem średniej pozycji.
Ograniczenia i dostępność
Kumo Tabular działa wyłącznie na kolumnach numerycznych i kategorycznych; tekst, obrazy lub znaczniki czasu mogą być przekształcane w cechy za pomocą wbudowanych przepisów wstępnego przetwarzania. Jeden przebieg w przód obsługuje do 10 klas, a biblioteka rozszerza model na dowolną liczbę klas przy użyciu kodów wyjściowych korygujących błędy. NVIDIA ostrzega, że dokładność może spadać w przypadku tabel znacznie wykraczających poza zakresy treningowe lub gdy wiersze zapytań pochodzą z innego rozkładu niż wiersze kontekstowe, i zaleca weryfikację dokładności oraz kalibracji na odrębnych danych przed wdrożeniem.
Pakiet structured-data-models jest natywny dla GPU, wymaga Pythona 3.11 lub nowszego oraz PyTorch 2.7 lub nowszego, a także zaleca użycie cudf w obciążeniach CUDA, aby operacje na dataframach pozostawały na GPU. Zawiera referencyjne implementacje modeli podstawowych dla danych tabelarycznych TabICLv2, KumoTabular i TabFM oraz modelu relacyjnego KumoRelational, a kod autorstwa NVIDIA w repozytorium jest udostępniony na licencji Apache 2.0.
NVIDIA poinformowała, że przepis treningowy oraz generatory danych sztucznych stojące za Kumo Tabular zostaną wkrótce udostępnione.












