AI 모델 및 플랫폼

NVIDIA, 테이블 예측을 위한 Open Kumo Tabular 모델 출시

mm
Unite.AI를 Google의 선호 소스에 추가

NVIDIA는 2026년 9월 29일에 Kumo Tabular를 출시했으며, 이는 테이블 분류와 회귀를 위한 오픈 기반 모델로, 새로운 행의 레이블을 단일 순방향 패스로 예측하며 학습, 튜닝, 특성 엔지니어링이 필요하지 않습니다. 이 모델은 인공 데이터만으로 사전 학습되었으며, 2,800만에서 2억 1,500만 파라미터에 이르는 세 가지 크기로 제공됩니다.

Kumo Tabular는 NVIDIA Kumo Structured 모델 컬렉션의 일부이며, Hugging Face 블로그의 발표에 따라 제공합니다. 가중치는 모델의 Hugging Face 목록에서 OpenMDW 1.1 라이선스 하에 제공되며, NVIDIA는 이 라이선스가 상업적 사용을 허용한다고 밝혔습니다. 추론은 오픈 소스 structured-data-models 라이브러리를 통해 수행되며, 이 라이브러리는 최초 사용 시 가중치를 다운로드하고 NVIDIA 평가에 사용된 전처리, 앙상블 및 다중 클래스 처리를 제공합니다.

NVIDIA는 이번 출시를 기업 테이블 작업이 지난 20년 동안 이탈, 채무불이행, 수요, 가격 예측과 같은 과제에서 그래디언트 부스팅 트리를 사용해 왔으며, 새로운 질문마다 레이블링, 특성 엔지니어링, 튜닝, 검증, 배포의 자체 사이클이 필요했던 상황에 대비한다고 설명합니다. 회사는 이 모델이 대형 언어 모델의 인컨텍스트 학습 패턴을 테이블에 적용하여, 레이블이 지정된 테이블을 컨텍스트로 읽고 새로운 행의 레이블을 직접 예측한다고 밝혔습니다.

아키텍처 및 인컨텍스트 예측

Kumo Tabular는 테이블 구조를 중심으로 구축된 Transformer이며, TabICL 및 TabPFN에서 소개된 열, 행, 인컨텍스트 어텐션을 사용합니다. 레이블을 예측하기 위해 모델은 각 값이 해당 열에서 의미하는 바, 행의 열들이 어떻게 상호 작용하는지, 그리고 레이블이 지정된 컨텍스트 행이 레이블이 알려지지 않은 쿼리 행과 어떻게 연관되는지를 파악합니다.

셀 임베딩 단계에서는 여러 셀들이 하나의 토큰으로 변환됩니다. 숫자형 및 범주형 값은 학습된 주파수의 푸리에 특징, 사인 및 코사인을 통과하며, 각 유형마다 별도의 가중치를 가집니다. 결측값은 특수하게 처리되어 별도의 보간이 필요 없으며, 컨텍스트 내 모든 토큰은 레이블 임베딩을 받습니다. 이후 각 행은 교차 열 어텐션을 통해 임베딩으로 압축되는데, 이는 행 수에 비례하여 비용이 선형적으로 증가하는 유도된 자체 어텐션이며, 행 어텐션은 행의 특성이 어떻게 상호 작용하는지를 학습하고, 회전 위치 정보를 사용해 열을 구분합니다. 네 개의 학습 가능한 CLS 토큰이 각 행에 추가되어 최종 출력 역할을 수행합니다.

최종 Transformer가 행 임베딩에 작용합니다. 컨텍스트 행들은 서로 어텐션을 주고, 쿼리 행은 오직 컨텍스트 행에만 어텐션을 주어, 각 예측이 컨텍스트와 해당 행 자체에만 의존하도록 합니다. 컨텍스트의 키와 값은 한 번 계산된 뒤 이후 예측에 재사용됩니다. 쿼리 행은 Test-GQA를 사용하여 각 예측이 읽는 캐시를 축소합니다. 길이 인식 어텐션 온도는 키 수의 로그에 비례하여 증가하는 계수로 각 쿼리를 스케일링하며, 각 헤드에 대해 별도로 학습된 계수를 사용해 추론 테이블이 일반 훈련 테이블보다 훨씬 길어도 어텐션이 날카롭게 유지됩니다. 각 헤드는 분류를 위한 클래스 확률 또는 회귀를 위한 999개의 분위수를 출력하여 점 예측과 불확실성 추정치를 제공합니다.

인공 테이블에 대한 사전 학습

각 훈련 테이블은 구조적 인과 모델에서 6단계로 샘플링됩니다. 생성기는 전체 테이블에 대한 구성을 추출한 뒤, 숨겨진 변수를 무작위 인과 그래프로 연결하는데, 이 그래프는 루트에서 리프로 평가되며 각 노드에서 무작위로 선택된 함수(선형 변환, 소규모 신경망, 트리, 가우시안 프로세스 등)를 사용합니다. 일부 노드는 숫자형 또는 범주형 열이 되고, 하나는 목표 열이 되며, 나머지는 실제 데이터 뒤에 측정되지 않은 원인처럼 숨겨진 상태로 남습니다. 후처리 단계에서는 열 그룹을 상관관계 분석하고, 이상치를 클리핑하며, 결측값을 삽입하고, 학습 가능한 신호가 없는 테이블은 트리 앙상블 검사를 통해 제외합니다.

NVIDIA는 실제 테이블의 불완전성을 생성기에 반영했다고 밝혔습니다: 값이 여러 패턴으로 누락되고, 일부 특성은 조정되어 중복 행이 레이블에 대해 서로 다를 수 있게 하며, 일부 범주형 열은 많은 레벨을 가지고, 회귀 목표는 헤비테일을 가질 수 있습니다. 훈련은 분류에 교차 엔트로피 손실을, 회귀에 분위수 손실을 사용하며, 두 작업은 별개의 모델로 학습되고, 세 단계로 진행됩니다: 1,024행 및 최대 100열의 테이블, 400~10,240행의 컨텍스트, 최종적으로 최대 60,000행의 컨텍스트. Small, Medium, Large 변형은 각각 약 3,500만, 7,100만, 1억 3,700만 개의 인공 테이블을 사용했습니다.

NVIDIA가 보고한 벤치마크 결과

NVIDIA는 세 가지 크기를 기본 설정으로 전체 TabArena 리더보드(튜닝된 그래디언트 부스팅 트리, AutoGluon, 최신 테이블 기반 모델 포함)와 비교 실험했으며, Kumo Tabular가 전체 1위에 올랐고 ELO 1950을 기록했으며, 단일 RTX 6000 Pro 환경에서 LimiX-2보다 26배 빠르게 실행됐다고 보고했습니다. 회사는 이 세 크기가 정확도-효율성 파레토 프런트에서 새로운 최첨단을 구축했다고 밝혔습니다.

BeyondArena에서 NVIDIA는 ELO 1418과 7.78%의 개선 가능성 점수를 기록했으며, 해당 리더보드에서 1위를 차지했다고 보고했습니다. TALENT에서는 분류 정확도, 분류 로그 손실, 회귀 RMSE 전반에 걸쳐 최고 종합 순위를 기록했으며, 평균 순위는 각각 6.67, 3.98, 4.22였습니다. 예측 분포를 위한 벤치마크인 ScoringBench에서 NVIDIA는 Kumo Tabular-Large와 Kumo Tabular-Medium이 평균 순위에서 각각 1위와 2위를 차지했다고 밝혔습니다.

제한 사항 및 제공 여부

Kumo Tabular는 수치형 및 범주형 열에만 적용되며, 텍스트, 이미지 또는 타임스탬프는 내장 전처리 레시피를 통해 특징으로 변환할 수 있습니다. 단일 전방 패스는 최대 10개의 클래스를 다루며, 라이브러리는 오류 정정 출력 코드를 사용하여 모델을 任意의 클래스 수로 확장합니다. NVIDIA는 학습 범위를 크게 벗어난 테이블이나 쿼리 행이 컨텍스트 행과 다른 분포에서 온 경우 정확도가 저하될 수 있음을 경고하고, 배포 전에 보류 데이터에 대해 정확도와 보정성을 검증할 것을 권고합니다.

structured-data-models 패키지는 GPU 네이티브이며 Python 3.11 이상 및 PyTorch 2.7 이상을 필요로 하고, 데이터프레임 작업이 GPU에 머물도록 CUDA 작업에 cudf 사용을 권장합니다. 이 패키지는 TabICLv2, KumoTabular, TabFM 탭형 기반 모델과 관계형 모델인 KumoRelational의 참고 구현을 포함하고 있으며, 저장소에 있는 NVIDIA가 작성한 코드는 Apache 2.0 라이선스로 제공됩니다.

NVIDIA는 Kumo Tabular 뒤에 있는 학습 레시피와 인공 데이터 생성기가 곧 공개될 것이라고 밝혔습니다.

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.