Mô hình và nền tảng AI

NVIDIA Ra Mắt Mô Hình Kumo Tabular Mở cho Dự Đoán Dữ Liệu Bảng

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vào ngày 29 tháng 9 năm 2026, NVIDIA đã phát hành Kumo Tabular, một mô hình nền tảng mở cho việc phân loại và hồi quy trên dữ liệu bảng, dự đoán nhãn của các hàng mới trong một lần truyền tiến duy nhất, mà không cần đào tạo, tinh chỉnh hoặc kỹ thuật tạo đặc trưng. Mô hình này được tiền huấn luyện hoàn toàn trên dữ liệu nhân tạo và có ba kích thước, dao động từ 28 triệu đến 215 triệu tham số.

Kumo Tabular là một phần của bộ sưu tập mô hình NVIDIA Kumo Structured, theo thông báo trên blog của Hugging Face. Các trọng số có sẵn từ bản liệt kê mô hình trên Hugging Face dưới giấy phép OpenMDW 1.1, mà NVIDIA cho biết cho phép sử dụng thương mại, và việc suy luận được thực hiện qua thư viện structured-data-models mã nguồn mở, thư viện này tải trọng số lần đầu sử dụng và cung cấp các bước tiền xử lý, kết hợp mô hình, và xử lý đa lớp được sử dụng trong các đánh giá của NVIDIA.

NVIDIA đặt việc phát hành này trong bối cảnh hai thập kỷ mà các nhiệm vụ dữ liệu bảng doanh nghiệp như dự đoán churn, vỡ nợ, nhu cầu và giá đã dựa vào cây tăng cường gradient, mỗi câu hỏi mới đòi hỏi một chu kỳ riêng biệt gồm gán nhãn, tạo đặc trưng, tinh chỉnh, xác thực và triển khai. Công ty cho biết mô hình áp dụng mô hình học trong ngữ cảnh của các mô hình ngôn ngữ lớn vào các bảng, đọc một bảng đã gán nhãn làm ngữ cảnh để dự đoán trực tiếp nhãn của các hàng mới.

Kiến Trúc và Dự Đoán Trong Ngữ Cảnh

Kumo Tabular là một Transformer được xây dựng quanh cấu trúc của một bảng, sử dụng cơ chế chú ý theo cột, hàng và trong ngữ cảnh như đã được giới thiệu trong TabICL và TabPFN. Để dự đoán một nhãn, mô hình xác định ý nghĩa của mỗi giá trị trong cột của nó, cách các cột của một hàng tương tác, và cách các hàng ngữ cảnh đã gán nhãn liên quan đến các hàng truy vấn mà nhãn chưa biết.

Trong giai đoạn nhúng ô, một nhóm các ô trở thành một token. Các giá trị số và phân loại đi qua các đặc trưng Fourier, sin và cos của các tần số đã học, với trọng số riêng cho mỗi loại. Các giá trị thiếu được xử lý đặc biệt và không cần bù trừ, và mỗi token trong ngữ cảnh nhận được một embedding nhãn. Sau đó, mỗi hàng được nén thành một embedding bằng cách luân phiên chú ý theo cột, một cơ chế tự chú ý được tạo ra mà chi phí tăng tuyến tính với số hàng, với chú ý hàng học cách các đặc trưng của hàng tương tác, sử dụng vị trí quay để phân biệt các cột. Bốn token CLS có khả năng học được gắn vào mỗi hàng và hoạt động như đầu ra cuối cùng của nó.

Một Transformer cuối cùng hoạt động trên các embedding của hàng. Các hàng ngữ cảnh chú ý lẫn nhau trong khi các hàng truy vấn chỉ chú ý đến các hàng ngữ cảnh, vì vậy mỗi dự đoán chỉ phụ thuộc vào ngữ cảnh và chính hàng đó, và các khóa và giá trị của ngữ cảnh được tính một lần và tái sử dụng cho các dự đoán sau. Các hàng truy vấn sử dụng Test-GQA, công cụ này thu nhỏ bộ nhớ đệm mà mỗi dự đoán đọc. Nhiệt độ chú ý có độ nhận thức độ dài điều chỉnh mỗi truy vấn bằng một hệ số tăng theo logarit của số khóa, với hệ số được học riêng cho mỗi đầu, giữ cho chú ý sắc nét khi bảng suy luận dài hơn nhiều so với bảng đào tạo tiêu chuẩn. Một đầu ra các xác suất lớp cho phân loại hoặc 999 quantile cho hồi quy, cung cấp một dự đoán điểm và ước lượng độ không chắc chắn.

Tiền Huấn Luyện trên Các Bảng Nhân Tạo

Mỗi bảng đào tạo được lấy mẫu từ một Mô Hình Nhân Quả Cấu Trúc qua sáu bước. Trình tạo rút ra một cấu hình cho toàn bộ bảng, sau đó liên kết các biến ẩn bằng một đồ thị nhân quả ngẫu nhiên được đánh giá từ gốc tới lá sử dụng các hàm được rút ngẫu nhiên tại mỗi nút, bao gồm các ánh xạ tuyến tính, mạng nơ-ron nhỏ, cây và quá trình Gaussian. Một số nút trở thành các cột số hoặc phân loại, một nút trở thành mục tiêu, và phần còn lại giữ ẩn, giống như các nguyên nhân không đo được phía sau dữ liệu thực. Giai đoạn hậu xử lý liên kết các nhóm cột, cắt các giá trị ngoại lệ và chèn các giá trị thiếu, và một kiểm tra cây-ensemble loại bỏ bất kỳ bảng nào không có tín hiệu có thể học được.

NVIDIA cho biết họ đã đưa những khiếm khuyết của các bảng thực vào trình tạo: các giá trị bị thiếu theo nhiều mẫu, một số đặc trưng bị làm thô để các hàng trùng lặp có thể không đồng nhất về nhãn, một số cột phân loại có nhiều mức, và các mục tiêu hồi quy có thể có đuôi nặng. Quá trình đào tạo sử dụng hàm mất mát cross-entropy cho phân loại và hàm mất mát quantile cho hồi quy, với hai nhiệm vụ được huấn luyện như các mô hình riêng biệt, và diễn ra trong ba giai đoạn: bảng có 1.024 hàng và tối đa 100 cột, ngữ cảnh thay đổi từ 400 đến 10.240 hàng, và cuối cùng là ngữ cảnh lên tới 60.000 hàng. Các biến thể Small, Medium và Large lần lượt đã thấy khoảng 35 triệu, 71 triệu và 137 triệu bảng nhân tạo.

Kết Quả Đánh Giá Tiêu Chuẩn Được NVIDIA Báo Cáo

NVIDIA báo cáo rằng họ đã chạy ba kích thước với cài đặt mặc định trên bảng xếp hạng đầy đủ của TabArena, bao gồm các cây tăng cường gradient đã được tinh chỉnh, AutoGluon và các mô hình nền tảng dữ liệu bảng gần đây, và Kumo Tabular đạt vị trí số một tổng thể với ELO 1950 trong khi chạy nhanh gấp 26 lần so với LimiX-2 dưới một cấu hình đánh giá đồng nhất sử dụng một RTX 6000 Pro. Công ty cho biết ba kích thước này thiết lập một mức độ tiên tiến mới trên đường biên Pareto về độ chính xác – hiệu suất.

Trên BeyondArena, NVIDIA báo cáo ELO là 1418 và điểm Improvability là 7,78%, đứng đầu bảng xếp hạng đó. Trên TALENT, công ty báo cáo vị trí xếp hạng tổng thể cao nhất trên các tiêu chí độ chính xác phân loại, log-loss phân loại và RMSE hồi quy, với các thứ hạng trung bình lần lượt là 6,67, 3,98 và 4,22. Trên ScoringBench, một bộ chuẩn cho các phân phối dự đoán, NVIDIA cho biết Kumo Tabular-Large và Kumo Tabular-Medium đạt vị trí thứ nhất và thứ hai về thứ hạng trung bình.

Hạn chế và khả dụng

Kumo Tabular chỉ hoạt động trên các cột số và phân loại; văn bản, hình ảnh hoặc dấu thời gian có thể được chuyển thành các đặc trưng thông qua các công thức tiền xử lý tích hợp. Một lần truyền tiến duy nhất có thể bao phủ tới 10 lớp, và thư viện mở rộng mô hình cho bất kỳ số lượng lớp nào bằng các mã đầu ra sửa lỗi. NVIDIA cảnh báo rằng độ chính xác có thể giảm trên các bảng vượt xa phạm vi đào tạo hoặc khi các hàng truy vấn đến từ phân phối khác so với các hàng ngữ cảnh, và khuyến nghị kiểm chứng độ chính xác và hiệu chuẩn trên dữ liệu giữ lại trước khi triển khai.

Gói structured-data-models được thiết kế bản địa cho GPU, yêu cầu Python 3.11 trở lên và PyTorch 2.7 trở lên, và khuyến nghị sử dụng cudf cho các tải công việc CUDA để các thao tác dataframe vẫn diễn ra trên GPU. Nó chứa các triển khai tham chiếu của các mô hình nền tảng bảng TabICLv2, KumoTabular và TabFM cùng với mô hình quan hệ KumoRelational, và mã do NVIDIA viết trong kho lưu trữ được cấp phép theo Apache 2.0.

NVIDIA cho biết công thức đào tạo và các bộ tạo dữ liệu nhân tạo phía sau Kumo Tabular sẽ sớm được phát hành.

Jonas Reeve là một nhà phân tích được tạo ra bằng AI tại Unite.AI, tập trung vào AI nhận thức, trí tuệ nhân tạo chung (AGI), và các nền tảng lý thuyết của trí thông minh máy móc. Công việc của ông khám phá cách mà học tập, suy luận, trí nhớ và trừu tượng xuất hiện trong cả hệ thống sinh học và nhân tạo, tạo ra các mối liên kết giữa kiến trúc AI hiện đại và những câu hỏi lâu đời trong khoa học nhận thức và triết học tâm trí.

Với cách tiếp cận khái niệm và suy ngẫm, Jonas xem xét các khung như mô hình suy luận, hệ thống đại lý, nhận thức nổi lên, và lý thuyết cân chỉnh, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì — và không phải là gì. Thay vì chạy theo các thời gian biểu hay sự thổi phồng, ông nhấn mạnh các nguyên tắc nền tảng, tính chặt chẽ khái niệm, và giới hạn của các mô hình hiện tại.

Các bài viết do Jonas Reeve viết được tạo ra bằng AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo độ chính xác, rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.