AI RACE— Cuộc đua AI
Model mới

NVIDIA ra mắt Kumo Tabular: Mô hình nền tảng xử lý dữ liệu bảng vượt trội, không cần tinh chỉnh

NVIDIA phát hành Kumo Tabular, mô hình nền tảng mã nguồn mở chuyên xử lý dữ liệu dạng bảng với cơ chế học theo ngữ cảnh (in-context learning), cho kết quả phân loại và hồi quy tức thì mà không cần huấn luyện lại.

22:30 29/09/2026
Model mới

Đột phá mới cho dữ liệu bảng với Kumo Tabular từ NVIDIA

NVIDIA vừa chính thức công bố Kumo Tabular, dòng mô hình nền tảng (foundation model) mã nguồn mở dành riêng cho dữ liệu dạng bảng (tabular data), hiện đã có mặt trên Hugging Face và GitHub. Điểm đặc biệt của Kumo Tabular là khả năng dự đoán nhãn cho các hàng dữ liệu mới chỉ trong một lượt tính toán xuôi (single forward pass). Người dùng không cần huấn luyện lại mô hình, không cần tinh chỉnh siêu tham số (hyperparameter tuning) và không phải thực hiện các bước kỹ thuật trích chọn đặc trưng (feature engineering) phức tạp.

Mô hình hỗ trợ cả hai tác vụ phổ biến nhất trong phân tích dữ liệu là phân loại (classification) và hồi quy (regression). Được phát hành dưới giấy phép OpenMDW-1.1 cho phép ứng dụng thương mại, Kumo Tabular có 3 kích thước dao động từ 28 triệu đến 215 triệu tham số (gồm các bản Small, Medium và Large) và vận hành trực tiếp thông qua thư viện xử lý dữ liệu có cấu trúc tăng tốc bằng GPU của NVIDIA.

Kiến trúc Transformer tối ưu và phương pháp sinh dữ liệu nhân tạo

Khác với các giải pháp truyền thống phụ thuộc vào cây quyết định tăng cường độ dốc (gradient-boosted trees), Kumo Tabular ứng dụng kiến trúc Transformer kết hợp cơ chế học theo ngữ cảnh (in-context learning), tương tự cách các mô hình ngôn ngữ lớn (LLM) xử lý văn bản:

  • Biểu diễn ô và hàng dữ liệu: Giá trị số và danh mục được chuyển hóa qua các đặc trưng Fourier (Fourier features) với tần số học được, trong khi các giá trị bị khuyết (missing values) được xử lý trực tiếp mà không cần điền bù (imputation). Mô hình luân phiên sử dụng cơ chế chú ý theo cột (Column attention) với chi phí mở rộng tuyến tính theo số hàng và cơ chế chú ý theo hàng (Row attention) cùng 4 token nén [CLS]. Nhờ đó, giai đoạn tính toán phía sau không bị phụ thuộc vào số lượng cột của bảng.
  • Học theo ngữ cảnh (In-context Learning): Các hàng truy vấn (cần dự đoán) chỉ chú ý đến các hàng ngữ cảnh (đã có nhãn), giúp bộ nhớ đệm khóa/giá trị (KV cache) của ngữ cảnh có thể tái sử dụng cho nhiều lượt suy luận tiếp theo nhờ kỹ thuật Test-GQA. Đầu ra phân loại trả về xác suất lớp, còn tác vụ hồi quy cung cấp 999 phân vị giúp ước lượng điểm và độ bất định.
  • Cơ chế nhiệt độ thích ứng theo độ dài: Để giải quyết tình trạng cơ chế chú ý (attention) bị loãng khi kích thước bảng tăng từ vài trăm lên hàng chục nghìn dòng, Kumo Tabular tích hợp hệ số co giãn nhiệt độ tỷ lệ thuận với logarit của số khóa, giữ cho độ tập trung luôn sắc nét trên các bảng lớn.
  • Tiền huấn luyện hoàn toàn bằng dữ liệu nhân tạo: Kumo Tabular được huấn luyện 100% trên dữ liệu giả lập từ Mô hình Nhân quả Cấu trúc (Structural Causal Model - SCM). Trình sinh dữ liệu tự động tạo ra đồ thị nhân quả ngẫu nhiên, mô phỏng các lỗi thực tế như giá trị khuyết, nhiễu và phân phối đuôi nặng (heavy-tailed). Ba phiên bản Small, Medium và Large lần lượt được tiếp xúc với khoảng 35 triệu, 71 triệu và 137 triệu bảng nhân tạo qua 3 giai đoạn huấn luyện với độ dài ngữ cảnh mở rộng tối đa lên tới 60.000 hàng.

Dẫn đầu loạt bảng xếp hạng chuẩn và bước chuyển dịch trong học máy doanh nghiệp

Dữ liệu bảng là xương sống của các ứng dụng học máy trong doanh nghiệp, từ chấm điểm tín dụng, dự đoán khách hàng rời bỏ đến ước tính nhu cầu và định giá. Trong suốt hai thập kỷ qua, các mô hình gradient-boosted trees như XGBoost hay LightGBM thống trị lĩnh vực này nhưng đòi hỏi quy trình xây dựng lại từ đầu cho từng bài toán riêng biệt. Kumo Tabular đánh dấu bước chuyển đổi quan trọng khi đưa mô hình nền tảng vào dữ liệu có cấu trúc.

Trên bảng xếp hạng TabArena đối đầu với các mô hình cây được tinh chỉnh kỹ lưỡng, công cụ AutoGluon và các mô hình bảng tiên tiến nhất hiện nay, Kumo Tabular chiếm vị trí quán quân với hệ số ELO 1950. Khi thử nghiệm trên cùng một cấu hình phần cứng với GPU RTX 6000 Pro, mô hình đạt tốc độ xử lý nhanh gấp 17 lần so với đối thủ LimiX-2.

Kumo Tabular cũng thiết lập kỷ lục mới trên ba bộ benchmark tiêu chuẩn khác:

  • BeyondArena: Đứng đầu bảng với chỉ số ELO 1418 và điểm cải thiện (Improvability) đạt 7,78%.
  • TALENT: Giành vị trí tổng thể cao nhất ở cả ba tiêu chí: độ chính xác phân loại (hạng trung bình 6,67), log-loss phân loại (hạng 3,98) và sai số RMSE trong hồi quy (hạng 4,22).
  • ScoringBench: Thước đo phân phối dự đoán ghi nhận hai phiên bản Kumo Tabular-Large và Medium lần lượt chia nhau vị trí thứ nhất và thứ hai toàn bảng.

Hiện tại, mô hình tập trung xử lý dữ liệu dạng số và danh mục với tối đa 10 lớp trong một lượt suy luận duy nhất (thư viện đi kèm cung cấp mã sửa lỗi để mở rộng thêm số lớp). NVIDIA lưu ý các dạng dữ liệu như văn bản, hình ảnh hoặc dấu thời gian cần qua bước tiền xử lý chuẩn hóa thành đặc trưng trước khi đưa vào mô hình.

Tin liên quan