NVIDIA lanza Kumo Tabular, un modelo fundacional abierto para datos tabulares
NVIDIA ha presentado Kumo Tabular, una familia de modelos fundacionales tabulares abiertos entrenados en su totalidad con datos sintéticos que ofrece predicciones instantáneas sin necesidad de ajuste manual.
NVIDIA presenta Kumo Tabular, un modelo fundacional tabular abierto
Investigadores de NVIDIA anunciaron el lanzamiento de NVIDIA Kumo Tabular, un modelo fundacional abierto diseñado para tareas de clasificación y regresión en datos tabulares. Como parte de la colección NVIDIA Kumo Structured, el modelo predice etiquetas para nuevas filas en un solo forward pass sin requerir ingeniería manual de características, búsqueda de hiperparámetros ni entrenamiento específico para cada tarea.
Kumo Tabular se presenta en tres tamaños que van desde los 28 millones hasta los 215 millones de parámetros y se publica junto con una biblioteca de código abierto bajo la licencia OpenMDW-1.1 para uso comercial. Los pesos del modelo se encuentran disponibles en Hugging Face, mientras que el código base está alojado en GitHub dentro del repositorio de datos estructurados de NVIDIA.
Arquitectura, preentrenamiento sintético y resultados en benchmarks
Diseñado como un Transformer adaptado a estructuras tabulares, Kumo Tabular incorpora mecanismos de atención por columna, por fila y en contexto, basándose en conceptos de TabICL y TabPFN. El proceso comienza con el incrustado de celdas (cell embedding), donde grupos de celdas se transforman en tokens; los valores numéricos y categóricos pasan por características de Fourier con frecuencias aprendidas, y los valores faltantes se gestionan directamente sin requerir imputación previa. Las incrustaciones de fila alternan entre la atención por columna —que rastrea la distribución de características a lo largo de las columnas con un costo que escala de forma lineal según la cantidad de filas— y la atención por fila a través de las características mediante incrustaciones de posición rotatoria (rotary position embeddings) y cuatro tokens [CLS] aprendibles.
La etapa final se basa en el aprendizaje en contexto (in-context learning), donde las filas de contexto se atienden entre sí, pero las filas de consulta (query rows) atienden estrictamente a las de contexto a través de Test-GQA, lo que permite reutilizar claves y valores en caché para futuras predicciones. Para evitar la degradación de la atención en tablas de gran tamaño, el modelo introduce una temperatura de atención sensible a la longitud, escalando las consultas de forma logarítmica respecto al número de claves mediante coeficientes aprendidos específicos para cada cabezal. Los cabezales de regresión devuelven 999 cuantiles junto con estimaciones puntuales y medidas de incertidumbre.
Kumo Tabular fue entrenado exclusivamente con tablas sintéticas generadas procedimentalmente a partir de Modelos Causales Estructurales (SCM). Para reflejar las imperfecciones del mundo real, el muestreador procedimental inyecta patrones de valores ausentes, objetivos de regresión con colas pesadas, categorías de alta cardinalidad y características simplificadas. El entrenamiento se estructuró en tres fases: comenzó con 1.024 filas y hasta 100 columnas, se amplió a un rango de entre 400 y 10.240 filas, y finalmente se extendió hasta las 60.000 filas. En total, las variantes Small, Medium y Large procesaron aproximadamente 35 millones, 71 millones y 137 millones de tablas artificiales, respectivamente.
En las evaluaciones de rendimiento empíricas:
- TabArena: Kumo Tabular se posicionó en el primer lugar general con un ELO de 1950, resultando 17 veces más rápido que LimiX-2 en un entorno de evaluación ejecutado sobre una única NVIDIA RTX 6000 Pro.
- BeyondArena: Alcanzó el primer lugar con un ELO de 1418 y una puntuación de Improvability del 7,78 %.
- TALENT: El modelo logró la posición más alta en la clasificación global, registrando rangos promedio de 6,67 en precisión de clasificación, 3,98 en log-loss de clasificación y 4,22 en RMSE de regresión.
- ScoringBench: Las versiones Large y Medium ocuparon el primer y segundo lugar en rango promedio.
El modelo procesa de forma nativa entradas numéricas y categóricas para hasta 10 clases en un solo forward pass, mientras que la biblioteca para GPU de NVIDIA (sdm) recurre a códigos de salida con corrección de errores para ampliar el soporte a un número arbitrario de clases. NVIDIA señala que el rendimiento puede reducirse si las distribuciones de consulta difieren en gran medida de las filas de contexto o si quedan fuera de los rangos de entrenamiento.
Hacia un cambio en los flujos de trabajo tabulares empresariales con aprendizaje en contexto
Durante casi dos décadas, las tareas de predicción tabular en empresas —como la pérdida de clientes (churn), el fraude, la fijación de precios y el riesgo de impago— han dependido de árboles de decisión con gradient boosting y marcos de AutoML como AutoGluon. Aunque estos flujos tradicionales basados en árboles son efectivos, exigen entrenar modelos dedicados desde cero para cada problema y conjunto de características independiente.
Kumo Tabular traslada a los datos estructurados el paradigma de aprendizaje en contexto popularizado por los modelos de lenguaje de gran tamaño (LLM). Al procesar directamente ejemplos etiquetados existentes como contexto dentro del espacio del prompt, los modelos fundacionales tabulares buscan sustituir el ciclo de preprocesamiento manual de datos, la optimización de hiperparámetros y los canales de despliegue independientes por inferencias basadas en prompts en una sola ejecución hacia adelante.



