NVIDIA Kumo Tabular: nuevo referente en precisión y eficiencia para datos tabulares

Kumo Tabular es un modelo fundacional abierto diseñado para tareas de clasificación y regresión sobre tablas. Predice etiquetas de nuevas filas en una sola pasada, sin entrenamiento ni ajuste, y fue preentrenado con datos artificiales.

Por Redaccion TD
NVIDIA Kumo Tabular: nuevo referente en precisión y eficiencia para datos tabulares

Resumen ejecutivo

NVIDIA presenta Kumo Tabular, un modelo fundacional para datos tabulares disponible en Hugging Face y en código abierto. Diseñado para clasificación y regresión, Kumo Tabular puede leer una tabla con filas etiquetadas y devolver predicciones para nuevas filas en una sola pasada —sin necesidad de entrenar, ajustar hiperparámetros ni hacer ingeniería de características— y viene en tres tamaños (aproximadamente 28M a 215M parámetros). El modelo está liberado bajo la licencia OpenMDW-1.1 con uso comercial permitido y, según su publicación, lidera cuatro benchmarks relevantes: TabArena, BeyondArena, TALENT y ScoringBench.

Qué es Kumo Tabular y por qué importa

Los datos tabulares son la columna vertebral de la analítica empresarial: registros de clientes, transacciones, sensores, reclamos y órdenes viven en tablas. Tradicionalmente, los equipos usan modelos de árboles potenciados (gradient-boosted trees) que requieren ciclos de vida largos: etiquetado, ingeniería de variables, búsqueda de hiperparámetros y despliegue por cada nuevo problema.

Kumo Tabular cambia este flujo al aplicar ideas de aprendizaje en contexto (in-context learning) —popularizadas por los grandes modelos de lenguaje— al dominio tabular. Un modelo preentrenado en millones de tablas puede recibir unas filas de ejemplo como contexto y predecir etiquetas para filas nuevas sin actualizar pesos. Para equipos y responsables de negocio, esto puede significar prototipos más rápidos, menos esfuerzo en preparación de datos y evaluaciones iniciales ágiles antes de invertir en modelos específicos.

Cómo funciona (arquitectura a alto nivel)

Kumo Tabular es un Transformer adaptado a la estructura de las tablas, combinando atención por columna, por fila y atención en contexto. Sus componentes principales son:

  • Cell embedding: grupos de celdas son convertidos en tokens. Valores numéricos y categóricos pasan por funciones tipo Fourier (senos y cosenos con frecuencias aprendidas). Los valores faltantes se manejan explícitamente, sin necesidad de imputación previa. Además, las filas del contexto llevan un embedding de etiqueta.

  • Row embedding: las filas se comprimen alternando dos tipos de atención. La atención por columna examina una columna completa para aprender qué significa un valor dentro de la distribución de esa columna (por ejemplo, si el valor 42 es típico o atípico). Este mecanismo tiene costo lineal en el número de filas. La atención por fila modela las interacciones entre columnas dentro de la misma fila, usando posiciones rotatorias para distinguir columnas. Cuatro tokens [CLS] aprendibles por fila actúan como lectura final de la fila y permiten que la etapa posterior no dependa del número de columnas.

  • In-context learning: sobre las representaciones de fila opera un Transformer final donde las filas de contexto se atienden entre sí, y las filas de consulta atienden únicamente al contexto. Así, cada predicción depende sólo del contexto y de la fila consultada; el contexto no se ve afectado por las filas que se anotan después. Las claves y valores del contexto pueden cachearse y reutilizarse, acelerando predicciones sucesivas.

  • Salida y cuantificación de incertidumbre: para clasificación, se generan probabilidades de clase; para regresión, el modelo produce 999 cuantiles, a partir de los cuales se obtiene una predicción puntual y una estimación de incertidumbre.

  • Atención sensible a la longitud: Kumo Tabular ajusta la “temperatura” de atención en función del logaritmo del número de claves (con coeficiente aprendido por cabeza de atención), lo que mantiene la atención nítida incluso cuando las tablas en inferencia son mucho más largas que las vistas durante el preentrenamiento.

Entrenamiento con datos artificiales

Una particularidad importante es que Kumo Tabular fue preentrenado exclusivamente con tablas sintéticas generadas por un sampler procedural basado en Modelos Causales Estructurales (Structural Causal Models, SCM). El proceso descrito incluye:

  1. Muestreo de la configuración de la tabla (tamaño, tarea, mecanismo, patrones de missingness).
  2. Generación de un grafo causal aleatorio que conecta variables latentes, evaluado de raíz a hojas mediante funciones aleatorias (lineales, pequeñas redes neuronales, árboles, procesos gaussianos, etc.).
  3. Selección de algunas variables como columnas observables y una como objetivo; el resto permanece oculto.
  4. Postprocesado que introduce correlaciones entre columnas, recorta valores extremos e inserta valores faltantes en patrones realistas.
  5. Un filtrado con un ensamblado de árboles que elimina tablas sin señal aprendible.

Al ser procedimental (no un modelo entrenado), el generador puede producir una cantidad prácticamente ilimitada de tablas, cada una con grafos y mecanismos distintos. Además, se buscó imitar imperfecciones del mundo real: patrones variados de valores faltantes, coarsening de algunos atributos, categorías con muchos niveles y objetivos de regresión con colas pesadas.

Implicaciones prácticas para equipos y empresas en América Latina

Kumo Tabular ofrece una vía rápida para explorar problemas tabulares sin invertir inmediatamente en pipelines complejos. Algunos escenarios de interés:

  • Prototipado y validación rápida: equipos de datos pueden obtener predicciones y estimaciones de incertidumbre con mínimo esfuerzo, lo que ayuda a priorizar problemas y a decidir si un enfoque más personalizado vale la pena.

  • Reducción de trabajo inicial: al minimizar la necesidad de ingeniería de características y ajuste fino, es posible acelerar pruebas de concepto en áreas como riesgo crediticio, detección de fraude, predicción de demanda y churn.

  • Educación y transferencia de conocimiento: para organizaciones que están construyendo capacidades internas en ML, Kumo Tabular sirve como referencia práctica para entender patrones en datos tabulares y comparar contra soluciones tradicionales.

Consideraciones locales: muchos conjuntos de datos en la región pueden tener patrones de missingness, categorías con muchos niveles y ruido —características que la fase de preentrenamiento intentó reproducir—, pero esto no sustituye la validación con datos reales y la revisión por expertos en dominio.

Limitaciones y buenas prácticas

  • Evaluar con datos reales: dado que el preentrenamiento fue sintético, es crucial validar el rendimiento y la calibración en sus propias tablas antes de producción.
  • No elimina completamente la necesidad de modelos a medida: para problemas regulatorios, de alta criticidad o con requisitos de explicabilidad estrictos, los enfoques personalizados pueden seguir siendo necesarios.
  • Recursos y despliegue: Kumo Tabular viene en varios tamaños; elegir el apropiado dependerá de costos de inferencia y requisitos de latencia.
  • Licencia y gobernanza: el modelo se publica bajo OpenMDW-1.1, que permite uso comercial, pero siempre revisen la licencia y las políticas internas de gobernanza de modelos.

Cómo empezar

La implementación de NVIDIA funciona con la biblioteca de código abierto asociada y contempla modos de inferencia que aprovechan el cacheo del contexto para acelerar predicciones en tablas grandes.

Conclusión

Kumo Tabular representa un avance relevante en la dirección de modelos fundacionales para datos tabulares: combina una arquitectura diseñada para tablas, técnicas de atención adaptadas a la escala y un preentrenamiento masivo en datos sintéticos que buscan cubrir imperfecciones reales. Para equipos latinoamericanos, ofrece una herramienta de bajo fricción para prototipado y evaluación inicial de problemas tabulares, aunque debe acompañarse de validación rigurosa y consideraciones de despliegue para pasar a producción.

Fuente original: Hugging Face Blog