Nvidia lanza Kumo Tabular, un modelo de IA que predice patrones en bases de datos sin entrenamiento previo
El modelo de código abierto analiza tablas de datos empresariales y hace predicciones en una sola pasada, sin necesidad de ajustar parámetros ni preparar los datos manualmente, superando a los métodos tradicionales en precisión y velocidad
Nvidia lanzó Kumo Tabular, un modelo de inteligencia artificial de código abierto que predice patrones en bases de datos empresariales (como deserción de clientes o demanda de productos) leyendo filas con etiquetas conocidas y generando predicciones para filas nuevas en una sola pasada, sin necesidad de ajustar parámetros, preparar variables manualmente ni entrenar un modelo desde cero para cada tarea nueva.

Nvidia ha lanzado Kumo Tabular, un modelo de inteligencia artificial que predice patrones en bases de datos de forma automática, sin necesidad de entrenamiento adicional ni ajustes manuales. El modelo, disponible en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), está diseñado para trabajar con datos tabulares (información organizada en filas y columnas, como hojas de cálculo), el formato más común en empresas para almacenar registros de clientes, transacciones, pedidos o sensores.
Durante dos décadas, las empresas han analizado este tipo de datos con gradient-boosted trees (árboles de decisión mejorados, una técnica estadística que combina muchas predicciones simples para obtener un resultado más preciso). El problema es que cada nueva pregunta empresarial —predecir si un cliente se va a dar de baja, si un préstamo será impagado, o cuánta demanda tendrá un producto— requería repetir todo el proceso: recopilar ejemplos etiquetados, preparar manualmente las variables, buscar la configuración óptima del modelo y desplegarlo. Kumo Tabular cambia esto aplicando el aprendizaje en contexto (in-context learning), la misma técnica que permite a los modelos de lenguaje como ChatGPT resolver tareas nuevas con solo ver algunos ejemplos en el prompt, pero aplicada a tablas en lugar de texto.
El modelo funciona en tres pasos. Primero, convierte cada celda en un token (una unidad de información que el modelo puede procesar) usando características de Fourier (transformaciones matemáticas que capturan patrones periódicos en los números) y tratando los valores faltantes de forma especial, sin necesidad de rellenarlos manualmente. Segundo, analiza cada fila con dos tipos de atención (mecanismos que permiten al modelo decidir qué información es relevante): la atención de columna compara un valor con todos los demás de su columna para entender si es típico o excepcional, mientras que la atención de fila examina cómo se relacionan las diferentes variables dentro de una misma fila. Tercero, un Transformer final (la arquitectura de red neuronal que también usan modelos como GPT) compara las filas con etiquetas conocidas con las filas que se quieren predecir, generando probabilidades para clasificación o estimaciones numéricas para regresión.
Según informó Nvidia en su blog oficial y en un comunicado conjunto con Hugging Face, Kumo Tabular fue entrenado exclusivamente con tablas artificiales generadas mediante modelos causales estructurales (SCM, sistemas que simulan relaciones de causa-efecto entre variables). El generador crea gráficos causales aleatorios donde nodos ocultos influyen en las columnas visibles, imitando las causas no medidas que existen en datos reales. Esto produce millones de tablas con diferentes tamaños, patrones de valores faltantes, columnas correlacionadas y distribuciones complicadas, preparando al modelo para la variedad del mundo real sin depender de datos privados de empresas.
El modelo existe en tres tamaños —28, 83 y 215 millones de parámetros (los valores internos que el modelo ajusta durante el entrenamiento)— y supera a los métodos tradicionales en cuatro benchmarks especializados: TabArena, BeyondArena, TALENT y ScoringBench. En TabArena, Kumo Tabular obtuvo una puntuación ELO (un sistema de ranking usado en ajedrez y competiciones) de 1950, siendo 17 veces más rápido que el segundo clasificado, LimiX-2, cuando ambos se ejecutan en la misma GPU (tarjeta gráfica especializada en cálculos paralelos) RTX 6000 Pro. El código está disponible en GitHub bajo licencia OpenMDW-1.1, que permite uso comercial, aunque solo funciona con columnas numéricas y categóricas, sin poder procesar texto, imágenes o marcas de tiempo por el momento.


