Nvidia lança modelo de IA que prevê dados em tabelas sem precisar de treinamento
O Kumo Tabular é um modelo de código aberto que analisa planilhas e faz previsões diretas, eliminando meses de trabalho de engenharia de dados e ajustes.
A Nvidia lançou o Kumo Tabular, um modelo de inteligência artificial de código aberto que prevê valores em tabelas de dados corporativos sem precisar de treinamento adicional ou ajuste de parâmetros. Ele usa aprendizado em contexto, lendo exemplos rotulados e fazendo previsões diretas, e lidera quatro benchmarks importantes do setor.

A Nvidia lançou o Kumo Tabular, um modelo de inteligência artificial de código aberto que promete revolucionar a forma como empresas trabalham com dados em tabelas — aquelas planilhas de clientes, vendas, sensores e transações que formam a espinha dorsal da maioria dos sistemas corporativos. Segundo informou a empresa em seu blog no Hugging Face (uma plataforma onde desenvolvedores compartilham modelos de IA já treinados), o modelo consegue fazer previsões sobre novos dados sem precisar de treinamento adicional, ajuste de parâmetros ou engenharia de features (o processo trabalhoso de transformar dados brutos em informações úteis para um modelo).
O Kumo Tabular funciona por meio de aprendizado em contexto, a mesma técnica que permite aos grandes modelos de linguagem (LLMs, os modelos de IA que entendem e geram texto) resolverem tarefas novas apenas lendo exemplos. Você fornece uma tabela com algumas linhas já rotuladas — por exemplo, clientes que cancelaram ou não cancelaram um serviço — e o modelo prevê o que vai acontecer com as linhas sem rótulo, tudo em uma única passagem pelos dados. Disponível em três tamanhos (de 28 milhões a 215 milhões de parâmetros, os valores ajustáveis que definem o comportamento de um modelo), ele foi treinado exclusivamente com dados artificiais gerados por simulações matemáticas, não com tabelas reais.
Nos testes de desempenho, o Kumo Tabular ficou em primeiro lugar em quatro benchmarks importantes do setor: TabArena, BeyondArena, TALENT e ScoringBench. No TabArena, que compara modelos de IA com métodos tradicionais como gradient-boosted trees (uma técnica estatística muito usada em machine learning para dados tabulares), o modelo alcançou uma pontuação ELO (um sistema de ranking) de 1950, superando concorrentes enquanto rodava 17 vezes mais rápido que o segundo colocado, o LimiX-2. A Nvidia também destacou que ele estabeleceu um novo padrão na relação entre precisão e eficiência computacional.
O modelo está disponível no GitHub e no Hugging Face sob a licença OpenMDW-1.1, que permite uso comercial. Ele funciona apenas com colunas numéricas e categóricas — não processa texto livre, imagens ou datas, o que limita seu uso em alguns cenários. A Nvidia promete lançar em breve tanto a receita completa de treinamento quanto os geradores de dados artificiais que criaram as milhões de tabelas sintéticas usadas para treinar o modelo, algo que pode ajudar outros pesquisadores a replicar ou melhorar a abordagem.


