Nvidia cria dataset de IA com 10 mil personas indianas para treinar modelos locais
Conjunto de dados sintéticos representa diversidade cultural, linguística e socioeconômica da Índia para desenvolvimento de IA soberana.

A Nvidia lançou o Nemotron-Personas-India, um dataset (conjunto de dados usado para treinar modelos de IA) com 10 mil personas sintéticas que representam a diversidade da Índia. O material inclui variações de idioma, região, contexto socioeconômico e background cultural, e está disponível gratuitamente no Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados). A ideia é permitir que empresas e governos indianos treinem seus próprios modelos de linguagem sem depender de dados produzidos no exterior.
Cada persona inclui informações detalhadas como profissão, nível educacional, idade, idioma nativo e estado de origem. O dataset cobre 22 idiomas oficiais da Índia e 28 estados, além de diferentes faixas etárias e níveis de renda. Segundo a Nvidia, a diversidade é essencial para evitar que modelos de IA reproduzam apenas a perspectiva de grupos majoritários ou de regiões específicas do país.
Os dados foram gerados sinteticamente — ou seja, criados por outro modelo de IA, não coletados de pessoas reais — usando o Nemotron-4 340B Instruct (um modelo de linguagem grande, ou LLM, desenvolvido pela própria Nvidia). A empresa validou as personas com especialistas indianos em cultura e linguística para garantir que refletem adequadamente a realidade local, incluindo nuances regionais e variações no uso de cada idioma.
O lançamento faz parte de uma estratégia mais ampla chamada IA soberana, que defende que cada país ou região deve ter capacidade de desenvolver modelos próprios, treinados com dados locais e adaptados às suas necessidades. A Nvidia já oferece datasets semelhantes para outros mercados e vê a Índia como um dos principais alvos dessa abordagem, dado o tamanho da população, a diversidade linguística e o crescimento do setor de tecnologia no país.


