Nvidia e Infosys crean un conjunto de datos sintéticos para entrenar modelos de IA adaptados a India
Nemotron-Personas-India genera conversaciones artificiales que reflejan la diversidad lingüística y cultural del subcontinente, con el objetivo de que empresas e instituciones indias desarrollen su propia inteligencia artificial.

Nvidia (el fabricante estadounidense de chips especializados en inteligencia artificial) e Infosys (una consultora tecnológica india) han publicado Nemotron-Personas-India, un conjunto de datos sintéticos (conversaciones generadas por IA, no por personas reales) diseñado específicamente para entrenar modelos de lenguaje que comprendan mejor el contexto cultural, lingüístico y social de India. Según informó Hugging Face en su blog oficial, el proyecto incluye más de 145.000 conversaciones artificiales que cubren desde jerga local hasta referencias culturales específicas de distintas regiones del país.
El objetivo declarado es facilitar la llamada "IA soberana" (sovereign AI), un término que en este contexto se refiere a que gobiernos, empresas o instituciones de un país puedan desarrollar y controlar sus propios sistemas de inteligencia artificial sin depender exclusivamente de modelos entrenados con datos occidentales. India, con sus 22 idiomas oficiales y cientos de dialectos, representa un desafío enorme para los modelos generalistas como ChatGPT o Gemini, que tienden a funcionar peor cuando se les pregunta en hindi, tamil o bengalí, o cuando necesitan entender contextos locales como festividades religiosas, sistemas de castas o expresiones coloquiales.
Para crear este conjunto de datos, Nvidia utilizó su propio modelo Nemotron (un LLM o modelo de lenguaje grande desarrollado internamente por la compañía) para generar conversaciones sintéticas basadas en 10.000 perfiles ficticios de personas indias, que incluyen variables como edad, región, idioma materno, nivel educativo y ocupación. El resultado son diálogos que abarcan desde consultas médicas en hindi hasta discusiones sobre derecho empresarial o recomendaciones de restaurantes en Chennai. Todos los datos están bajo licencia abierta y disponibles en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados).
Aunque el proyecto se presenta como una herramienta para democratizar el acceso a la IA en India, también plantea preguntas sobre quién decide qué se considera "representativo" de un país tan diverso. Los datos sintéticos, por definición, reflejan los sesgos del modelo que los genera: si Nemotron fue entrenado principalmente con textos en inglés y datos occidentales, es difícil garantizar que las conversaciones artificiales capturen fielmente la complejidad de la realidad india. Nvidia e Infosys no han detallado aún qué métricas de evaluación utilizaron para validar la calidad cultural de los datos generados.
El lanzamiento forma parte de una tendencia más amplia en la que gobiernos y empresas de países no anglófonos buscan reducir su dependencia de las grandes tecnológicas estadounidenses. Emiratos Árabes Unidos, Francia y varios países de Latinoamérica han anunciado iniciativas similares en los últimos meses. La diferencia en el caso indio es que cuenta con el respaldo directo de Nvidia, cuyas GPUs (procesadores gráficos especializados en cálculos de IA) son fundamentales para entrenar estos modelos, lo que convierte a la compañía en un socio estratégico difícil de esquivar incluso para quienes aspiran a la "soberanía tecnológica".


