En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Nvidia e Infosys crean un conjunto de datos sintéticos para entrenar modelos de IA adaptados a India

Nemotron-Personas-India genera conversaciones artificiales que reflejan la diversidad lingüística y cultural del subcontinente, con el objetivo de que empresas e instituciones indias desarrollen su propia inteligencia artificial.

Por Redacción2 min
Compartir
Nvidia e Infosys crean un conjunto de datos sintéticos para entrenar modelos de IA adaptados a India
Modelos de IA · Hugging Face Blog

Nvidia (el fabricante estadounidense de chips especializados en inteligencia artificial) e Infosys (una consultora tecnológica india) han publicado Nemotron-Personas-India, un conjunto de datos sintéticos (conversaciones generadas por IA, no por personas reales) diseñado específicamente para entrenar modelos de lenguaje que comprendan mejor el contexto cultural, lingüístico y social de India. Según informó Hugging Face en su blog oficial, el proyecto incluye más de 145.000 conversaciones artificiales que cubren desde jerga local hasta referencias culturales específicas de distintas regiones del país.

El objetivo declarado es facilitar la llamada "IA soberana" (sovereign AI), un término que en este contexto se refiere a que gobiernos, empresas o instituciones de un país puedan desarrollar y controlar sus propios sistemas de inteligencia artificial sin depender exclusivamente de modelos entrenados con datos occidentales. India, con sus 22 idiomas oficiales y cientos de dialectos, representa un desafío enorme para los modelos generalistas como ChatGPT o Gemini, que tienden a funcionar peor cuando se les pregunta en hindi, tamil o bengalí, o cuando necesitan entender contextos locales como festividades religiosas, sistemas de castas o expresiones coloquiales.

Para crear este conjunto de datos, Nvidia utilizó su propio modelo Nemotron (un LLM o modelo de lenguaje grande desarrollado internamente por la compañía) para generar conversaciones sintéticas basadas en 10.000 perfiles ficticios de personas indias, que incluyen variables como edad, región, idioma materno, nivel educativo y ocupación. El resultado son diálogos que abarcan desde consultas médicas en hindi hasta discusiones sobre derecho empresarial o recomendaciones de restaurantes en Chennai. Todos los datos están bajo licencia abierta y disponibles en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados).

Aunque el proyecto se presenta como una herramienta para democratizar el acceso a la IA en India, también plantea preguntas sobre quién decide qué se considera "representativo" de un país tan diverso. Los datos sintéticos, por definición, reflejan los sesgos del modelo que los genera: si Nemotron fue entrenado principalmente con textos en inglés y datos occidentales, es difícil garantizar que las conversaciones artificiales capturen fielmente la complejidad de la realidad india. Nvidia e Infosys no han detallado aún qué métricas de evaluación utilizaron para validar la calidad cultural de los datos generados.

El lanzamiento forma parte de una tendencia más amplia en la que gobiernos y empresas de países no anglófonos buscan reducir su dependencia de las grandes tecnológicas estadounidenses. Emiratos Árabes Unidos, Francia y varios países de Latinoamérica han anunciado iniciativas similares en los últimos meses. La diferencia en el caso indio es que cuenta con el respaldo directo de Nvidia, cuyas GPUs (procesadores gráficos especializados en cálculos de IA) son fundamentales para entrenar estos modelos, lo que convierte a la compañía en un socio estratégico difícil de esquivar incluso para quienes aspiran a la "soberanía tecnológica".

Fuente original
Hugging Face Blog
Más en · Modelos de IA