Hugging Face e IISc se alían para impulsar modelos de IA en las lenguas de India
La plataforma de modelos abiertos y el instituto tecnológico indio colaborarán para entrenar y compartir sistemas de inteligencia artificial que funcionen en idiomas como el hindi, el tamil o el bengalí, lenguas con escasa presencia en los grandes modelos comerciales.
Hugging Face (plataforma donde se comparten modelos de IA) y el Indian Institute of Science trabajarán juntos para entrenar y publicar de forma abierta modelos de lenguaje en idiomas como hindi, tamil o bengalí, lenguas con cientos de millones de hablantes pero casi ausentes en los grandes sistemas comerciales de IA.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) y el Indian Institute of Science (IISc, uno de los centros de investigación más prestigiosos de India) han anunciado una colaboración para desarrollar modelos de inteligencia artificial centrados en los idiomas del país asiático. El objetivo es crear sistemas capaces de entender y generar texto en lenguas como el hindi, el bengalí, el tamil o el marathi, que suman cientos de millones de hablantes pero apenas aparecen en los grandes LLMs (modelos de lenguaje extensos, como ChatGPT o Claude) que dominan el mercado.
La alianza, según informó Hugging Face en su blog oficial, incluye apoyo técnico del equipo de la plataforma, acceso a infraestructura de entrenamiento (los servidores y procesadores necesarios para enseñar a un modelo a partir de enormes cantidades de texto) y la publicación abierta de los modelos resultantes. IISc aportará experiencia en procesamiento del lenguaje natural y conjuntos de datos en lenguas indias, un recurso escaso y difícil de conseguir en comparación con el inglés o el español.
El problema de fondo es conocido: los modelos de IA más avanzados se entrenan casi exclusivamente con texto en inglés, y en menor medida en chino, español o francés. Idiomas con sistemas de escritura distintos, como el devanagari (usado para el hindi y el sánscrito) o el tamil, quedan marginados, lo que limita su utilidad para millones de personas. Proyectos anteriores, como Bhashini del gobierno indio, han intentado cerrar esa brecha, pero la falta de modelos de pesos abiertos (aquellos cuyo código y parámetros se pueden descargar y modificar libremente) ha frenado su adopción.
Hugging Face lleva años apostando por la democratización de la IA, facilitando que cualquier equipo pequeño pueda entrenar, ajustar o desplegar modelos sin depender de las grandes tecnológicas. Esta colaboración con IISc sigue esa línea: los modelos que salgan del acuerdo estarán disponibles de forma gratuita en la plataforma, permitiendo que otros desarrolladores los usen, mejoren o adapten a sus propias necesidades. La iniciativa también busca crear una comunidad activa de investigadores y desarrolladores indios en torno a la IA de código abierto.
Aunque no se han dado plazos concretos ni nombres de modelos específicos, el anuncio llega en un momento en que varios países no anglófonos están invirtiendo en sus propios ecosistemas de IA. Francia con Mistral, los Emiratos Árabes con Falcon o España con proyectos más modestos como ALIA son ejemplos de esa tendencia. India, con su tamaño demográfico y diversidad lingüística, tiene mucho que ganar si logra que sus idiomas dejen de ser ciudadanos de segunda clase en la era de los modelos de lenguaje.


