Hugging Face incorpora Sentence Transformers, la biblioteca que compara textos con inteligencia artificial
La plataforma de IA adquiere el proyecto de código abierto que usan millones de desarrolladores para entender similitudes entre textos, y su creador se une al equipo.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) anunció la incorporación oficial de Sentence Transformers, una biblioteca de código abierto que permite convertir textos en representaciones matemáticas para comparar su significado. El proyecto, creado hace cinco años por Nils Reimers, ha superado los 100 millones de descargas y se usa en miles de aplicaciones que necesitan entender si dos frases significan algo parecido, desde buscadores internos de empresas hasta asistentes virtuales que interpretan preguntas.
Reimers, quien desarrolló la herramienta durante su doctorado y la mantuvo de forma independiente hasta ahora, se une a Hugging Face como ingeniero de aprendizaje automático (machine learning engineer, la persona que entrena y optimiza modelos de IA). Según informó la compañía en su blog oficial, la biblioteca seguirá siendo completamente gratuita y de código abierto, sin cambios en su licencia Apache 2.0 que permite usarla tanto en proyectos personales como comerciales.
La tecnología detrás de Sentence Transformers convierte frases completas en embeddings (representaciones numéricas que capturan el significado del texto), lo que permite buscar documentos similares, agrupar opiniones de clientes por tema o detectar textos duplicados sin necesidad de compararlos palabra por palabra. A diferencia de modelos más grandes como los LLM (large language models, los sistemas de IA que generan texto como ChatGPT), estos modelos son mucho más pequeños y rápidos, lo que los hace ideales para ejecutarse en servidores normales o incluso en dispositivos móviles.
La integración no cambiará el funcionamiento actual de la biblioteca, pero Hugging Face planea mejorar su compatibilidad con el resto de su ecosistema, que incluye más de 500.000 modelos públicos. Esto podría facilitar que más desarrolladores combinen Sentence Transformers con otras herramientas de la plataforma, como datasets (conjuntos de datos preparados para entrenar modelos) o pipelines de procesamiento de lenguaje natural. Para la comunidad de código abierto, la noticia confirma que uno de los proyectos más utilizados en búsqueda semántica (la técnica de buscar por significado en lugar de por palabras exactas) tendrá respaldo institucional sin perder su carácter abierto.


