Cómo crear modelos de IA que entiendan texto e imágenes a la vez
Hugging Face actualiza su biblioteca Sentence Transformers para que cualquiera pueda entrenar modelos capaces de comparar y buscar información combinando palabras y fotos.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de actualizar su biblioteca Sentence Transformers para que sea mucho más fácil crear modelos multimodales. Esto significa que ahora cualquier persona con conocimientos básicos de programación puede entrenar modelos de IA capaces de entender y comparar tanto texto como imágenes al mismo tiempo, algo que antes requería conocimientos avanzados y mucho código personalizado.
La novedad está en que la biblioteca ahora soporta modelos de embeddings multimodales (sistemas que convierten textos e imágenes en representaciones numéricas que se pueden comparar) y rerankers (modelos que reordenan resultados de búsqueda para mostrar los más relevantes primero). Según explica el anuncio de Hugging Face, esto permite casos de uso como buscar imágenes usando descripciones en texto, o encontrar productos en un catálogo combinando fotos y palabras clave.
El cambio principal es que la biblioteca ahora trabaja con modelos basados en CLIP (un tipo de red neuronal entrenada para relacionar imágenes y texto) y con modelos más recientes como Qwen2-VL o NVLM, que pueden procesar varios tipos de datos a la vez. Los desarrolladores solo necesitan cargar el modelo, preparar sus datos y ejecutar el entrenamiento con unas pocas líneas de código, sin tener que escribir funciones complejas para manejar imágenes y texto por separado.
La actualización también mejora el fine-tuning (el proceso de ajustar un modelo ya entrenado para una tarea específica). Ahora es posible entrenar estos modelos multimodales usando técnicas como MatryoshkaLoss (que permite crear embeddings de distintos tamaños para ahorrar recursos) o GISTEmbedLoss (que mejora la calidad de las representaciones numéricas). Todo esto sin salir de la misma biblioteca que ya usaban miles de proyectos para trabajar solo con texto.
Para quien quiera probarlo, Hugging Face ha publicado ejemplos de código y notebooks interactivos que muestran cómo entrenar un modelo desde cero o cómo afinar uno ya existente. La biblioteca es de código abierto y funciona tanto en ordenadores personales con GPU (procesadores gráficos que aceleran el entrenamiento de modelos de IA) como en servicios en la nube. Es un paso importante para democratizar el acceso a modelos que antes solo estaban al alcance de equipos con muchos recursos técnicos.


