En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Cómo crear modelos de IA que entiendan texto e imágenes a la vez

Hugging Face actualiza su biblioteca Sentence Transformers para que cualquiera pueda entrenar modelos capaces de comparar y buscar información combinando palabras y fotos.

Por Redacción2 min
Compartir
Cómo crear modelos de IA que entiendan texto e imágenes a la vez
Herramientas · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de actualizar su biblioteca Sentence Transformers para que sea mucho más fácil crear modelos multimodales. Esto significa que ahora cualquier persona con conocimientos básicos de programación puede entrenar modelos de IA capaces de entender y comparar tanto texto como imágenes al mismo tiempo, algo que antes requería conocimientos avanzados y mucho código personalizado.

La novedad está en que la biblioteca ahora soporta modelos de embeddings multimodales (sistemas que convierten textos e imágenes en representaciones numéricas que se pueden comparar) y rerankers (modelos que reordenan resultados de búsqueda para mostrar los más relevantes primero). Según explica el anuncio de Hugging Face, esto permite casos de uso como buscar imágenes usando descripciones en texto, o encontrar productos en un catálogo combinando fotos y palabras clave.

El cambio principal es que la biblioteca ahora trabaja con modelos basados en CLIP (un tipo de red neuronal entrenada para relacionar imágenes y texto) y con modelos más recientes como Qwen2-VL o NVLM, que pueden procesar varios tipos de datos a la vez. Los desarrolladores solo necesitan cargar el modelo, preparar sus datos y ejecutar el entrenamiento con unas pocas líneas de código, sin tener que escribir funciones complejas para manejar imágenes y texto por separado.

La actualización también mejora el fine-tuning (el proceso de ajustar un modelo ya entrenado para una tarea específica). Ahora es posible entrenar estos modelos multimodales usando técnicas como MatryoshkaLoss (que permite crear embeddings de distintos tamaños para ahorrar recursos) o GISTEmbedLoss (que mejora la calidad de las representaciones numéricas). Todo esto sin salir de la misma biblioteca que ya usaban miles de proyectos para trabajar solo con texto.

Para quien quiera probarlo, Hugging Face ha publicado ejemplos de código y notebooks interactivos que muestran cómo entrenar un modelo desde cero o cómo afinar uno ya existente. La biblioteca es de código abierto y funciona tanto en ordenadores personales con GPU (procesadores gráficos que aceleran el entrenamiento de modelos de IA) como en servicios en la nube. Es un paso importante para democratizar el acceso a modelos que antes solo estaban al alcance de equipos con muchos recursos técnicos.

Fuente original
Hugging Face Blog
Más en · Herramientas