En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Cómo crear modelos de IA que entiendan texto e imágenes a la vez

Hugging Face actualiza su biblioteca Sentence Transformers para que cualquiera pueda entrenar modelos capaces de comparar y buscar información combinando palabras y fotos.

Por Redacción2 min
Compartir
Cómo crear modelos de IA que entiendan texto e imágenes a la vez
Herramientas · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de actualizar su biblioteca Sentence Transformers para que sea mucho más fácil crear modelos multimodales. Esto significa que ahora cualquier persona con conocimientos básicos de programación puede entrenar modelos de IA capaces de entender y comparar tanto texto como imágenes al mismo tiempo, algo que antes requería conocimientos avanzados y mucho código personalizado.

La novedad está en que la biblioteca ahora soporta modelos de embeddings multimodales (sistemas que convierten textos e imágenes en representaciones numéricas que se pueden comparar) y rerankers (modelos que reordenan resultados de búsqueda para mostrar los más relevantes primero). Según explica el anuncio de Hugging Face, esto permite casos de uso como buscar imágenes usando descripciones en texto, o encontrar productos en un catálogo combinando fotos y palabras clave.

El cambio principal es que la biblioteca ahora trabaja con modelos basados en CLIP (un tipo de red neuronal entrenada para relacionar imágenes y texto) y con modelos más recientes como Qwen2-VL o NVLM, que pueden procesar varios tipos de datos a la vez. Los desarrolladores solo necesitan cargar el modelo, preparar sus datos y ejecutar el entrenamiento con unas pocas líneas de código, sin tener que escribir funciones complejas para manejar imágenes y texto por separado.

La actualización también mejora el fine-tuning (el proceso de ajustar un modelo ya entrenado para una tarea específica). Ahora es posible entrenar estos modelos multimodales usando técnicas como MatryoshkaLoss (que permite crear embeddings de distintos tamaños para ahorrar recursos) o GISTEmbedLoss (que mejora la calidad de las representaciones numéricas). Todo esto sin salir de la misma biblioteca que ya usaban miles de proyectos para trabajar solo con texto.

Para quien quiera probarlo, Hugging Face ha publicado ejemplos de código y notebooks interactivos que muestran cómo entrenar un modelo desde cero o cómo afinar uno ya existente. La biblioteca es de código abierto y funciona tanto en ordenadores personales con GPU (procesadores gráficos que aceleran el entrenamiento de modelos de IA) como en servicios en la nube. Es un paso importante para democratizar el acceso a modelos que antes solo estaban al alcance de equipos con muchos recursos técnicos.

Fuente original
Hugging Face Blog
Más en · Herramientas