En directo
[Modelos de IA]Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas[Investigación]DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad[Investigación]OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA[Investigación]Científicos usan AlphaFold para diseñar cultivos resistentes al calor[Herramientas]OpenAI lanza ChatGPT Work, un asistente que completa proyectos enteros por ti[Modelos de IA]Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad[Investigación]AlphaFold desvela la estructura de una proteína clave en las enfermedades cardíacas[Herramientas]Microsoft y Hugging Face profundizan su alianza para facilitar el despliegue de modelos de IA[Modelos de IA]Falcon-Edge: modelos de lenguaje de 1,58 bits que caben en un móvil[Herramientas]Hugging Face y Kaggle facilitan el uso compartido de modelos de inteligencia artificial[Modelos de IA]Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas[Investigación]DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad[Investigación]OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA[Investigación]Científicos usan AlphaFold para diseñar cultivos resistentes al calor[Herramientas]OpenAI lanza ChatGPT Work, un asistente que completa proyectos enteros por ti[Modelos de IA]Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad[Investigación]AlphaFold desvela la estructura de una proteína clave en las enfermedades cardíacas[Herramientas]Microsoft y Hugging Face profundizan su alianza para facilitar el despliegue de modelos de IA[Modelos de IA]Falcon-Edge: modelos de lenguaje de 1,58 bits que caben en un móvil[Herramientas]Hugging Face y Kaggle facilitan el uso compartido de modelos de inteligencia artificial
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog1 min

Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas

La nueva familia de modelos de inteligencia artificial combina procesamiento de imágenes y texto en español, alemán, japonés y otros seis idiomas, y ya está disponible para descarga gratuita en Hugging Face.

Por Redacción1 min
En resumen

Google lanzó PaliGemma 2 Mix, tres modelos de visión y lenguaje (sistemas de IA que analizan imágenes y texto) que funcionan en nueve idiomas incluido el español. Vienen en versiones de 3, 10 y 28 mil millones de parámetros (valores ajustables del modelo), están disponibles en Hugging Face y permiten uso comercial sin restricciones.

Compartir
Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas
Modelos de IA · Hugging Face Blog

Google ha lanzado PaliGemma 2 Mix, una nueva generación de modelos de visión y lenguaje (sistemas de IA capaces de analizar tanto imágenes como texto) que operan nativamente en nueve idiomas, incluido el español. Estos modelos, disponibles para descarga en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), representan una evolución significativa respecto a la versión anterior, que funcionaba principalmente en inglés.

La familia PaliGemma 2 Mix incluye tres variantes de distinto tamaño: 3 mil millones, 10 mil millones y 28 mil millones de parámetros (valores ajustables que determinan el comportamiento del modelo). Los tres han sido entrenados con una mezcla equilibrada de datos en inglés, español, francés, alemán, italiano, portugués, hindi, japonés y coreano, lo que les permite responder a instrucciones y describir imágenes en cualquiera de estos idiomas sin necesidad de traducción previa.

Según Google, estos modelos destacan especialmente en tareas como el OCR (reconocimiento óptico de caracteres, es decir, extraer texto de imágenes), la detección de objetos y la respuesta a preguntas sobre contenido visual. La versión de 28 mil millones de parámetros alcanza un rendimiento comparable al de modelos líderes del sector en benchmarks multilingües (pruebas estandarizadas para medir capacidades de IA), algo inusual para un modelo de visión de pesos abiertos (cuya arquitectura interna es pública y modificable).

Los tres modelos están licenciados bajo Gemma Terms of Use, lo que permite su uso comercial sin restricciones de escala. Google ha publicado también el código de entrenamiento y las recetas de fine-tuning (ajuste fino, proceso de adaptar un modelo preentrenado a una tarea específica) para facilitar que otros equipos los personalicen. La disponibilidad en Hugging Face, combinada con su capacidad multilingüe nativa, podría acelerar el desarrollo de aplicaciones de visión por computadora en mercados no anglófonos.

Fuente original
Hugging Face Blog
Más en · Modelos de IA