En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

GLM-5.2, un modelo de IA chino pensado para tareas que requieren planificación a largo plazo

Zhipu AI publica un modelo de lenguaje de pesos abiertos que destaca en razonamiento complejo y puede ejecutarse en portátiles con GPU doméstica.

Por Redacción2 min
Compartir
GLM-5.2, un modelo de IA chino pensado para tareas que requieren planificación a largo plazo
Modelos de IA · Hugging Face Blog

Zhipu AI (una empresa china especializada en inteligencia artificial) ha presentado GLM-5.2, un modelo de lenguaje de pesos abiertos (es decir, cuyo código y parámetros pueden descargarse y modificarse libremente) diseñado específicamente para tareas que exigen planificación y razonamiento en múltiples pasos. Según informó la compañía en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), GLM-5.2 destaca en benchmarks (pruebas estandarizadas que miden el rendimiento de un modelo) de razonamiento complejo, como AIME 2024 y GPQA, superando a modelos más grandes en algunos casos.

El modelo está disponible en dos versiones: una de 9 mil millones de parámetros (los valores internos que determinan cómo responde el modelo) y otra de 32 mil millones. La versión más pequeña puede ejecutarse en portátiles con GPUs de gama media como la RTX 4090 (una tarjeta gráfica de Nvidia pensada para videojuegos y creación de contenido, pero que también sirve para ejecutar modelos de IA localmente), lo que facilita su uso sin depender de servidores en la nube. Zhipu AI afirma que GLM-5.2 mantiene un equilibrio entre capacidad de razonamiento y eficiencia, consumiendo menos recursos que alternativas de código cerrado como GPT-4.

Una de las características destacadas es su ventana de contexto de 256.000 tokens (la cantidad de texto que el modelo puede procesar de una sola vez, equivalente aproximadamente a unas 180.000 palabras), lo que permite trabajar con documentos extensos o conversaciones largas sin perder información. El modelo también incluye capacidades multimodales (puede procesar no solo texto, sino también imágenes), aunque la compañía reconoce que esta función aún está en fase experimental y puede tener fallos.

GLM-5.2 se ha entrenado utilizando una técnica llamada GRPO (Group Relative Policy Optimization, una variante del aprendizaje por refuerzo que ajusta el modelo comparando respuestas entre sí en lugar de usar recompensas absolutas), que según Zhipu AI mejora su capacidad para descomponer problemas complejos en pasos más manejables. El modelo está optimizado para casos de uso como programación asistida, análisis de datos científicos y tareas que requieren mantener coherencia a lo largo de respuestas extensas.

Los pesos del modelo están disponibles bajo una licencia permisiva que permite uso comercial, y pueden descargarse desde Hugging Face. Zhipu AI ha publicado también un documento técnico detallando la arquitectura y el proceso de entrenamiento, aunque no revela el dataset completo utilizado (la colección de textos con la que se entrenó el modelo), citando consideraciones de propiedad intelectual. La compañía es conocida por GLM-4, un modelo anterior que ganó cierta tracción en el mercado chino, y esta nueva versión busca competir directamente con alternativas occidentales en el segmento de modelos abiertos de razonamiento avanzado.

Fuente original
Hugging Face Blog
Más en · Modelos de IA