En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

IBM explica cómo entrenó Granite 4.1, su familia de modelos de IA de código abierto

La compañía publica los detalles técnicos completos del proceso de entrenamiento, incluyendo datos usados, arquitectura y decisiones de diseño de sus nuevos modelos de lenguaje.

Por Redacción2 min
Compartir
IBM explica cómo entrenó Granite 4.1, su familia de modelos de IA de código abierto
Modelos de IA · Hugging Face Blog

IBM ha publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) un artículo detallado sobre cómo construyó Granite 4.1, su última familia de modelos de lenguaje de código abierto. A diferencia de muchas empresas que solo lanzan los modelos ya entrenados, IBM explica paso a paso las decisiones técnicas que tomó durante el desarrollo, desde la selección de datos de entrenamiento hasta la arquitectura de las redes neuronales (la estructura interna que permite al modelo aprender y generar texto).

Los modelos Granite 4.1 vienen en varios tamaños —desde 1.000 millones hasta 16.000 millones de parámetros (los valores internos que el modelo ajusta durante el aprendizaje para mejorar sus respuestas)— y están pensados para poder ejecutarse tanto en servidores potentes como en ordenadores convencionales o dispositivos móviles. IBM entrenó estos modelos con un conjunto de datos multilingüe de 12 billones de palabras (tokens) que incluye código de programación, contenido científico, matemático y conversacional en múltiples idiomas, incluyendo español.

Una de las novedades técnicas más destacadas es el uso de una arquitectura híbrida que combina mecanismos de atención (la forma en que el modelo decide qué partes del texto son más importantes al generar una respuesta) con capas recurrentes (un tipo de estructura que procesa el texto de forma secuencial, recordando información de pasos anteriores). Según IBM, esto permite que los modelos sean más eficientes durante la inferencia (el momento en que el modelo genera una respuesta a partir de una pregunta o instrucción del usuario), reduciendo el consumo de memoria y acelerando las respuestas sin perder precisión.

La compañía también detalla cómo aplicó técnicas de fine-tuning (ajuste fino, un proceso en el que se entrena un modelo base con datos específicos para mejorar su rendimiento en tareas concretas) y RLHF (aprendizaje por refuerzo con retroalimentación humana, donde personas evalúan las respuestas del modelo para que aprenda a generar contenido más útil y seguro). IBM afirma haber invertido recursos significativos en filtrar contenido tóxico y sesgado de los datos de entrenamiento, y en evaluar el rendimiento de los modelos en tareas comunes como resumir documentos, responder preguntas técnicas o generar código funcional.

Todos los modelos Granite 4.1 están disponibles bajo licencia Apache 2.0, lo que significa que cualquier empresa o desarrollador puede descargarlos, modificarlos y usarlos en productos comerciales sin restricciones importantes. IBM publicó además los checkpoints intermedios (versiones guardadas del modelo en distintos puntos del entrenamiento) y las recetas de entrenamiento completas, algo poco común en la industria y que facilita que otros investigadores puedan reproducir o mejorar el trabajo.

Fuente original
Hugging Face Blog
Etiquetas
Más en · Modelos de IA