En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

LinkedIn publica el código de GPT-OSS, el modelo que entrena con aprendizaje por refuerzo sin ayuda humana

La red social profesional comparte cómo entrenó un modelo de lenguaje capaz de generar código sin supervisión, usando un sistema que se autoevalúa mientras aprende

Por Redacción2 min
Compartir
LinkedIn publica el código de GPT-OSS, el modelo que entrena con aprendizaje por refuerzo sin ayuda humana
Investigación · Hugging Face Blog

LinkedIn ha publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) el código completo de GPT-OSS, un proyecto experimental que busca entrenar modelos de lenguaje grandes (LLM, sistemas de inteligencia artificial capaces de generar texto) para que escriban código de programación sin necesidad de que humanos revisen cada respuesta. La clave está en el aprendizaje por refuerzo agentic (agentic RL, una técnica donde el modelo aprende a resolver tareas de forma autónoma, recibiendo recompensas cuando lo hace bien), que permite al sistema mejorar sin intervención manual.

El equipo de LinkedIn explica que la mayor dificultad no fue diseñar el modelo en sí, sino hacer que el entrenamiento fuera escalable y estable. Entrenar con aprendizaje por refuerzo requiere que el modelo genere miles de respuestas posibles, las evalúe automáticamente y ajuste sus parámetros internos (los pesos, los valores numéricos que determinan cómo funciona la IA) en función de cuáles funcionaron mejor. Ese proceso consume muchísima memoria y potencia de cálculo, especialmente cuando el modelo tiene miles de millones de parámetros, como es el caso de GPT-OSS.

Para solucionar el problema de recursos, el equipo aplicó varias optimizaciones técnicas: usaron LoRA (Low-Rank Adaptation, un método que permite entrenar solo una pequeña parte de los pesos del modelo en lugar de todos a la vez) y dividieron el trabajo en múltiples GPUs (procesadores especializados en cálculos paralelos, los chips que hacen posible entrenar modelos grandes). También tuvieron que ajustar el sistema de recompensas —cómo el modelo sabe si una respuesta es buena o mala— para que fuera lo bastante riguroso sin volverse demasiado exigente y bloquear el aprendizaje.

Según informó el blog de Hugging Face, el modelo logró mejoras significativas en tareas de generación de código, comparado con versiones entrenadas solo con aprendizaje supervisado tradicional (donde se le muestran ejemplos correctos para que los imite). Los resultados sugieren que el aprendizaje por refuerzo puede ser una alternativa viable para entrenar modelos especializados sin depender tanto de conjuntos de datos etiquetados por humanos, algo que suele ser caro y lento de conseguir.

LinkedIn no ha anunciado planes para integrar GPT-OSS en sus productos, pero la publicación del código abre la puerta a que otros equipos experimenten con técnicas similares. El enfoque resulta especialmente relevante para empresas que necesitan entrenar modelos en dominios especializados —como medicina, derecho o ingeniería— donde conseguir datos etiquetados de calidad es complicado. La liberación del código, además, permite a investigadores independientes reproducir los experimentos y proponer mejoras, algo que no siempre ocurre con proyectos de esta escala desarrollados dentro de grandes empresas.

Fuente original
Hugging Face Blog
Más en · Investigación