En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

LinkedIn publica el código de GPT-OSS, el modelo que entrena con aprendizaje por refuerzo sin ayuda humana

La red social profesional comparte cómo entrenó un modelo de lenguaje capaz de generar código sin supervisión, usando un sistema que se autoevalúa mientras aprende

Por Redacción2 min
Compartir
LinkedIn publica el código de GPT-OSS, el modelo que entrena con aprendizaje por refuerzo sin ayuda humana
Investigación · Hugging Face Blog

LinkedIn ha publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) el código completo de GPT-OSS, un proyecto experimental que busca entrenar modelos de lenguaje grandes (LLM, sistemas de inteligencia artificial capaces de generar texto) para que escriban código de programación sin necesidad de que humanos revisen cada respuesta. La clave está en el aprendizaje por refuerzo agentic (agentic RL, una técnica donde el modelo aprende a resolver tareas de forma autónoma, recibiendo recompensas cuando lo hace bien), que permite al sistema mejorar sin intervención manual.

El equipo de LinkedIn explica que la mayor dificultad no fue diseñar el modelo en sí, sino hacer que el entrenamiento fuera escalable y estable. Entrenar con aprendizaje por refuerzo requiere que el modelo genere miles de respuestas posibles, las evalúe automáticamente y ajuste sus parámetros internos (los pesos, los valores numéricos que determinan cómo funciona la IA) en función de cuáles funcionaron mejor. Ese proceso consume muchísima memoria y potencia de cálculo, especialmente cuando el modelo tiene miles de millones de parámetros, como es el caso de GPT-OSS.

Para solucionar el problema de recursos, el equipo aplicó varias optimizaciones técnicas: usaron LoRA (Low-Rank Adaptation, un método que permite entrenar solo una pequeña parte de los pesos del modelo en lugar de todos a la vez) y dividieron el trabajo en múltiples GPUs (procesadores especializados en cálculos paralelos, los chips que hacen posible entrenar modelos grandes). También tuvieron que ajustar el sistema de recompensas —cómo el modelo sabe si una respuesta es buena o mala— para que fuera lo bastante riguroso sin volverse demasiado exigente y bloquear el aprendizaje.

Según informó el blog de Hugging Face, el modelo logró mejoras significativas en tareas de generación de código, comparado con versiones entrenadas solo con aprendizaje supervisado tradicional (donde se le muestran ejemplos correctos para que los imite). Los resultados sugieren que el aprendizaje por refuerzo puede ser una alternativa viable para entrenar modelos especializados sin depender tanto de conjuntos de datos etiquetados por humanos, algo que suele ser caro y lento de conseguir.

LinkedIn no ha anunciado planes para integrar GPT-OSS en sus productos, pero la publicación del código abre la puerta a que otros equipos experimenten con técnicas similares. El enfoque resulta especialmente relevante para empresas que necesitan entrenar modelos en dominios especializados —como medicina, derecho o ingeniería— donde conseguir datos etiquetados de calidad es complicado. La liberación del código, además, permite a investigadores independientes reproducir los experimentos y proponer mejoras, algo que no siempre ocurre con proyectos de esta escala desarrollados dentro de grandes empresas.

Fuente original
Hugging Face Blog
Más en · Investigación