Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA
Investigadores de Nvidia adaptaron su modelo Nemotron para competir al nivel de los mejores estudiantes del mundo tanto en programación como en matemáticas, demostrando que un mismo sistema puede especializarse en dominios muy diferentes
Nvidia entrenó versiones especializadas de su modelo Nemotron (un sistema de inteligencia artificial de propósito general) para competir en la Olimpiada Internacional de Informática y la Olimpiada Internacional de Matemáticas. Ambas versiones alcanzaron puntuaciones de medalla de oro usando la misma receta: entrenamiento supervisado, aprendizaje por refuerzo y sistemas iterativos de generación, verificación y refinamiento de respuestas.

Nvidia acaba de demostrar que su familia de modelos Nemotron puede adaptarse a problemas completamente distintos y alcanzar nivel de medalla de oro en ambos. Según informó la compañía en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), sus equipos consiguieron que versiones especializadas de Nemotron superaran el umbral de oro tanto en la Olimpiada Internacional de Informática (IOI, una competición de programación algorítmica) como en la Olimpiada Internacional de Matemáticas (IMO, centrada en demostraciones formales escritas). Lo interesante no es solo el resultado, sino que ambos sistemas partieron del mismo modelo base y usaron una receta de adaptación similar.
Para la IOI 2026, el equipo entrenó dos versiones especializadas del modelo: Nemotron-3-Nano-CC, con 30.000 millones de parámetros totales (los valores ajustables que definen el comportamiento de un modelo de IA) pero solo 3.000 millones activos en cada momento, y Nemotron-3-Ultra-CC, con 550.000 millones de parámetros totales y 55.000 millones activos. El modelo más pequeño recibió tanto entrenamiento supervisado (SFT, aprender de ejemplos etiquetados por humanos) como aprendizaje por refuerzo (RL, mejorar mediante prueba y error con un sistema de recompensas). El Ultra solo necesitó entrenamiento supervisado. Ambos usaron después GenCorrect, un sistema iterativo que genera código, lo evalúa contra casos de prueba y lo refina en varias rondas. El resultado final del Ultra-CC fue de 535,4 puntos sobre 600, muy por encima del umbral de oro (361,12) y del mejor competidor humano (498,27). La prueba se realizó bajo las mismas condiciones que los participantes humanos: tiempo limitado, sin acceso a internet y con restricciones en el número de envíos.
En matemáticas, el desafío era distinto: escribir demostraciones rigurosas en lenguaje natural, no código ejecutable. El equipo entrenó dos especialistas a partir de Nemotron 3 Ultra: uno con SFT sobre 414.890 ejemplos que cubrían no solo respuestas finales sino también verificación, refinamiento y meta-verificación (evaluar si una demostración está completa), y otro con RL sobre 9.597 problemas seleccionados justo en el límite de capacidad del modelo. El sistema combinó ambos especialistas con el modelo general en un bucle que generaba demostraciones candidatas, las puntuaba, producía críticas y refinaba las más prometedoras. Sin usar ningún probador formal, herramientas externas ni internet, el sistema alcanzó 30 puntos sobre 42, superando el umbral oficial de medalla de oro (29 puntos) y resolviendo completamente cuatro de los seis problemas.
Nvidia subraya que estos resultados no provienen solo del entrenamiento ni solo de generar miles de respuestas y elegir la mejor. La clave está en combinar tres elementos: un modelo base potente, especialización dirigida mediante SFT y RL, y un sistema de inferencia (el proceso de usar un modelo ya entrenado para generar respuestas) que puede buscar, verificar y mejorar candidatos. En el caso de IOI, GenCorrect amplificó las mejoras del entrenamiento en varias rondas de feedback. En IMO, usar dos especialistas complementarios (uno mejor en la primera ronda de búsqueda, otro en el resultado global) fue más efectivo que simplemente muestrear más veces un solo modelo.
La compañía ha publicado los modelos especializados, los conjuntos de datos de entrenamiento y los pipelines de inferencia en Hugging Face y en el repositorio NeMo-Skills. Para matemáticas, la colección Nemotron Labs IMO 2026 incluye los checkpoints (versiones guardadas de un modelo en diferentes etapas de entrenamiento) de SFT y RL, ambos datasets y Nemotron-IMO-Bench, un nuevo benchmark (conjunto de problemas estándar para medir rendimiento) con 200 problemas de nivel olimpiada. Para programación competitiva, está disponible el modelo Nemotron-3-Ultra-CC y el detalle completo de la metodología GenCorrect. Nvidia espera que estos recursos permitan a otros investigadores reproducir y ampliar el trabajo, demostrando que un mismo modelo fundacional puede especializarse en dominios muy distintos sin necesidad de empezar desde cero cada vez.


