Nvidia publica su receta completa para evaluar modelos pequeños de IA
La compañía comparte el proceso exacto que usó para medir el rendimiento de Nemotron 3 Nano, su modelo compacto que funciona en dispositivos sin conexión a internet.

Nvidia acaba de publicar en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) todos los detalles técnicos de cómo evaluó Nemotron 3 Nano, su modelo de lenguaje pequeño diseñado para funcionar sin conexión en dispositivos como el Jetson Nano (un ordenador compacto y barato pensado para ejecutar IA localmente). La compañía no solo comparte los resultados de las pruebas, sino el proceso completo: qué tests utilizó, cómo los configuró y qué herramientas empleó para medir el rendimiento del modelo.
El documento técnico, que Nvidia llama "receta de evaluación", detalla cómo midieron la capacidad del modelo en tareas como responder preguntas, razonar con lógica matemática o seguir instrucciones complejas. Para hacerlo usaron NeMo Evaluator, su propia herramienta de código abierto que permite ejecutar benchmarks (conjuntos de pruebas estandarizadas para comparar modelos) de forma reproducible. La idea es que cualquier equipo pueda replicar las mismas pruebas con sus propios modelos y obtener resultados comparables.
Lo interesante de esta publicación es que va más allá de simplemente decir "nuestro modelo saca X puntos en Y test". Nvidia explica decisiones técnicas como qué versión exacta de cada benchmark utilizó, cuántos ejemplos incluyó en cada prueba o cómo gestionó casos límite donde el modelo no daba una respuesta clara. Este nivel de transparencia es poco habitual en la industria, donde muchas empresas publican cifras de rendimiento sin compartir cómo las obtuvieron exactamente.
Según informó Hugging Face en su blog, la receta incluye evaluaciones en más de una docena de benchmarks estándar del sector, desde MMLU (que mide conocimientos generales en decenas de disciplinas) hasta GSM8K (problemas matemáticos de nivel escolar). Nvidia también detalla cómo adaptó algunas pruebas pensadas originalmente para modelos grandes (LLMs, modelos de lenguaje con miles de millones de parámetros) para que funcionen con Nemotron 3 Nano, que tiene solo 1.700 millones de parámetros.
La compañía argumenta que compartir estas recetas de evaluación ayuda a estandarizar cómo se miden los modelos pequeños, un segmento que crece rápido porque cada vez más aplicaciones necesitan ejecutar IA directamente en dispositivos móviles, drones o sistemas embebidos sin depender de la nube. Si diferentes equipos usan las mismas pruebas configuradas de la misma manera, los usuarios finales pueden comparar modelos con más confianza y tomar mejores decisiones sobre cuál usar en su proyecto.


