En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Nvidia publica su receta completa para evaluar modelos pequeños de IA

La compañía comparte el proceso exacto que usó para medir el rendimiento de Nemotron 3 Nano, su modelo compacto que funciona en dispositivos sin conexión a internet.

Por Redacción2 min
Compartir
Nvidia publica su receta completa para evaluar modelos pequeños de IA
Investigación · Hugging Face Blog

Nvidia acaba de publicar en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) todos los detalles técnicos de cómo evaluó Nemotron 3 Nano, su modelo de lenguaje pequeño diseñado para funcionar sin conexión en dispositivos como el Jetson Nano (un ordenador compacto y barato pensado para ejecutar IA localmente). La compañía no solo comparte los resultados de las pruebas, sino el proceso completo: qué tests utilizó, cómo los configuró y qué herramientas empleó para medir el rendimiento del modelo.

El documento técnico, que Nvidia llama "receta de evaluación", detalla cómo midieron la capacidad del modelo en tareas como responder preguntas, razonar con lógica matemática o seguir instrucciones complejas. Para hacerlo usaron NeMo Evaluator, su propia herramienta de código abierto que permite ejecutar benchmarks (conjuntos de pruebas estandarizadas para comparar modelos) de forma reproducible. La idea es que cualquier equipo pueda replicar las mismas pruebas con sus propios modelos y obtener resultados comparables.

Lo interesante de esta publicación es que va más allá de simplemente decir "nuestro modelo saca X puntos en Y test". Nvidia explica decisiones técnicas como qué versión exacta de cada benchmark utilizó, cuántos ejemplos incluyó en cada prueba o cómo gestionó casos límite donde el modelo no daba una respuesta clara. Este nivel de transparencia es poco habitual en la industria, donde muchas empresas publican cifras de rendimiento sin compartir cómo las obtuvieron exactamente.

Según informó Hugging Face en su blog, la receta incluye evaluaciones en más de una docena de benchmarks estándar del sector, desde MMLU (que mide conocimientos generales en decenas de disciplinas) hasta GSM8K (problemas matemáticos de nivel escolar). Nvidia también detalla cómo adaptó algunas pruebas pensadas originalmente para modelos grandes (LLMs, modelos de lenguaje con miles de millones de parámetros) para que funcionen con Nemotron 3 Nano, que tiene solo 1.700 millones de parámetros.

La compañía argumenta que compartir estas recetas de evaluación ayuda a estandarizar cómo se miden los modelos pequeños, un segmento que crece rápido porque cada vez más aplicaciones necesitan ejecutar IA directamente en dispositivos móviles, drones o sistemas embebidos sin depender de la nube. Si diferentes equipos usan las mismas pruebas configuradas de la misma manera, los usuarios finales pueden comparar modelos con más confianza y tomar mejores decisiones sobre cuál usar en su proyecto.

Fuente original
Hugging Face Blog
Más en · Investigación