En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Hugging Face añade métricas de rendimiento independientes a las fichas de sus modelos de IA

La plataforma integra resultados de Every Eval Ever para que cualquiera pueda comparar modelos sin depender solo de las cifras que publican sus creadores.

Por Redacción2 min
Compartir
Hugging Face añade métricas de rendimiento independientes a las fichas de sus modelos de IA
Herramientas · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de integrar en las fichas de sus modelos los resultados de Every Eval Ever, un proyecto que evalúa de forma independiente el rendimiento de los modelos de lenguaje (LLMs, los sistemas de IA que generan texto y responden preguntas). Hasta ahora, quien quería comparar modelos debía confiar principalmente en las métricas que publicaban sus propios creadores, lo que dificultaba saber cuál funcionaba realmente mejor en la práctica.

Every Eval Ever es una iniciativa comunitaria que somete a distintos modelos a las mismas pruebas estandarizadas, desde tareas de razonamiento hasta generación de código, usando hardware y condiciones idénticas. Así se evita el problema habitual de que cada empresa mida el rendimiento de su modelo con sus propios criterios, lo que hace casi imposible comparar manzanas con manzanas. Según informó Hugging Face en su blog oficial, estas evaluaciones aparecerán directamente en las páginas de los modelos, junto a la información sobre su tamaño, licencia y fecha de publicación.

La integración busca que cualquiera pueda tomar decisiones más informadas a la hora de elegir un modelo para su proyecto, sin necesidad de ejecutar pruebas por su cuenta ni interpretar tablas técnicas complejas. Por ahora cubre principalmente modelos de lenguaje de pesos abiertos (modelos cuyo código y parámetros internos están disponibles públicamente para descargar y modificar), que son los más habituales en Hugging Face, aunque la plataforma también aloja modelos de otros tipos, como los que generan imágenes o procesan audio.

Este movimiento llega en un momento en que la industria de la IA enfrenta críticas por la falta de transparencia en cómo se evalúan y comparan los modelos. Muchas empresas publican benchmarks (pruebas de rendimiento estandarizadas) optimizados para que sus propios modelos queden bien, lo que convierte las comparaciones en un ejercicio de marketing más que de rigor técnico. Al incorporar evaluaciones de terceros, Hugging Face refuerza su posición como plataforma neutral y orientada a la comunidad, frente a los ecosistemas cerrados de gigantes como OpenAI o Anthropic.

Fuente original
Hugging Face Blog
Más en · Herramientas