En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Hugging Face cambia cómo evalúa los mejores modelos de IA para frenar las trampas

La plataforma introduce Math-Verify, un sistema que obliga a los modelos a mostrar su razonamiento paso a paso antes de dar una respuesta, haciendo mucho más difícil inflar artificialmente las puntuaciones.

Por Redacción2 min
Compartir
Hugging Face cambia cómo evalúa los mejores modelos de IA para frenar las trampas
Modelos de IA · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y comparan modelos de inteligencia artificial) acaba de cambiar las reglas de su tabla de clasificación de modelos de lenguaje. El motivo: demasiados equipos estaban inflando artificialmente las puntuaciones de sus modelos para parecer mejores de lo que realmente son. La solución se llama Math-Verify, y obliga a los modelos a enseñar cómo llegan a una respuesta antes de poder darla por buena.

Hasta ahora, muchos modelos conseguían puntuaciones altas en problemas matemáticos simplemente memorizando las respuestas de los conjuntos de datos de entrenamiento (las colecciones de ejemplos que se usan para enseñar a los modelos), o generando cientos de respuestas hasta que una coincidiera con la correcta por pura probabilidad. Math-Verify corta este atajo: ahora los modelos deben explicar su razonamiento paso a paso usando un lenguaje formal de matemáticas llamado Lean (un sistema que permite verificar automáticamente si una demostración matemática es correcta o no).

Según explica Hugging Face en su blog oficial, el cambio es radical. Con el sistema antiguo, modelos pequeños llegaban a alcanzar puntuaciones del 90% en ciertos tests matemáticos. Con Math-Verify, esas mismas puntuaciones bajan al 30-40%, revelando que muchos aciertos anteriores eran en realidad producto de atajos y sobreajuste (cuando un modelo aprende a resolver los ejemplos de entrenamiento de memoria, pero falla con problemas nuevos). Los modelos que sí razonan de verdad, en cambio, mantienen o incluso mejoran sus resultados.

La medida llega después de meses de quejas en la comunidad de desarrolladores de IA. Muchos denunciaban que la Open LLM Leaderboard (la tabla de clasificación de modelos de lenguaje de código abierto de Hugging Face) se había convertido en una carrera por trucar las métricas en lugar de medir capacidades reales. El nuevo sistema no solo hace más difícil hacer trampas, sino que premia a los modelos capaces de razonar matemáticamente de forma verificable, una habilidad mucho más útil en aplicaciones reales.

Math-Verify ya está activo en la versión 3 de la Open LLM Leaderboard. Hugging Face ha publicado además el código y los conjuntos de datos usados para que cualquier desarrollador pueda reproducir las evaluaciones por su cuenta. La idea es que otras plataformas y organizaciones adopten sistemas similares, elevando los estándares de evaluación en toda la industria de modelos de código abierto.

Fuente original
Hugging Face Blog
Más en · Modelos de IA