En directo
[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia

Un equipo del Allen Institute descubre que los benchmarks actuales evalúan principalmente cuánta información ha memorizado un modelo de lenguaje durante su entrenamiento, no su capacidad real de razonar o resolver problemas nuevos.

Por Redacción2 min
En resumen

Los benchmarks actuales de modelos de lenguaje miden principalmente cuánta información ha memorizado el sistema durante su entrenamiento (entre el 76% y el 91% de la puntuación), no su capacidad real de razonar o resolver problemas nuevos, según un análisis del Allen Institute que examinó 37 tests populares y 28 modelos distintos.

Compartir
Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia
Investigación · Hugging Face Blog

Los tests que usamos para medir la inteligencia de los modelos de lenguaje (los LLM, siglas de large language models, sistemas de IA capaces de generar texto como ChatGPT o Claude) están midiendo sobre todo una cosa: cuántos datos ha visto el modelo durante su entrenamiento. Así lo revela BenchMIRT, una nueva herramienta estadística desarrollada por investigadores del Allen Institute for AI (un centro de investigación sin ánimo de lucro fundado por el cofundador de Microsoft Paul Allen) y publicada en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados).

El equipo analizó 37 benchmarks populares —conjuntos de preguntas o tareas que se usan para evaluar modelos de IA— y 28 modelos de lenguaje distintos. Su conclusión: entre el 76% y el 91% de lo que miden estos tests no es razonamiento ni capacidad de resolver problemas, sino información memorizada. En otras palabras, un modelo que saca mejor nota en MMLU (un test muy usado que incluye preguntas de conocimiento general, matemáticas y ciencias) no es necesariamente más inteligente, simplemente ha visto más ejemplos parecidos durante su fase de entrenamiento.

Esta correlación tan fuerte entre datos de entrenamiento y puntuaciones tiene consecuencias prácticas importantes. Por un lado, explica por qué es tan fácil inflar artificialmente el rendimiento de un modelo: basta con entrenar el sistema con ejemplos muy similares a los que aparecerán después en el test. Por otro, sugiere que muchos de los avances que celebramos como saltos en inteligencia artificial podrían ser, en realidad, saltos en cantidad de datos procesados.

Los investigadores proponen BenchMIRT como una forma de identificar qué benchmarks están contaminados por esta memorización y cuáles miden habilidades más genuinas. La herramienta usa un modelo estadístico llamado MIRT (siglas de multidimensional item response theory, una técnica que originalmente se desarrolló para analizar exámenes educativos) adaptado para modelos de lenguaje. Según el equipo, algunos tests como IFEval (que mide si un modelo sigue instrucciones precisas) y MATH (problemas matemáticos complejos) parecen evaluar capacidades más reales, mientras que otros como HellaSwag (un test de sentido común muy popular) están muy correlacionados con los datos de entrenamiento.

El hallazgo llega en un momento en que la industria debate intensamente cómo medir el progreso real en IA. Empresas como OpenAI, Google y Anthropic presentan regularmente nuevos modelos con puntuaciones récord en estos tests, pero cada vez más voces dentro del sector advierten de que las métricas actuales no capturan lo que realmente importa: la capacidad de un sistema para razonar, generalizar y resolver problemas que nunca ha visto antes. BenchMIRT es un intento de separar lo que es memoria de lo que podría acercarse más a la inteligencia.

Fuente original
Hugging Face Blog
Más en · Investigación