Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia
Un equipo del Allen Institute descubre que los benchmarks actuales evalúan principalmente cuánta información ha memorizado un modelo de lenguaje durante su entrenamiento, no su capacidad real de razonar o resolver problemas nuevos.
Los benchmarks actuales de modelos de lenguaje miden principalmente cuánta información ha memorizado el sistema durante su entrenamiento (entre el 76% y el 91% de la puntuación), no su capacidad real de razonar o resolver problemas nuevos, según un análisis del Allen Institute que examinó 37 tests populares y 28 modelos distintos.

Los tests que usamos para medir la inteligencia de los modelos de lenguaje (los LLM, siglas de large language models, sistemas de IA capaces de generar texto como ChatGPT o Claude) están midiendo sobre todo una cosa: cuántos datos ha visto el modelo durante su entrenamiento. Así lo revela BenchMIRT, una nueva herramienta estadística desarrollada por investigadores del Allen Institute for AI (un centro de investigación sin ánimo de lucro fundado por el cofundador de Microsoft Paul Allen) y publicada en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados).
El equipo analizó 37 benchmarks populares —conjuntos de preguntas o tareas que se usan para evaluar modelos de IA— y 28 modelos de lenguaje distintos. Su conclusión: entre el 76% y el 91% de lo que miden estos tests no es razonamiento ni capacidad de resolver problemas, sino información memorizada. En otras palabras, un modelo que saca mejor nota en MMLU (un test muy usado que incluye preguntas de conocimiento general, matemáticas y ciencias) no es necesariamente más inteligente, simplemente ha visto más ejemplos parecidos durante su fase de entrenamiento.
Esta correlación tan fuerte entre datos de entrenamiento y puntuaciones tiene consecuencias prácticas importantes. Por un lado, explica por qué es tan fácil inflar artificialmente el rendimiento de un modelo: basta con entrenar el sistema con ejemplos muy similares a los que aparecerán después en el test. Por otro, sugiere que muchos de los avances que celebramos como saltos en inteligencia artificial podrían ser, en realidad, saltos en cantidad de datos procesados.
Los investigadores proponen BenchMIRT como una forma de identificar qué benchmarks están contaminados por esta memorización y cuáles miden habilidades más genuinas. La herramienta usa un modelo estadístico llamado MIRT (siglas de multidimensional item response theory, una técnica que originalmente se desarrolló para analizar exámenes educativos) adaptado para modelos de lenguaje. Según el equipo, algunos tests como IFEval (que mide si un modelo sigue instrucciones precisas) y MATH (problemas matemáticos complejos) parecen evaluar capacidades más reales, mientras que otros como HellaSwag (un test de sentido común muy popular) están muy correlacionados con los datos de entrenamiento.
El hallazgo llega en un momento en que la industria debate intensamente cómo medir el progreso real en IA. Empresas como OpenAI, Google y Anthropic presentan regularmente nuevos modelos con puntuaciones récord en estos tests, pero cada vez más voces dentro del sector advierten de que las métricas actuales no capturan lo que realmente importa: la capacidad de un sistema para razonar, generalizar y resolver problemas que nunca ha visto antes. BenchMIRT es un intento de separar lo que es memoria de lo que podría acercarse más a la inteligencia.


