El instituto de seguridad de IA del Reino Unido publica sus resultados de evaluación en abierto
UK AISI comparte los datos completos de sus pruebas con modelos como GPT-5 y Claude Opus 4, usando un formato estándar que permite reproducir y verificar los experimentos
UK AISI (el instituto de seguridad en IA del gobierno británico) ha publicado los datos completos de sus pruebas con seis modelos de última generación, incluyendo GPT-5 y Claude Opus 4, usando Evaluation Cards (una plataforma abierta de Hugging Face). Los resultados incluyen información técnica suficiente para reproducir los experimentos, algo poco habitual hasta ahora en el sector.

El instituto británico de seguridad en IA (UK AISI, una agencia de investigación del gobierno del Reino Unido dedicada a estudiar los riesgos de la inteligencia artificial avanzada) ha empezado a publicar los resultados completos de sus evaluaciones de modelos usando Evaluation Cards, una plataforma abierta que recopila datos de pruebas con un formato común. La iniciativa forma parte de una colaboración con la coalición EvalEval, un grupo de investigación que busca hacer más reproducibles las evaluaciones de IA.
Según informó Hugging Face, la plataforma donde se alojan estas tarjetas de evaluación, el problema actual es que los resultados de las pruebas a modelos de lenguaje (LLMs, sistemas de IA que generan y entienden texto) se publican en formatos dispersos y a menudo sin suficiente información para repetir los experimentos. Además, volver a ejecutar estas pruebas puede resultar prohibitivamente caro, lo que dificulta verificar los hallazgos de forma independiente.
Los primeros datos publicados incluyen resultados verificados de seis modelos de última generación (Claude Opus 4, 4.5 y 4.6 de Anthropic, junto con GPT-5, 5.2 y 5.4 de OpenAI) en cinco pruebas de referencia: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro y Terminal-Bench 2.0. También se han compartido dos evaluaciones adicionales de ciberseguridad. Los datos acompañan a un estudio de AISI que analiza cómo el rendimiento en estas pruebas depende del tiempo de cómputo dedicado a generar respuestas y del protocolo de evaluación utilizado.
La investigación reveló, por ejemplo, que el rendimiento en Humanity's Last Exam varía significativamente según se le dé al modelo información sobre si sus respuestas son correctas tras cada intento. Con esa retroalimentación (feedback), los modelos seguían resolviendo tareas adicionales a medida que usaban más tokens (las unidades en que los LLMs dividen el texto para procesarlo). Esta transparencia permite a otros investigadores entender mejor cómo las decisiones de configuración influyen en los resultados reportados.
La coalición EvalEval impulsa el esquema Every Eval Ever (EEE), un formato común para documentar no solo las puntuaciones finales sino también los detalles técnicos necesarios para interpretar y reproducir las evaluaciones. Según los responsables del proyecto, cuando más organizaciones adopten este estándar, será posible comparar resultados de forma más fiable y hacer metainvestigación sobre el estado real de las capacidades de los modelos, algo especialmente relevante para reguladores y gobiernos que deben tomar decisiones sobre despliegues de IA.


