Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade
O BenchMIRT mapeia quais habilidades cognitivas estão por trás de cada pergunta dos benchmarks mais usados para avaliar modelos de linguagem, revelando que muitos testes medem as mesmas capacidades repetidas vezes.
O BenchMIRT é uma ferramenta criada pelo Allen Institute for AI que mapeia quais habilidades cognitivas cada pergunta dos principais benchmarks (conjuntos de testes padronizados) de modelos de linguagem está medindo, usando teoria de resposta ao item. Ela revelou que muitos testes populares avaliam capacidades semelhantes, apesar de serem apresentados como diferentes.

Quando uma empresa anuncia que seu novo modelo de inteligência artificial teve desempenho recorde em determinado benchmark (um conjunto padronizado de perguntas usado para testar modelos de IA), o que isso significa na prática? Pesquisadores do Allen Institute for AI, segundo informou o blog oficial da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), acabam de lançar uma ferramenta que responde justamente a essa pergunta: o BenchMIRT.
O projeto parte de uma constatação simples: ninguém sabe ao certo quais habilidades cognitivas cada benchmark está medindo. Um modelo pode ir bem em matemática porque é bom em raciocínio lógico, porque memorizou fórmulas ou porque entende bem linguagem natural — e até agora não havia forma sistemática de separar essas capacidades. O BenchMIRT usa a teoria de resposta ao item (IRT, na sigla em inglês — um método estatístico originalmente desenvolvido para testes educacionais) para mapear, pergunta por pergunta, qual habilidade está sendo avaliada.
Os resultados iniciais mostram que muitos benchmarks populares medem as mesmas coisas. O MMLU (Massive Multitask Language Understanding, um teste com perguntas de múltipla escolha sobre dezenas de temas) e o ARC (AI2 Reasoning Challenge, focado em raciocínio científico), por exemplo, têm sobreposição considerável nas habilidades testadas, apesar de serem apresentados como complementares. Isso ajuda a explicar por que modelos que vão bem em um costumam ir bem no outro — e por que melhorar a pontuação em vários benchmarks ao mesmo tempo nem sempre significa que o modelo ficou mais capaz de fato.
A ferramenta está disponível publicamente e permite que qualquer pessoa explore os dados: você pode filtrar benchmarks por tipo de habilidade, ver quais perguntas medem raciocínio abstrato, compreensão de texto ou conhecimento factual, e comparar a dificuldade real de cada item. Para quem desenvolve modelos, isso significa poder escolher benchmarks que testem exatamente o que interessa; para quem acompanha o setor, é uma forma de entender melhor o que os números divulgados pelas empresas realmente indicam.


