Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade

O BenchMIRT mapeia quais habilidades cognitivas estão por trás de cada pergunta dos benchmarks mais usados para avaliar modelos de linguagem, revelando que muitos testes medem as mesmas capacidades repetidas vezes.

Por Redação2 min
Em resumo

O BenchMIRT é uma ferramenta criada pelo Allen Institute for AI que mapeia quais habilidades cognitivas cada pergunta dos principais benchmarks (conjuntos de testes padronizados) de modelos de linguagem está medindo, usando teoria de resposta ao item. Ela revelou que muitos testes populares avaliam capacidades semelhantes, apesar de serem apresentados como diferentes.

Compartilhar
Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade
Pesquisa · Hugging Face Blog

Quando uma empresa anuncia que seu novo modelo de inteligência artificial teve desempenho recorde em determinado benchmark (um conjunto padronizado de perguntas usado para testar modelos de IA), o que isso significa na prática? Pesquisadores do Allen Institute for AI, segundo informou o blog oficial da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), acabam de lançar uma ferramenta que responde justamente a essa pergunta: o BenchMIRT.

O projeto parte de uma constatação simples: ninguém sabe ao certo quais habilidades cognitivas cada benchmark está medindo. Um modelo pode ir bem em matemática porque é bom em raciocínio lógico, porque memorizou fórmulas ou porque entende bem linguagem natural — e até agora não havia forma sistemática de separar essas capacidades. O BenchMIRT usa a teoria de resposta ao item (IRT, na sigla em inglês — um método estatístico originalmente desenvolvido para testes educacionais) para mapear, pergunta por pergunta, qual habilidade está sendo avaliada.

Os resultados iniciais mostram que muitos benchmarks populares medem as mesmas coisas. O MMLU (Massive Multitask Language Understanding, um teste com perguntas de múltipla escolha sobre dezenas de temas) e o ARC (AI2 Reasoning Challenge, focado em raciocínio científico), por exemplo, têm sobreposição considerável nas habilidades testadas, apesar de serem apresentados como complementares. Isso ajuda a explicar por que modelos que vão bem em um costumam ir bem no outro — e por que melhorar a pontuação em vários benchmarks ao mesmo tempo nem sempre significa que o modelo ficou mais capaz de fato.

A ferramenta está disponível publicamente e permite que qualquer pessoa explore os dados: você pode filtrar benchmarks por tipo de habilidade, ver quais perguntas medem raciocínio abstrato, compreensão de texto ou conhecimento factual, e comparar a dificuldade real de cada item. Para quem desenvolve modelos, isso significa poder escolher benchmarks que testem exatamente o que interessa; para quem acompanha o setor, é uma forma de entender melhor o que os números divulgados pelas empresas realmente indicam.

Fonte original
Hugging Face Blog
Mais em · Pesquisa