
Hugging Face lança padrão para medir busca em modelos de IA
RTEB é um novo conjunto de testes que permite comparar diferentes sistemas de recuperação de informação — a tecnologia por trás de chatbots que citam fontes e buscadores inteligentes.
Notícias.
Inteligência Artificial
Inteligência Artificial para Gente de Verdade · ES / PT-BR

RTEB é um novo conjunto de testes que permite comparar diferentes sistemas de recuperação de informação — a tecnologia por trás de chatbots que citam fontes e buscadores inteligentes.

Pesquisadores criam Alyah, conjunto de testes que avalia se grandes modelos de linguagem conseguem lidar com o árabe falado nos Emirados — e a maioria falha.

AssetOpsBench é um novo benchmark que avalia se agentes de IA conseguem diagnosticar falhas em equipamentos industriais, não apenas responder perguntas genéricas.

Novo benchmark revela que mesmo os modelos mais avançados acertam menos de 40% das tarefas em ambientes empresariais reais.

Benchmark criado pela IBM mostra que mesmo os melhores modelos de linguagem falham em tarefas simples quando precisam usar ferramentas ou raciocinar em várias etapas.

O ScarfBench avalia se modelos de linguagem são capazes de migrar aplicações Java legadas para frameworks modernos — uma tarefa que consome meses de trabalho humano.
Usamos cookies de análise (Google Analytics) para entender quais artigos interessam. Só são ativadas se você aceitar. Saiba mais sobre privacidade