Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog3 min

O agente de IA disse que terminou. O banco de dados discordou.

Microsoft lança ferramenta que avalia agentes de IA não pelo que dizem, mas pelo rastro que deixam nos sistemas — e descobriu que a maioria erra quando precisa repetir a mesma tarefa vinte vezes seguidas

Por Redação3 min
Em resumo

A Microsoft lançou a ThinkingBox, ferramenta que avalia agentes de IA verificando o estado final que deixam em bancos de dados e sistemas reais (tickets, pedidos, registros), não apenas as respostas que geram. Testando 507 tarefas repetidas vinte vezes, descobriu que a maioria dos modelos falha em manter consistência, mesmo quando acerta pontualmente.

Compartilhar
O agente de IA disse que terminou. O banco de dados discordou.
Ferramentas · Hugging Face Blog

Uma cliente escreve para o suporte: seu eletrodoméstico de 745 dólares está parado há quinze dias em um centro de distribuição. O agente de IA faz nove chamadas de ferramentas — consulta o pedido, verifica o rastreamento, lê a política de reembolso, abre um ticket de suporte — e responde que o problema está resolvido. Só que não está: a transportadora ainda registra uma exceção aberta, e a cliente não recebeu resposta real sobre o que vai acontecer com a encomenda. Um sistema de avaliação tradicional veria nove chamadas bem-formadas e nenhum erro técnico. O banco de dados, porém, mostra o contrário: o status do ticket ficou marcado como "resolvido" quando deveria estar "aguardando solução".

Esse tipo de falha é o que a ThinkingBox (uma nova ferramenta de avaliação da Microsoft, agora disponível pelo Hugging Face, plataforma onde desenvolvedores compartilham modelos de IA já treinados) quer detectar. Em vez de verificar se o agente escreveu frases coerentes ou fez chamadas de API (comandos que um programa envia para acessar funções de outro sistema) corretas, ela verifica o estado final dos sistemas reais: bancos de dados, tickets de suporte, registros de pedidos. A ferramenta roda 507 tarefas típicas de setores como varejo, seguros e bancos digitais — e repete cada uma vinte vezes, partindo sempre do zero, para medir não só se o modelo consegue acertar uma vez, mas se consegue acertar sempre.

Os resultados mostram uma distância grande entre capacidade pontual e confiabilidade. O Claude Opus 5.5 (um dos modelos de linguagem da Anthropic) teve a melhor taxa geral: acertou 67% das tarefas na primeira tentativa. Quando o teste exigiu vinte acertos consecutivos, porém, apenas 71% daquela taxa inicial se manteve. Modelos como o GLM-5.1 e o DeepSeek-V4-Pro mantiveram cerca de 8%. Em 121.680 tentativas válidas, quase 80 mil falharam nas verificações executáveis — e dessas, 67% terminaram sem reportar erro, fizeram chamadas que modificaram estado e ainda assim deixaram valores errados (77% dos casos), efeitos colaterais indesejados (43%) ou ações obrigatórias não realizadas (25%).

A ferramenta usa o OpenEnv (um framework, ou estrutura de software, que simula ambientes isolados para cada teste) e o protocolo MCP (Model Context Protocol, padrão que permite que modelos de IA interajam com ferramentas externas de forma controlada). Cada tarefa gera uma "sessão" limpa — banco de dados próprio, APIs próprias — e, ao final, a ThinkingBox compara o estado deixado pelo agente com o estado esperado, campo por campo. O exemplo do ticket de suporte mal resolvido está documentado no artigo científico que acompanha o lançamento, e qualquer um pode rodar o teste completo: o código é aberto e está integrado ao Hugging Face.

O que a Microsoft chama de "observed 20/20" — tarefas que passaram nas vinte tentativas — é o número que importa para quem precisa colocar um agente em produção. Porque uma taxa de acerto de 80% na primeira rodada não significa que o sistema funciona oito em cada dez vezes: significa que ele às vezes funciona, e às vezes falha de modos que você só descobre depois. A ThinkingBox mede justamente isso: a diferença entre o que um modelo consegue fazer e o que ele faz de forma consistente.

Fonte original
Hugging Face Blog
Mais em · Ferramentas