Como saber se um agente de IA realmente funciona fora do laboratório
Pesquisadores criaram um método para testar assistentes de inteligência artificial em ambientes reais, como navegadores e planilhas, e os resultados mostram que ainda há muito trabalho pela frente.

A maioria dos testes de agentes de IA (programas que executam tarefas de forma autônoma, como preencher formulários ou navegar em sites) acontece em ambientes simulados, onde tudo é controlado e previsível. Mas um grupo de pesquisadores da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) e da Universidade de Cambridge resolveu testar esses assistentes onde eles realmente vão trabalhar: em navegadores de verdade, planilhas do Excel e aplicativos comuns.
O projeto se chama OpenEnv, e funciona assim: em vez de criar um ambiente falso que imita um site ou um programa, os pesquisadores deixam o agente interagir com os aplicativos de verdade — clicando em botões, digitando textos, abrindo abas. Segundo informou a Hugging Face em seu blog oficial, essa abordagem revela problemas que os testes tradicionais não capturam, como lentidão, erros de interface e dificuldade em lidar com pop-ups ou avisos inesperados.
Os resultados não são animadores. Mesmo modelos avançados, como o GPT-4o (um LLM, ou grande modelo de linguagem, da OpenAI), acertaram apenas 36% das tarefas testadas em navegadores reais, contra mais de 60% em ambientes simulados. A diferença está nos detalhes: uma página que demora a carregar, um botão que muda de lugar, um formulário que exige captcha — tudo isso atrapalha agentes treinados em cenários perfeitos.
O OpenEnv não é só um teste, é também uma ferramenta aberta que outros pesquisadores podem usar para avaliar seus próprios agentes. A ideia é criar um padrão de avaliação que reflita o mundo real, não apenas o que funciona em laboratório. Para quem acompanha o mercado de IA, fica o alerta: assistentes virtuais impressionantes em demos controladas ainda tropeçam em tarefas simples quando saem do script.


