Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog1 min

Como saber se um agente de IA realmente funciona fora do laboratório

Pesquisadores criaram um método para testar assistentes de inteligência artificial em ambientes reais, como navegadores e planilhas, e os resultados mostram que ainda há muito trabalho pela frente.

Por Redação1 min
Compartilhar
Como saber se um agente de IA realmente funciona fora do laboratório
Pesquisa · Hugging Face Blog

A maioria dos testes de agentes de IA (programas que executam tarefas de forma autônoma, como preencher formulários ou navegar em sites) acontece em ambientes simulados, onde tudo é controlado e previsível. Mas um grupo de pesquisadores da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) e da Universidade de Cambridge resolveu testar esses assistentes onde eles realmente vão trabalhar: em navegadores de verdade, planilhas do Excel e aplicativos comuns.

O projeto se chama OpenEnv, e funciona assim: em vez de criar um ambiente falso que imita um site ou um programa, os pesquisadores deixam o agente interagir com os aplicativos de verdade — clicando em botões, digitando textos, abrindo abas. Segundo informou a Hugging Face em seu blog oficial, essa abordagem revela problemas que os testes tradicionais não capturam, como lentidão, erros de interface e dificuldade em lidar com pop-ups ou avisos inesperados.

Os resultados não são animadores. Mesmo modelos avançados, como o GPT-4o (um LLM, ou grande modelo de linguagem, da OpenAI), acertaram apenas 36% das tarefas testadas em navegadores reais, contra mais de 60% em ambientes simulados. A diferença está nos detalhes: uma página que demora a carregar, um botão que muda de lugar, um formulário que exige captcha — tudo isso atrapalha agentes treinados em cenários perfeitos.

O OpenEnv não é só um teste, é também uma ferramenta aberta que outros pesquisadores podem usar para avaliar seus próprios agentes. A ideia é criar um padrão de avaliação que reflita o mundo real, não apenas o que funciona em laboratório. Para quem acompanha o mercado de IA, fica o alerta: assistentes virtuais impressionantes em demos controladas ainda tropeçam em tarefas simples quando saem do script.

Fonte original
Hugging Face Blog
Mais em · Pesquisa