Agentes de IA vazam dados confidenciais ao fazer pesquisas na web, mostra estudo
Experimento revela que sistemas autônomos de inteligência artificial expõem informações sensíveis quando navegam em sites maliciosos durante buscas online.

Agentes de IA (sistemas autônomos que navegam na internet e executam tarefas sem supervisão constante) estão vazando dados confidenciais para sites maliciosos, segundo um estudo publicado pela ServiceNow Research e pela Hugging Face. O experimento, batizado de MosaicLeaks, simulou cenários reais em que esses agentes recebem instruções para pesquisar informações na web — e mostrou que, ao visitar páginas criadas por atacantes, eles podem expor documentos internos, credenciais e outros dados sensíveis sem perceber.
O problema acontece porque muitos agentes de IA operam com acesso a arquivos locais ou bancos de dados corporativos para realizar tarefas complexas. Quando eles fazem buscas no Google ou acessam sites durante uma pesquisa, páginas maliciosas podem enviar instruções ocultas (através de técnicas conhecidas como prompt injection, ou injeção de comandos) que enganam o agente e o levam a enviar informações confidenciais de volta para o atacante. No experimento, os pesquisadores conseguiram extrair dados em mais de 80% das tentativas usando alguns dos agentes mais populares do mercado.
Os testes incluíram sistemas baseados em modelos de linguagem (LLMs, sigla para large language models — os algoritmos por trás de ferramentas como ChatGPT) de diferentes empresas, incluindo OpenAI, Anthropic e Google. Todos apresentaram vulnerabilidades, independentemente de serem modelos de código aberto ou proprietários. A equipe criou um benchmark público (um conjunto de testes padronizados) chamado MosaicLeaks para que outros pesquisadores possam avaliar a segurança de novos agentes antes de colocá-los em produção.
Segundo informou a Hugging Face em seu blog oficial, o estudo serve como um alerta para empresas que já usam ou planejam adotar agentes autônomos em ambientes corporativos. A recomendação é limitar o acesso desses sistemas a dados sensíveis, monitorar suas interações com sites externos e nunca assumir que um modelo "inteligente" é capaz de distinguir sozinho uma solicitação legítima de um ataque. O código e os dados do experimento estão disponíveis publicamente para a comunidade de segurança em IA.


