Novo sistema detecta quando agentes de IA citam a fonte errada
ProvenanceGuard verifica se cada informação numa resposta de agente realmente veio da fonte citada, problema crítico quando sistemas usam múltiplas ferramentas ao mesmo tempo
O ProvenanceGuard é um sistema que verifica se cada afirmação numa resposta de agente de IA veio realmente da fonte que a resposta cita, não apenas se está correta em algum lugar da evidência disponível. Ele mantém separadas as saídas de cada ferramenta MCP (um padrão que permite aos agentes chamar diferentes fontes de dados) e detecta quando uma informação verdadeira é atribuída à fonte errada.

Agentes de inteligência artificial que usam ferramentas já não funcionam como buscadores simples. Através do Model Context Protocol, ou MCP (um padrão que permite aos agentes de IA chamar diferentes fontes de dados — busca na web, bancos de dados, registros médicos — numa mesma conversa), um agente pode consultar um prontuário de paciente, pesquisar a literatura médica, puxar metadados de um sistema e juntar tudo numa resposta única. Isso torna a checagem de fatos mais complicada do que parece: a maioria dos sistemas existentes verifica se uma afirmação está apoiada em algum lugar no conjunto de evidências, mas não se ela veio da fonte que a resposta cita.
Um novo artigo publicado pela Multiverse Computing na plataforma Hugging Face (onde desenvolvedores compartilham e baixam modelos de IA já treinados) apresenta o ProvenanceGuard, um sistema que fecha essa lacuna. O problema central é o que os pesquisadores chamam de "conflação entre fontes": uma afirmação verdadeira em algum lugar da evidência, mas atribuída à fonte errada. Imagine um agente de atendimento que responde "segundo o registro da conta, este plano inclui reembolso de 30 dias". A janela de reembolso pode existir de fato, mas estar descrita num documento de política geral, não no registro específico da conta. Se você misturar as duas fontes num bloco só, a afirmação parece sustentada; se mantiver as fontes separadas, a atribuição está errada — e numa situação sensível, uma atribuição errada pode ser tão prejudicial quanto um fato errado.
O ProvenanceGuard funciona como uma camada de verificação que roda depois de o agente produzir a resposta, sem precisar retreinar o agente nem ter acesso ao seu funcionamento interno. Ele lê o rastro de chamadas MCP capturado — incluindo as saídas de cada ferramenta e seus identificadores de fonte — e executa cinco passos: quebra a resposta em afirmações específicas, encontra a fonte mais relevante para cada uma, checa se essa fonte de fato a apoia, compara a fonte identificada com aquela que a resposta nomeia ou sugere, e emite tanto um veredito por afirmação quanto uma decisão global de permitir ou bloquear a resposta. Na configuração testada pelos pesquisadores, o sistema usa modelos locais (que rodam no próprio servidor, sem enviar dados para a nuvem): o MiniLM (um modelo pequeno de busca semântica) ajuda a encontrar a fonte relevante, um verificador baseado em DeBERTa (um modelo treinado para inferência de linguagem natural, ou NLI, que decide se uma frase apoia, contradiz ou é neutra em relação a outra) checa se a fonte apoia a afirmação, e um modelo de linguagem local ajuda a decompor as respostas. O verificador também confere valores literais de perto: um número, data ou identificador ausente da fonte não pode passar só porque a frase soa plausível.
Os testes foram feitos com 281 rastros reais de um agente médico que usava prontuários de pacientes, artigos de pesquisa e outras ferramentas — medicina é um campo útil para testar porque um fato do prontuário e um fato da literatura geral não podem ser tratados como vindos da mesma fonte. Especialistas humanos revisaram 361 afirmações de 40 respostas reservadas para teste. Dos 139 casos que os especialistas disseram que não deveriam passar, o ProvenanceGuard bloqueou 138, deixando apenas um escapar. Também reteve 67 afirmações que os especialistas consideravam apoiadas, refletindo uma calibração conservadora que prefere uma segunda olhada a deixar passar algo sem suporte. Para afirmações com fonte identificável, acertou a fonte correta cerca de 86% das vezes. Quatro outros verificadores existentes — MiniCheck, RAGAS Faithfulness (uma métrica comum de fidelidade em sistemas RAG, sigla para Retrieval-Augmented Generation, ou geração aumentada por recuperação de documentos), AlignScore e SummaC — foram testados nas mesmas afirmações, mas nenhum deles indica qual saída de ferramenta apoiou cada afirmação; o ProvenanceGuard registra essa conexão, permitindo que um revisor veja a fonte checada e a decisão tomada para cada pedaço da resposta.
Quando uma resposta é bloqueada, o sistema pode acionar um loop de reparo inspirado no método RARR (sigla para Retrieve, Attribute, Rewrite, Repeat, um processo que tenta reescrever a resposta usando apenas o que está comprovado nas fontes corretas), que tenta uma revisão fundamentada nas fontes ou recorre a um texto seguro de recusa. Nos testes completos, todas as 173 respostas bloqueadas foram resolvidas, embora 144 tenham terminado em texto de recusa — o sistema escolhendo evitar uma resposta não verificável em vez de fabricar uma. Num teste controlado focado em atribuição errada, onde os pesquisadores trocaram a fonte nomeada em 50 casos mantendo a evidência de apoio intacta, o ProvenanceGuard detectou todas as 50 trocas. Segundo informou a Multiverse Computing no artigo, o custo de processamento é modesto para uso offline: cerca de meio segundo por resposta na configuração local testada.


