Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog4 min

Novo sistema detecta quando agentes de IA citam a fonte errada

ProvenanceGuard verifica se cada informação numa resposta de agente realmente veio da fonte citada, problema crítico quando sistemas usam múltiplas ferramentas ao mesmo tempo

Por Redação4 min
Em resumo

O ProvenanceGuard é um sistema que verifica se cada afirmação numa resposta de agente de IA veio realmente da fonte que a resposta cita, não apenas se está correta em algum lugar da evidência disponível. Ele mantém separadas as saídas de cada ferramenta MCP (um padrão que permite aos agentes chamar diferentes fontes de dados) e detecta quando uma informação verdadeira é atribuída à fonte errada.

Compartilhar
Novo sistema detecta quando agentes de IA citam a fonte errada
Pesquisa · Hugging Face Blog

Agentes de inteligência artificial que usam ferramentas já não funcionam como buscadores simples. Através do Model Context Protocol, ou MCP (um padrão que permite aos agentes de IA chamar diferentes fontes de dados — busca na web, bancos de dados, registros médicos — numa mesma conversa), um agente pode consultar um prontuário de paciente, pesquisar a literatura médica, puxar metadados de um sistema e juntar tudo numa resposta única. Isso torna a checagem de fatos mais complicada do que parece: a maioria dos sistemas existentes verifica se uma afirmação está apoiada em algum lugar no conjunto de evidências, mas não se ela veio da fonte que a resposta cita.

Um novo artigo publicado pela Multiverse Computing na plataforma Hugging Face (onde desenvolvedores compartilham e baixam modelos de IA já treinados) apresenta o ProvenanceGuard, um sistema que fecha essa lacuna. O problema central é o que os pesquisadores chamam de "conflação entre fontes": uma afirmação verdadeira em algum lugar da evidência, mas atribuída à fonte errada. Imagine um agente de atendimento que responde "segundo o registro da conta, este plano inclui reembolso de 30 dias". A janela de reembolso pode existir de fato, mas estar descrita num documento de política geral, não no registro específico da conta. Se você misturar as duas fontes num bloco só, a afirmação parece sustentada; se mantiver as fontes separadas, a atribuição está errada — e numa situação sensível, uma atribuição errada pode ser tão prejudicial quanto um fato errado.

O ProvenanceGuard funciona como uma camada de verificação que roda depois de o agente produzir a resposta, sem precisar retreinar o agente nem ter acesso ao seu funcionamento interno. Ele lê o rastro de chamadas MCP capturado — incluindo as saídas de cada ferramenta e seus identificadores de fonte — e executa cinco passos: quebra a resposta em afirmações específicas, encontra a fonte mais relevante para cada uma, checa se essa fonte de fato a apoia, compara a fonte identificada com aquela que a resposta nomeia ou sugere, e emite tanto um veredito por afirmação quanto uma decisão global de permitir ou bloquear a resposta. Na configuração testada pelos pesquisadores, o sistema usa modelos locais (que rodam no próprio servidor, sem enviar dados para a nuvem): o MiniLM (um modelo pequeno de busca semântica) ajuda a encontrar a fonte relevante, um verificador baseado em DeBERTa (um modelo treinado para inferência de linguagem natural, ou NLI, que decide se uma frase apoia, contradiz ou é neutra em relação a outra) checa se a fonte apoia a afirmação, e um modelo de linguagem local ajuda a decompor as respostas. O verificador também confere valores literais de perto: um número, data ou identificador ausente da fonte não pode passar só porque a frase soa plausível.

Os testes foram feitos com 281 rastros reais de um agente médico que usava prontuários de pacientes, artigos de pesquisa e outras ferramentas — medicina é um campo útil para testar porque um fato do prontuário e um fato da literatura geral não podem ser tratados como vindos da mesma fonte. Especialistas humanos revisaram 361 afirmações de 40 respostas reservadas para teste. Dos 139 casos que os especialistas disseram que não deveriam passar, o ProvenanceGuard bloqueou 138, deixando apenas um escapar. Também reteve 67 afirmações que os especialistas consideravam apoiadas, refletindo uma calibração conservadora que prefere uma segunda olhada a deixar passar algo sem suporte. Para afirmações com fonte identificável, acertou a fonte correta cerca de 86% das vezes. Quatro outros verificadores existentes — MiniCheck, RAGAS Faithfulness (uma métrica comum de fidelidade em sistemas RAG, sigla para Retrieval-Augmented Generation, ou geração aumentada por recuperação de documentos), AlignScore e SummaC — foram testados nas mesmas afirmações, mas nenhum deles indica qual saída de ferramenta apoiou cada afirmação; o ProvenanceGuard registra essa conexão, permitindo que um revisor veja a fonte checada e a decisão tomada para cada pedaço da resposta.

Quando uma resposta é bloqueada, o sistema pode acionar um loop de reparo inspirado no método RARR (sigla para Retrieve, Attribute, Rewrite, Repeat, um processo que tenta reescrever a resposta usando apenas o que está comprovado nas fontes corretas), que tenta uma revisão fundamentada nas fontes ou recorre a um texto seguro de recusa. Nos testes completos, todas as 173 respostas bloqueadas foram resolvidas, embora 144 tenham terminado em texto de recusa — o sistema escolhendo evitar uma resposta não verificável em vez de fabricar uma. Num teste controlado focado em atribuição errada, onde os pesquisadores trocaram a fonte nomeada em 50 casos mantendo a evidência de apoio intacta, o ProvenanceGuard detectou todas as 50 trocas. Segundo informou a Multiverse Computing no artigo, o custo de processamento é modesto para uso offline: cerca de meio segundo por resposta na configuração local testada.

Fonte original
Hugging Face Blog
Mais em · Pesquisa