Por qué un chatbot puede citarte la fuente equivocada aunque el dato sea real
Investigadores de Multiverse Computing presentan ProvenanceGuard, un sistema que verifica no solo si un agente de IA dice algo cierto, sino si lo atribuye a la fuente correcta entre las muchas que consulta.
ProvenanceGuard es un sistema de verificación creado por Multiverse Computing que comprueba si un agente de IA (un chatbot que usa herramientas externas como bases de datos o buscadores) atribuye cada afirmación a la fuente correcta, no solo si el dato es verdadero en alguna de las fuentes consultadas. Detectó correctamente el 99 por ciento de afirmaciones problemáticas en pruebas con un asistente médico real.

Los agentes de inteligencia artificial modernos ya no leen un solo documento para responder. A través del Model Context Protocol o MCP (un estándar que permite a los modelos de lenguaje usar herramientas externas como buscadores, bases de datos o registros médicos), un chatbot puede consultar varias fuentes distintas y combinar toda esa información en una sola respuesta. El problema: la mayoría de sistemas que verifican si una IA dice la verdad comprueban únicamente que el dato exista en alguna de esas fuentes, pero no si la respuesta lo atribuye a la correcta.
Ese fallo puede ser grave en contextos sensibles. Imagina un asistente de atención al cliente que responde: «Según tu ficha de usuario, este plan incluye devolución en 30 días». El plazo de devolución puede ser real, pero aparecer en un documento de política general, no en la ficha del cliente a la que el sistema dice haber consultado. Si juntas todas las fuentes en un solo bloque de texto, el dato parece respaldado. Si las mantienes separadas, la atribución es incorrecta, y en entornos con datos personales o clínicos un error de fuente puede ser tan dañino como un error de hecho.
ProvenanceGuard, un sistema presentado por Multiverse Computing en un artículo publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), aborda precisamente ese vacío. Según informó la empresa, el método detecta lo que llaman «conflación entre fuentes»: afirmaciones verdaderas pero atribuidas a la herramienta equivocada. A diferencia de sistemas de verificación tradicionales como RAGAS, MiniCheck o AlignScore, que mezclan toda la evidencia disponible, ProvenanceGuard mantiene la identidad de cada fuente a lo largo de todo el proceso de revisión.
El sistema funciona como una capa de verificación que se añade después de que el agente genere su respuesta. Primero divide la respuesta en afirmaciones concretas, luego identifica qué fuente es más relevante para cada una, comprueba si esa fuente realmente la respalda y finalmente compara la fuente encontrada con la que el agente nombró o sugirió. Si detecta un problema, puede bloquear la respuesta o intentar repararla automáticamente citando la fuente correcta. En pruebas con 361 afirmaciones de un asistente médico real, ProvenanceGuard detectó 138 de las 139 afirmaciones que expertos humanos consideraron inaceptables, dejando pasar solo una.
La configuración probada por los investigadores usa modelos locales (que funcionan en el propio servidor, sin enviar datos a la nube): MiniLM (un modelo que ayuda a encontrar textos relevantes), DeBERTa NLI (un verificador que comprueba si una fuente respalda una afirmación) y un modelo de lenguaje local para descomponer respuestas. Esta arquitectura puede adaptarse a servicios en la nube según las necesidades de cada equipo, aunque los resultados publicados corresponden a la versión local. El sistema añade aproximadamente medio segundo de revisión por respuesta, un coste asumible en escenarios donde importa más la precisión que la velocidad.
ProvenanceGuard consiguió una puntuación F1 (una medida estadística que equilibra detección de errores y falsos positivos) de 0,802 en bloquear afirmaciones problemáticas, superando a otros verificadores populares en la misma prueba. Además, identificó correctamente la fuente de origen en el 86% de los casos cuando las fuentes eran claramente distintas, aunque esa precisión bajó al 50% cuando las fuentes se parecían mucho entre sí, un área donde el equipo reconoce que queda trabajo por hacer. En una prueba específica donde los investigadores cambiaron deliberadamente la fuente citada en 50 respuestas, ProvenanceGuard detectó las 50 sustituciones, demostrando que puede identificar errores claros de atribución incluso cuando el dato en sí es correcto.


