Cuando la IA acierta en el hecho pero culpa a la fuente equivocada, esta nueva herramienta lo detecta
ProvenanceGuard apunta a un punto ciego en la verificación de hechos de la IA: una afirmación puede ser verdadera y aun así estar falsamente atribuida. En pruebas médicas, detectó 138 de 139 afirmaciones que deberían haber sido bloqueadas.

Puntos clave
- ProvenanceGuard detectó 138 de 139 afirmaciones que expertos humanos dijeron que deberían bloquearse, en 361 ejemplos verificados manualmente extraídos de resultados de agentes de IA médica.
- La herramienta aborda la "conflación entre fuentes", un fallo donde la respuesta de una IA es factualmente correcta pero acredita la fuente equivocada, algo que los verificadores de hechos estándar no detectan.
- En la prueba principal de retención, ProvenanceGuard obtuvo 0.802 en la métrica que equilibra la detección de afirmaciones malas con el bloqueo de las buenas, superando a cuatro verificadores rivales incluyendo MiniCheck (0.783) y RAGAS Faithfulness (0.758).
- Se ejecuta en aproximadamente medio segundo por respuesta en la configuración probada, lo que la hace práctica como puerta de revisión sin conexión.
Imagina preguntarle a un asistente de IA sobre tu plan de salud y obtener una respuesta segura: "Según tu historial de paciente, este medicamento se recomienda para tu condición". El detalle podría aparecer en realidad en un artículo de investigación que la IA también leyó, no en tu registro personal en absoluto. El hecho es real, el crédito es incorrecto, y casi todas las herramientas diseñadas para detectar errores de IA lo pasarían de todas formas.
Ese es el problema que un nuevo sistema llamado ProvenanceGuard fue construido para solucionar. Los investigadores publicaron el trabajo esta semana en arXiv, y también fue destacado por Hugging Face.
¿Por qué importa mezclar las fuentes?
Importa más cuando la fuente tiene peso legal o clínico. Una atribución incorrecta no es solo descuidada; puede llevar a un clínico o a un paciente al lugar equivocado para verificación, con consecuencias que un error factual simple podría no conllevar.
Los asistentes de IA funcionan cada vez más extrayendo información de varios lugares a la vez, utilizando un estándar llamado Protocolo de Contexto del Modelo, o MCP, que permite a una IA llamar a una herramienta de búsqueda, una base de datos, un sistema de registro de pacientes y otras fuentes de una sola vez, y luego unir los resultados en una sola respuesta. La mayoría de las herramientas de verificación de hechos agrupan toda esa evidencia antes de probar si la respuesta se sostiene. Agrupar las fuentes y el problema de atribución incorrecta desaparece de la vista: el hecho está respaldado en algún lugar, por lo que el verificador lo aprueba.
Los investigadores llaman a este modo de fallo "conflación entre fuentes". Primero cubrimos comportamiento de agentes relacionados con MCP el 14 de julio de 2026, y nuestra historia sobre la integración del agente de hogar inteligente de Google la semana pasada mostró cuán rápidamente estos conductos de múltiples fuentes están llegando a usuarios ordinarios.
| Verificador | Puntuación F1 de bloqueo/rechazo | ¿Rastrea la fuente? |
|---|---|---|
| ProvenanceGuard | 0.802 | Sí |
| MiniCheck | 0.783 | No |
| RAGAS Faithfulness | 0.758 | No |
| AlignScore | 0.662 | No |
| SummaC-ZS | 0.436 | No |
La puntuación F1 aquí es un número único, que oscila entre 0 y 1, que captura qué tan bien un sistema detecta afirmaciones malas sin bloquear demasiadas buenas. Más alto es mejor.
¿Cómo funciona realmente ProvenanceGuard?
Se coloca encima de un agente de IA existente y verifica respuestas después de que se producen, sin reentrenar nada. Cada fuente permanece etiquetada por separado en todo momento. El sistema luego ejecuta cinco pasos: dividir la respuesta en afirmaciones individuales, encontrar la fuente más relevante para cada una, verificar si esa fuente realmente respalda la afirmación, compararla con cualquier fuente que la respuesta nombre, y emitir un veredicto para permitir o bloquear la respuesta.
Las respuestas bloqueadas no simplemente desaparecen. Un paso de reparación, basado en una técnica llamada RARR (Retrofit Attribution using Research and Revision, originalmente descrita aquí), intenta una reescritura fundamentada en la fuente correcta. Cuando no es posible una reescritura confiable, el sistema genera un texto de seguridad en lugar de adivinar.
En la ejecución de prueba completa de 173 respuestas bloqueadas, todas se resolvieron, aunque 144 terminaron como texto de alternativa cautelosa. Los investigadores tratan eso como el sistema funcionando correctamente: una no-respuesta es mejor que una confidentemente incorrecta.
¿Qué deberían aprender los usuarios ordinarios?
Si utilizas una herramienta de IA que extrae de varias fuentes de datos, como una aplicación de salud, un bot de servicio al cliente, o un asistente financiero, el sistema tal como está construido probablemente no pueda decirte qué fuente respalda cada cosa que dice. ProvenanceGuard es un paso hacia herramientas que puedan.
Es un documento de investigación, no un producto terminado. Pero detectar 138 de 139 afirmaciones que expertos dijeron que deberían fallar, mientras se elige la fuente correcta el 86% de las veces, la pone significativamente por delante de las herramientas estándar actuales en el problema específico para el que fue diseñada.
El desafío más difícil, distinguir entre dos fuentes muy similares, permanece abierto: la precisión de identificación de fuentes bajó al 50,3% cuando las fuentes se parecían mucho entre sí. Esa salvedad importa en contextos clínicos, donde dos estudios sobre el mismo fármaco pueden verse casi idénticos a un sistema automatizado. Nuestra historia del vigilante del NHS del 31 de agosto mostró lo que sucede cuando los errores de IA clínica no se comprueban a nivel de fuente.
El problema de atribución que ProvenanceGuard aborda es uno que el campo ha estado ignorando en gran medida mientras debate otros tipos de errores de IA. Acertar en la fuente, no solo en el hecho, es donde está la próxima batalla por la confiabilidad.



