Evaluación de RAG: cómo detectar fuentes que no son aplicables

Un RAG puede citar fielmente una norma obsoleta. Cómo separar recuperación, fidelidad y vigencia al evaluar respuestas sobre documentos internos.

La respuesta tiene una cita. Al abrirla, el documento existe y dice exactamente lo que ha resumido el asistente. Todo parece correcto hasta que alguien advierte que esa política dejó de aplicarse hace seis meses.

En este ejemplo hipotético, el modelo no necesitó inventar nada para equivocarse. Le bastó con seguir fielmente una fuente que ya no correspondía. Esa posibilidad cambia la evaluación de los asistentes que responden sobre documentación interna.

¿Puede un RAG citar bien y responder mal?

Sí. Una respuesta puede ser fiel al documento recuperado y, aun así, resultar incorrecta para la fecha, el producto o la situación consultados. RAG, la generación aumentada mediante recuperación, aporta documentos al contexto del modelo. Esa recuperación necesita encontrar información relevante, pero la relevancia textual no demuestra por sí sola su vigencia o aplicabilidad.

La tesis aquí es concreta: antes de confiar en la fidelidad de la respuesta, necesitamos establecer por qué su fuente tiene autoridad para esa pregunta. De lo contrario, podemos optimizar un sistema hasta que seleccione con enorme consistencia la versión equivocada.

Ya tratamos el problema de las citas en buscadores con IA. En un repositorio corporativo aparece otra responsabilidad: la empresa controla, al menos en parte, las versiones que conserva y las relaciones entre ellas. Tener una cita verificable abre la revisión, pero no la termina.

Recuperación, fidelidad y aplicabilidad responden a preguntas distintas

Microsoft distingue en sus evaluadores de RAG la calidad de recuperación, la fidelidad al contexto, la relevancia de la respuesta y su completitud. La fidelidad examina si la respuesta está respaldada por el contexto recibido. Esa separación ayuda a localizar fallos en lugar de resumir todo como «el modelo alucina».

Para el problema de este artículo necesitamos hacer explícita una distinción adicional:

Recuperación
La búsqueda encuentra la información necesaria para responder. Si el documento adecuado queda fuera, el generador puede carecer de la evidencia que necesita.
Fidelidad
La respuesta respeta lo que dice el contexto. Una conclusión añadida sin respaldo puede fallar aquí aunque el documento sea correcto.
Aplicabilidad
La fuente corresponde a la entidad, versión, fecha y supuesto de la pregunta. Una norma derogada puede estar bien recuperada por similitud y bien resumida, pero no servir para una decisión actual.

La aplicabilidad es el criterio analítico que propongo añadir, no el nombre de una nueva función del proveedor. Tampoco sustituye a los permisos de acceso: una fuente puede ser vigente y relevante sin que el usuario esté autorizado a verla. Son condiciones diferentes.

Una mejora del 67 % necesita su denominador

Hay avances técnicos valiosos en recuperación. En septiembre de 2024, Anthropic publicó su evaluación de Contextual Retrieval. Al combinar contextualización, búsqueda léxica y reranking, comunicó una reducción del fallo de recuperación del 5,7 % al 1,9 %: aproximadamente un 67 % relativo.

La métrica era 1 menos recall@20, evaluada sobre los primeros veinte fragmentos recuperados. El resultado mostrado promediaba distintos dominios con una configuración de embeddings concreta. Es una evaluación histórica del proveedor, no una medición de un asistente corporativo nuestro ni una tasa de respuestas finales incorrectas.

El avance ataca un problema real: fragmentos aislados pueden perder el contexto que permite encontrarlos. Pero sería un salto injustificado concluir que ese 67 % también mide reducción de decisiones erróneas, de fuentes obsoletas o de trabajo humano. Son resultados diferentes y necesitan su propia evidencia.

Este matiz tiene una consecuencia práctica para quien compra o patrocina el sistema. Una demostración puede mostrar mejores documentos recuperados y todavía no responder a la pregunta que importa al negocio: ¿estamos aplicando la norma que corresponde a este caso?

La ficha de aplicabilidad de la respuesta

Propongo una ficha de aplicabilidad de la respuesta para organizar esa revisión. Es una síntesis propia de criterios, no una certificación de exactitud. Relaciona cada afirmación relevante con su fuente y con las condiciones bajo las que puede utilizarse.

Objeto de la pregunta
Qué producto, proceso, cliente o servicio se consulta. Dos documentos con el mismo título pueden regir ámbitos diferentes.
Momento aplicable
Si buscamos la regla vigente ahora o la que existía cuando ocurrió un hecho. La fecha de subida del archivo no siempre coincide con la entrada en vigor.
Autoridad de la fuente
Quién mantiene el documento, si es borrador o versión aprobada y qué relación tiene con otros textos que lo amplían o sustituyen.
Respaldo de la afirmación
El pasaje que sostiene la respuesta y las excepciones que pueden cambiarla. Citar la portada del manual no basta para acreditar una condición concreta.
Conflicto pendiente
Qué información falta o qué fuentes discrepan. Esa situación debe poder acabar en una respuesta limitada o en una petición de aclaración, sin fabricar consenso.

Pensemos en una empresa ficticia donde el manual general permite un trámite durante treinta días, mientras un anexo aprobado fija quince para un producto concreto desde julio. En septiembre, una pregunta sobre ese producto necesita combinar ámbito y vigencia. Seleccionar únicamente el manual general puede generar una respuesta impecablemente citada y equivocada.

La ficha obliga a expresar por qué se aplica el anexo. También muestra qué hacer si el índice solo contiene el manual: el problema está en la evidencia disponible, y no se arregla pidiendo al modelo que sea más convincente. Los plazos de este ejemplo son inventados para ilustrar la relación documental, no asesoramiento sobre una política real.

El documento más reciente tampoco gana siempre

Ordenar por fecha parece una solución rápida, pero «nuevo» puede significar varias cosas. Un borrador subido ayer puede coexistir con una norma aprobada hace un año. Un documento antiguo puede seguir siendo la fuente adecuada para explicar una decisión histórica. Y la actualización de una copia no acredita que haya cambiado la regla.

Por eso conservar versiones tiene valor. La cuestión es que el sistema distinga su función. El histórico sirve para reconstruir el pasado, mientras una consulta sobre el presente necesita identificar qué permanece aplicable. Eliminar todo lo antiguo simplifica el repositorio a costa de perder preguntas legítimas.

En ocasiones la organización tampoco ha resuelto la contradicción. Dos departamentos pueden mantener documentos incompatibles sin una autoridad reconocida para elegir. Presentar una única respuesta limpia oculta ese desacuerdo. El asistente debería poder mostrarlo con suficiente precisión para que una persona competente lo resuelva.

La evaluación debe incluir preguntas incómodas

La guía de evaluación de Azure recomienda examinar distintas dimensiones del resultado y advierte de la variabilidad de las respuestas. Para este caso, interesa además un conjunto de preguntas donde el repositorio contenga versiones sustituidas, excepciones vigentes y conflictos sin resolver.

Podemos plantear una pregunta sobre la norma actual, otra sobre una fecha pasada y una tercera cuyo producto no esté identificado. No esperamos la misma conducta: en un caso procede responder, en otro localizar el histórico y en el tercero quizá pedir el dato que falta. Penalizar siempre la abstención premiaría una seguridad aparente que no necesitamos.

La ficha no garantiza que el modelo razone bien ni que los documentos sean ciertos. Hace visible una parte del trabajo que una cita suele esconder. Un buen asistente documental permite entender qué sostiene la respuesta y hasta dónde llega. Si no sabemos por qué esa fuente corresponde a esa pregunta, todavía nos falta la parte más importante de la precisión.

Subscription Form

Recibe más contenido como este

Ideas, guías y recursos sobre datos, automatización, desarrollo interno e IA aplicada con criterio técnico. Sin ruido. Solo contenido que merezca la pena leer.