El problema: una cifra correcta en la frase equivocada
Un asistente afirma que un modo reduce un 15% la energía anual de una máquina y enlaza un informe técnico. El informe contiene «15%», pero se refiere a menos tiempo de parada durante treinta días. La cita existe, el documento trata la máquina correcta y la cifra está bien copiada. Sin embargo, la conclusión no tiene respaldo: cambiaron la magnitud medida y el horizonte temporal.
¿Cómo distinguir una respuesta documentada de otra solo adornada con fuentes? Construiremos un archivo sintético de cuatro documentos y compararemos tres respuestas. Separar recuperación, respaldo de afirmaciones y completitud revela errores ocultos por un único porcentaje. No medimos un producto comercial: documentos, respuestas y anotaciones están construidos para que el razonamiento sea comprobable.
Tres pasos que no se garantizan entre sí
Un sistema RAG, generación aumentada por recuperación, selecciona pasajes y los entrega al generador. Un agente puede buscar otra vez, abrir el documento completo o precisar la pregunta. Esa flexibilidad no elimina la diferencia entre encontrar una fuente y usarla bien. Un texto parecido a la pregunta puede estar obsoleto, tratar otro modelo o respaldar solo media frase.
Llamemos pertinencia a la relación con el tema y respaldo a la relación lógica entre fuente y afirmación concreta. Un informe pertinente al modo Eco no demuestra ahorro energético anual. Completitud es incluir la información necesaria para responder. Una sola frase perfectamente respaldada puede omitir casi todo lo solicitado. Son preguntas distintas y necesitan comprobaciones distintas.
El archivo de prueba: pequeño y totalmente comprobable
El lector pregunta: «Para P7 en su versión actual, ¿cuál es el límite térmico continuo, qué documenta el piloto Eco y cuánto ahorra de energía anual?». P7 es ficticia. D1, manual actual v3, indica 80 °C de límite continuo. D2, manual obsoleto v2, indicaba 100 °C. D3 informa 30 días de observación y 15% menos tiempo de parada, sin estimación energética anual ni tamaño muestral. D4 es un catálogo que menciona Eco sin rendimiento cuantificado.
Estos cuatro textos son todo el universo informativo del ejercicio. D3 es deliberadamente incompleto: no permite estimar un beneficio causal ni generalizar a otras máquinas. Estudiamos si la respuesta relata fielmente lo escrito, no si el informe ficticio demuestra un resultado industrial. No hay fuentes ocultas que autoricen 15% energético ni mil máquinas de muestra.
Primera comprobación: ¿recuperamos las pruebas disponibles?
Supongamos una clasificación manual: D2, D4, D1, D3. No procede de un buscador ejecutado; aísla el conteo. Los documentos válidos son D1 y D3. Definimos recall documental a k como la proporción de esos dos entre los primeros k resultados. A k=2 es cero aunque haya dos textos sobre el tema; a k=3 es 1/2; a k=4 es 2/2. La pertinencia léxica no basta para encontrar la prueba adecuada.
Conocemos el denominador porque construimos y leímos todo el archivo. En un corpus real, identificar todas las fuentes probatorias ya es parte de evaluar. Dos documentos tampoco significan dos hechos: D1 cubre temperatura y D3 duración y métrica observada. A k=3 tenemos media documentación pero solo un tercio de los tres hechos documentables solicitados. Contar documentos no mide automáticamente cobertura informativa.
Segunda comprobación: ¿la fuente respalda esa afirmación exacta?
Consideremos A: «El límite continuo es 80 °C [D1]. Eco reduce 15% la energía anual [D3]. El piloto fue validado en mil máquinas [D4]». Las tres frases tienen cita y los documentos se abren. Solo la primera está respaldada: D3 habla de paradas, no energía; D4 no menciona muestra. Sin respaldo no equivale a falso: podría existir ahorro, pero la respuesta no lo demuestra.
Dividimos la respuesta en afirmaciones atómicas, comprobables por separado. Para c_i y sus citas C_i, definimos S(C_i,c_i)=1 si las fuentes la respaldan por completo en el contexto aplicable, y cero si no. Sin cita vale cero. Aquí la relación está anotada explícitamente; el programa no entiende lenguaje natural ni descubre respaldo por sí solo.
n cuenta afirmaciones, no documentos recuperados. Hay citas en 3/3, el 100%, pero respaldo en 1/3, aproximadamente 33,3%. Si recuperamos los cuatro documentos, R_doc también es 100%. Una recuperación aparentemente lograda y citas completas pueden coexistir con poco respaldo. No hace falta inventar una tasa de alucinación de un modelo para mostrarlo.
Tercera comprobación: ¿basta borrar las frases difíciles?
B dice solo: «El límite continuo es 80 °C [D1]». Su respaldo es 1/1, el 100%. Evita añadidos injustificados, pero omite duración y métrica del piloto. Definimos antes de generar un conjunto G de hechos solicitados documentables: límite 80 °C, duración 30 días y reducción de paradas 15% informada. La cobertura U es la fracción de G expresada con respaldo. No cambiamos G para ajustarlo a lo que el sistema decidió decir.
C conserva el límite e informa de treinta días y menos paradas, citando D1, D3 y D3. Después aclara que el archivo no contiene estimación energética anual. Para los tres hechos positivos, respaldo y cobertura son 100%. Abstenerse sobre energía expresa el límite de las fuentes, no invita a inventar una cuarta prestación. La cobertura concierne a tres hechos disponibles, no afirma que toda la pregunta tenga respuesta cuantitativa.
| Respuesta | Presencia de citas | Respaldo S | Cobertura U |
|---|---|---|---|
| A | 100% | 33.3% | 33.3% |
| B | 100% | 100% | 33.3% |
| C | 100% | 100% | 100% |
Comparemos por pares. A y B tienen igual cobertura útil, pero B evita dos afirmaciones sin apoyo. B y C tienen igual respaldo porcentual, pero C entrega tres veces los hechos solicitados. Una respuesta vacía no recibe respaldo del 100%: con n=0 el cociente es indefinido y se registra abstención con cobertura nula. Fijar esas reglas evita que la puntuación mejore mientras empeora el servicio.

Granularidad y citas múltiples cambian la comprobación
«El límite es 80 °C y Eco ahorra 15% de energía [D1,D3]» contiene dos afirmaciones. Evaluarla en bloque oculta qué mitad falla; dividirla da mejor feedback. Pero segmentar no debe convertir palabras sueltas en supuestos hechos autónomos. Sujeto, versión, cantidad, unidad y condiciones deben seguir unidos. El vínculo entre 15% y paradas es justo lo que una mala segmentación perdería.
Con varias fuentes, algunas afirmaciones requieren evidencia conjunta. Un documento define un código y otro informa un resultado con él; unirlos solo vale si identidad y contexto coinciden. No basta puntuar cada enlace. Hay que distinguir citas necesarias de redundantes o irrelevantes y comprobar el conjunto cuando un pasaje no basta. El ejercicio usa una fuente por afirmación y no implementa ese problema general.
Qué tomamos de ALCE
Enabling Large Language Models to Generate Text with Citations, de Gao, Yen, Yu y Chen, publicado en EMNLP 2023, propone ALCE y distingue corrección de calidad de citas. Sus secciones 3.3 y 5 describen métricas, evaluadores y experimentos; el respaldo se estima con un modelo de inferencia de lenguaje natural, NLI. Usan datasets como ASQA, versiones de la época y presupuestos de pasajes declarados. Es referencia metodológica histórica, no clasificación de 2026 ni medida de nuestro archivo.
Nuestro conteo es una simplificación didáctica explícita, no reproducción completa de ALCE. No ejecutamos NLI, recuperación neuronal ni generación de modelo: declaramos relaciones de respaldo y calculamos métricas. Un verificador real puede fallar con negaciones, números, versiones o evidencia repartida. La evaluación humana de los autores pertenece a su estudio; aquí no hubo revisión con lectores ni anotadores humanos.
De la métrica a la siguiente acción del agente
La separación indica dónde actuar. Si no se recuperó D3, pedir precisión al generador no aporta la prueba: hay que mejorar búsqueda, filtros o acceso. Si D3 está disponible pero transforma paradas en energía, falla el uso de evidencia. Si responde fielmente pero incompleto, faltan componentes de la pregunta. Una etiqueta genérica «respuesta incorrecta» ocultaría tres causas operativas distintas.
Para energía puede convenir otra búsqueda, pero con regla de parada: límite de consultas o coste y obligación de declarar lo aún no documentado. Repetir hasta hallar una frase favorable no es verificar. Hay que conservar identificador y versión, pasaje usado y relación con cada afirmación. Si cambia una fuente, esos registros permiten revisar respuestas afectadas sin fingir que una URL sea evidencia inmutable.
Qué demuestra el experimento reproducible
El código conserva cuatro documentos, cinco afirmaciones candidatas, relaciones permitidas y tres respuestas. Calcula recall, respaldo y cobertura con conjuntos y verificaciones. El conteo es lineal en pares afirmación–cita si consultar el respaldo cuesta tiempo constante; lo costoso en realidad es establecer correctamente esa tabla. Nuestro programa no resuelve ese problema semántico. No necesita semilla porque no usa azar.
Evaluar un sistema real exige preguntas representativas, fuentes congeladas o versionadas, respuestas registradas, reglas de segmentación y gestión de desacuerdos. Separar casos respondibles, información ausente y documentos contradictorios. Los tres escenarios no estiman error empresarial ni justifican umbrales universales. Muestran que las métricas divergen aun funcionando los enlaces: el protocolo debe verificar contenido, no solo presencia de links.
Respuesta a la pregunta inicial
Una cita permite comprobar una afirmación solo si conduce a evidencia aplicable que la respalda. En el archivo, recuperación y presencia de enlaces alcanzan 100% con solo un tercio respaldado. Reducir a una frase elimina errores pero omite dos tercios de hechos disponibles. La mejor respuesta conserva unidades, versiones y condiciones, relata lo permitido y declara el límite energético anual. Esa relación comprobable entre pregunta, afirmación y prueba hace útil al agente documental.
Bibliografía y transparencia
Tianyu Gao, Howard Yen, Jiatong Yu y Danqi Chen, Enabling Large Language Models to Generate Text with Citations, EMNLP 2023, pp. 6465–6488. Leídas las secciones de calidad de citas, métodos y comparación experimental. P7 es totalmente ficticio y no corresponde a clientes, instalaciones ni productos EL-AI. El texto no acredita un verificador automático disponible en el CMS u otros productos.
Gao et al. (2023) — Enabling Large Language Models to Generate Text with Citations.
support = {"c1": {"D1"}, "c2": {"D3"}, "c3": {"D3"},
"c4": set(), "c5": set()}
required = {"c1", "c2", "c3"}
answer = [("c1", "D1"), ("c4", "D3"), ("c5", "D4")]
good = {claim for claim, doc in answer if doc in support[claim]}
print("support:", len(good)/len(answer))
print("coverage:", len(good & required)/len(required))
# The support labels are stipulated for this synthetic corpus.
# This code is not a natural-language entailment model.
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 28 de septiembre de 2026.

