Il problema: un numero giusto nella frase sbagliata
Un assistente risponde che una modalità di funzionamento riduce del 15% l’energia annuale consumata da una macchina e aggiunge il collegamento a un rapporto tecnico. Aprendo il rapporto troviamo davvero «15%», ma riguarda una riduzione dei tempi di fermo in un’osservazione di trenta giorni. La citazione esiste, il documento parla della macchina giusta e il numero è stato copiato correttamente. La conclusione, però, non è sostenuta: sono cambiati sia la grandezza misurata sia l’orizzonte temporale.
La domanda è come distinguere una risposta documentata da una risposta soltanto decorata con fonti. Costruiremo un archivio sintetico di quattro documenti e confronteremo tre risposte. Separare recupero, supporto delle affermazioni e completezza permetterà di riconoscere errori che una singola percentuale nasconde. Non misureremo un prodotto commerciale: i documenti, le risposte e le annotazioni sono costruiti per rendere verificabile il ragionamento.
Tre passaggi che non si garantiscono a vicenda
Un sistema RAG, cioè generazione aumentata dal recupero di documenti, prima seleziona passaggi e poi li fornisce al generatore. Un agente può ripetere la ricerca, aprire un documento completo o formulare una domanda più precisa. Questa flessibilità non elimina la distinzione tra trovare una fonte e usarla correttamente. Un testo simile alla domanda può essere obsoleto, parlare di un altro modello o sostenere solo metà della frase prodotta.
Chiamiamo pertinenza la relazione con il tema cercato; supporto la relazione logica tra una fonte e una specifica affermazione. Dire che il rapporto è pertinente alla modalità Eco non dimostra che Eco risparmi energia annuale. Chiamiamo infine completezza la presenza delle informazioni necessarie per rispondere alla domanda. Una risposta di una sola frase, perfettamente sostenuta, può comunque omettere quasi tutto quello che il lettore chiedeva. Sono tre domande diverse e richiedono controlli diversi.
L’archivio di prova: piccolo abbastanza da controllarlo tutto
La richiesta del lettore è: «Per P7 nella versione corrente, qual è il limite di temperatura continua, che cosa documenta il pilota Eco e quanto risparmia di energia in un anno?». P7 è una macchina inventata. D1 è il manuale corrente v3 e indica 80 °C come limite continuo. D2 è il manuale superato v2, che indicava 100 °C. D3 è un rapporto Eco: osservazione di 30 giorni, riduzione dei tempi di fermo del 15%, nessuna stima energetica annuale e nessuna numerosità del campione dichiarata. D4 è un catalogo che menziona Eco senza prestazioni quantitative.
Questi quattro testi sono l’intero universo informativo dell’esercizio. Il rapporto D3 è deliberatamente incompleto: non permette di stimare causalmente un beneficio né di generalizzarlo ad altre macchine. L’articolo studia se una risposta riferisca fedelmente ciò che è scritto, non se il rapporto inventato dimostri un risultato industriale. Non esiste una fonte nascosta che autorizzi il 15% energetico o un campione di mille macchine.
Il primo controllo: abbiamo recuperato le prove disponibili?
Supponiamo una graduatoria di ricerca fissata a mano: D2, D4, D1, D3. Non è l’output di un motore realmente eseguito; serve a isolare il conteggio. I documenti validi per i fatti richiesti sono D1 e D3. Definiamo recall documentale a k come la quota di questi due documenti presente nei primi k risultati. A k=2 vale zero, pur avendo due testi sul tema; a k=3 vale 1/2; a k=4 vale 2/2. La pertinenza lessicale non basta a trovare la prova giusta.
Il denominatore è noto perché abbiamo costruito e letto tutto l’archivio. In un corpus reale, identificare tutte le fonti che contengono una prova è già parte del lavoro di valutazione. Inoltre due documenti non significano due fatti: D1 copre il limite termico; D3 copre sia la durata sia la metrica osservata. A k=3 abbiamo metà dei documenti ma solo un terzo dei tre fatti documentabili richiesti. Un conteggio per documento non misura automaticamente la copertura informativa.
Il secondo controllo: la fonte sostiene proprio quella frase?
Consideriamo la risposta A: «Il limite continuo è 80 °C [D1]. Eco riduce del 15% l’energia annuale [D3]. Il pilota è stato validato su mille macchine [D4]». Tutte e tre le frasi hanno una citazione e tutti i documenti possono essere aperti. Solo la prima, però, è sostenuta. D3 parla di fermo, non energia; D4 non menziona il campione. L’assenza di supporto non è identica alla falsità: il risparmio potrebbe esistere nel mondo, ma questa risposta non ne fornisce evidenza.
Suddividiamo la risposta in affermazioni atomiche, cioè verificabili separatamente. Per ogni affermazione c_i e insieme delle sue citazioni C_i, definiamo S(C_i,c_i)=1 se le fonti, nel contesto applicabile, la sostengono interamente; zero altrimenti. Se manca la citazione, il valore è zero. Nel nostro archivio questa relazione è annotata esplicitamente nell’esempio; il programma non comprende il linguaggio naturale e non scopre da solo il supporto.
n è il numero di affermazioni della risposta, non il numero di documenti recuperati. La presenza di citazioni è 3/3, cioè 100%, mentre il supporto è 1/3, circa 33,3%. Se tutti e quattro i documenti sono stati recuperati, anche R_doc è 100%. Ecco un caso completo in cui ricerca apparentemente riuscita e citazioni complete convivono con una risposta scarsamente sostenuta. Non serve inventare una percentuale di allucinazioni di un modello per mostrare il problema.
Il terzo controllo: basta cancellare le frasi difficili?
La risposta B dice soltanto: «Il limite continuo è 80 °C [D1]». Il suo supporto è 1/1, quindi 100%. È migliore della prima nel non aggiungere affermazioni ingiustificate, ma tace sulla durata del pilota e sulla metrica osservata. Per misurare questa perdita definiamo prima della generazione un insieme G di fatti documentabili richiesti: limite 80 °C, durata 30 giorni, riduzione del fermo 15% riportata nel pilota. La copertura U è la frazione di G riportata con supporto nella risposta. Non cambiamo G per adattarlo a ciò che il sistema ha scelto di dire.
La risposta C mantiene il limite, riferisce i trenta giorni e la riduzione del fermo, citando rispettivamente D1, D3 e D3. Poi precisa che l’archivio non contiene una stima del risparmio energetico annuale. Per i tre fatti positivi, supporto e copertura sono entrambi 100%. L’astensione sulla domanda energetica è una risposta esplicita al limite delle fonti, non una quarta prestazione da inventare. Il nostro punteggio di copertura riguarda i tre fatti disponibili, non pretende che tutte le parti della domanda abbiano una risposta quantitativa.
| Risposta | Presenza citazioni | Supporto S | Copertura U |
|---|---|---|---|
| A | 100% | 33.3% | 33.3% |
| B | 100% | 100% | 33.3% |
| C | 100% | 100% | 100% |
Nella tabella confrontiamo due righe alla volta. A e B hanno la stessa copertura utile, ma B evita due affermazioni non sostenute. B e C hanno lo stesso supporto percentuale, ma C restituisce tre volte i fatti richiesti. Una risposta vuota non riceverebbe supporto 100%: con n=0 il rapporto non è definito e va registrato come astensione, insieme alla copertura nulla. Sono convenzioni da fissare nel protocollo, altrimenti il punteggio può migliorare mentre il servizio peggiora.

Granularità e citazioni multiple cambiano il controllo
La frase «Il limite è 80 °C e Eco risparmia il 15% di energia [D1,D3]» contiene due affermazioni. Valutarla come un solo blocco può nascondere quale metà fallisce; dividerla consente un feedback più preciso. Ma la segmentazione non deve trasformare parole isolate in presunti fatti autonomi. Soggetto, versione, quantità, unità e condizioni devono rimanere collegati. La relazione tra 15% e fermo è proprio l’informazione che una segmentazione sbagliata potrebbe perdere.
Con più fonti, alcune affermazioni possono richiedere una prova congiunta. Un documento definisce un codice e un altro riporta un risultato usando quel codice; il collegamento è valido soltanto se identità e contesto sono compatibili. Non basta assegnare un punto a ogni collegamento presente. Serve distinguere una citazione necessaria da una ridondante o irrilevante, e controllare l’insieme quando nessun singolo passaggio è sufficiente. Il nostro esercizio usa intenzionalmente una fonte per affermazione: non implementa questo problema più generale.
Che cosa riprendiamo da ALCE
Il lavoro Enabling Large Language Models to Generate Text with Citations, pubblicato a EMNLP 2023 da Gao, Yen, Yu e Chen, propone ALCE e distingue correttezza e qualità delle citazioni. Le sezioni 3.3 e 5 spiegano metriche, valutatori e confronti sperimentali; il supporto viene stimato con un modello di inferenza sul linguaggio naturale, NLI. I test usano dataset come ASQA e versioni di modelli dell’epoca, con budget di passaggi dichiarati. È un riferimento metodologico storico, non una classifica del 2026 e non una misura del nostro archivio.
Il nostro conteggio è una semplificazione didattica esplicita, non una riproduzione completa di ALCE. Non abbiamo eseguito NLI, retrieval neurale o generazione di un modello: abbiamo dichiarato le relazioni di supporto e calcolato le metriche. Un verificatore automatico reale può sbagliare su negazioni, numeri, versioni o prove distribuite in più passaggi. La verifica umana riportata dagli autori appartiene al loro studio; qui non è stata svolta alcuna revisione con lettori o annotatori umani.
Dalla metrica alla scelta successiva dell’agente
La separazione indica anche dove intervenire. Se D3 non è stato recuperato, chiedere al generatore di essere più preciso non gli fornisce la prova mancante: bisogna migliorare ricerca, filtri o accesso al documento. Se D3 è disponibile ma il generatore trasforma fermo in energia, il problema è nell’uso dell’evidenza. Se il risultato è fedele ma incompleto, serve controllare i punti della domanda ancora scoperti. Lo stesso messaggio generico «risposta sbagliata» nasconderebbe tre cause operative diverse.
Nel caso energetico, una ricerca aggiuntiva può essere ragionevole, ma deve avere un criterio di arresto: un numero massimo di ricerche o un costo consentito, più l’obbligo di dichiarare ciò che resta non documentato. Ripetere query fino a trovare una frase apparentemente favorevole non è verifica. Occorre conservare identificativo e versione del documento, passaggio usato e legame con la singola affermazione. Se una fonte cambia, questi riferimenti permettono di capire quali risposte vadano riesaminate, senza fingere che un URL sia una prova immutabile.
Che cosa dimostra l’esperimento riproducibile
Il codice allegato conserva i quattro documenti, cinque affermazioni candidate, le relazioni ammesse e le tre risposte. Calcola recall, supporto e copertura con operazioni su insiemi e verifiche dei risultati attesi. La complessità del conteggio è lineare nel numero di coppie affermazione–citazione quando l’accesso alla tabella di supporto ha costo costante; il problema costoso, nel mondo reale, è stabilire correttamente quella tabella. Il nostro programma non risolve quel problema semantico. Nessun seed è necessario perché non usa numeri casuali.
Per valutare un sistema reale occorrerebbero domande rappresentative, fonti congelate o versionate, risposte registrate, regole di segmentazione e gestione dei disaccordi. Andrebbero separati casi con risposta disponibile, informazione mancante e documenti in conflitto. I tre scenari qui non stimano una frequenza di errore aziendale e non giustificano soglie di accettazione universali. Mostrano che alcune metriche possono divergere anche quando i collegamenti funzionano tutti: è il motivo per cui il protocollo deve verificare contenuti e non solo la presenza dei link.
Risposta alla domanda iniziale
Una citazione rende controllabile un’affermazione soltanto se conduce a una fonte applicabile che la sostiene davvero. Nel nostro archivio, recupero e presenza dei link arrivano al 100% anche con solo un terzo delle affermazioni supportate. Ridurre la risposta a una frase elimina errori ma lascia due terzi dei fatti disponibili inespressi. La risposta migliore riferisce ciò che le fonti consentono, conserva unità, versioni e condizioni, e dichiara il limite sull’energia annuale. È questa relazione verificabile tra domanda, affermazione e prova a rendere utile un agente documentale.
Bibliografia e trasparenza
Tianyu Gao, Howard Yen, Jiatong Yu e Danqi Chen, Enabling Large Language Models to Generate Text with Citations, EMNLP 2023, pp. 6465–6488. Lette le sezioni sulla qualità delle citazioni, i metodi e i confronti sperimentali. L’archivio P7 è interamente inventato e non riguarda clienti, impianti o prodotti EL-AI. Il testo non attesta che un verificatore automatico sia già disponibile nel CMS o negli altri prodotti dell’azienda.
Gao et al. (2023) — Enabling Large Language Models to Generate Text with Citations.
support = {"c1": {"D1"}, "c2": {"D3"}, "c3": {"D3"},
"c4": set(), "c5": set()}
required = {"c1", "c2", "c3"}
answer = [("c1", "D1"), ("c4", "D3"), ("c5", "D4")]
good = {claim for claim, doc in answer if doc in support[claim]}
print("support:", len(good)/len(answer))
print("coverage:", len(good & required)/len(required))
# The support labels are stipulated for this synthetic corpus.
# This code is not a natural-language entailment model.
Codice, dati e istruzioni · JSON. Calcoli didattici eseguiti con Python 3.14.0; figure con Matplotlib 3.11.2. Analisi con assistenza AI, senza dichiarare peer review o revisione umana. Copertina originale ImageGen, illustrativa: non documenta persone, sedi o installazioni EL-AI. Fonti consultate il 28 settembre 2026.

