ELAI S.r.l.

Una misura assente è davvero un dato neutro? Che cosa impara l’AI dal processo di raccolta

Un esempio biomedico interamente sintetico spiega selezione, imputazione e segnali di assenza: quando aiutano e quando cambiare protocollo li rende fragili.

Una misura assente è davvero un dato neutro? Che cosa impara l’AI dal processo di raccolta

Il problema: la casella vuota racconta anche una scelta

In un archivio biomedico, alcune righe contengono una misura e altre una casella vuota. La prima reazione può essere riempire i vuoti con una media e proseguire. Ma perché quella misura manca? Potrebbe non essere stata richiesta, essere arrivata tardi o essersi persa nel trasferimento dei dati. Queste situazioni possono coinvolgere gruppi diversi. Un modello può quindi imparare il processo che decide chi viene misurato, anche quando il valore misurato non aggiunge informazione.

La domanda centrale è: conservare l’informazione “presente o assente” migliora la previsione, e che cosa succede quando cambia il modo di raccogliere i dati? La risposta richiede distinguere tre compiti: prevedere un esito, ricostruire un valore non osservato e descrivere una popolazione. Seguiremo una tabella sintetica di mille casi, con tutti i conteggi dichiarati. Non sono pazienti reali, non valutiamo un esame diagnostico e non proponiamo decisioni cliniche. L’esempio isola un meccanismo statistico utile a chi progetta e controlla sistemi AI.

Notazione e un esempio volutamente semplice

Y vale uno quando si verifica un esito astratto e zero altrimenti. Nella tabella retrospettiva conosciamo Y per tutti i mille casi; quando faremo una previsione futura, naturalmente non potremo usarlo come ingresso. X è una misura in unità arbitrarie. R vale uno quando X è disponibile al momento della previsione e zero quando non lo è. R è detto indicatore di osservazione; il corrispondente indicatore di mancanza è 1 − R. Specificare questa convenzione evita di scambiare presenti e assenti nelle formule.

Per isolare l’effetto del processo, nel nostro mondo sintetico X vale sempre 7, anche dove non lo vediamo. È una scelta estrema e dichiarata: il valore non può distinguere gli esiti. Duecento casi hanno Y = 1 e ottocento Y = 0, quindi la frequenza complessiva è 20%. Il processo rende disponibile X nell’80% dei casi con Y = 1 e nel 10% dei casi con Y = 0. Descriviamo un’associazione statistica, non affermiamo che un operatore conosca in anticipo l’esito futuro: segnali o circostanze correlate possono produrre una selezione di questo tipo.

EsitoR = 1: presenteR = 0: assenteTotale
Y = 116040200
Y = 080720800
Σ2407601000

La selezione cambia il denominatore

Guardando soltanto le righe complete, troviamo 160 esiti positivi su 240: circa 66,67%. Guardando le righe senza misura, ne troviamo 40 su 760: circa 5,26%. Entrambe le frequenze sono corrette per i rispettivi gruppi, ma nessuna è la frequenza dell’intera popolazione. Eliminare le righe incomplete e riferire 66,67% come frequenza generale confonderebbe una selezione con il totale. La prima difficoltà dei dati mancanti è spesso questa, prima ancora di scegliere un algoritmo di imputazione.

π = P(Y=1), a = P(R=1|Y=1), b = P(R=1|Y=0) P(Y=1|R=1) = πa / [πa + (1−π)b] P(Y=1|R=0) = π(1−a) / [π(1−a) + (1−π)(1−b)]

La barra verticale significa “dato che”: una probabilità condizionata restringe il gruppo su cui contiamo. Nella prima frazione il numeratore πa è la quota con esito uno e misura presente. Il denominatore aggiunge tutti i presenti, inclusi quelli con esito zero. Sostituendo π = 0,2, a = 0,8 e b = 0,1 otteniamo 0,16/0,24 = 2/3. Per gli assenti otteniamo 0,04/0,76 = 1/19. Non abbiamo scoperto informazione nel numero 7: l’informazione è nel modo in cui le righe vengono selezionate.

Riempire bene non equivale a prevedere bene

Imputare significa assegnare un valore sostitutivo a una misura mancante. La media dei valori osservati è 7: riempiendo con 7 ricostruiamo perfettamente ogni X di questo esperimento, perché conosciamo la sua costruzione. Tuttavia, se cancelliamo R, tutte le righe diventano indistinguibili. Una regola che usa soltanto quel valore può assegnare a tutti la probabilità 0,2. Conservando R può invece assegnare 2/3 ai presenti e 1/19 agli assenti. La ricostruzione di X è perfetta in entrambi i casi, mentre l’informazione disponibile per prevedere Y è diversa.

Questo non dimostra che la media sia sempre una cattiva imputazione, né che un indicatore sia sempre indispensabile: un codice sostitutivo distinto dai valori reali potrebbe già rendere riconoscibile l’assenza. Il nostro caso dimostra qualcosa di più circoscritto: un riempimento che fonde stati informativi diversi può perdere un segnale utile alla previsione. Non è una contraddizione dei risultati teorici generali sull’imputazione: il nostro X costante non soddisfa, per esempio, l’ipotesi di una distribuzione con densità continua usata nel lavoro citato più avanti.

Misurare la previsione con un errore comprensibile

Per confrontare probabilità, usiamo il Brier score binario: la media del quadrato della differenza fra probabilità prevista p e risultato Y. Se prevediamo 0,8 e accade Y = 1, il contributo è 0,04; se accade Y = 0, è 0,64. Penalizza quindi una forte sicurezza sbagliata. Non ha unità fisiche e un valore minore è migliore. Non è percentuale di errori diagnostici né beneficio clinico.

BS = (1/N) Σᵢ (pᵢ − Yᵢ)² E[(Y−p)² | R] = q_R(1−q_R) + (p−q_R)², q_R = P(Y=1|R)

La seconda identità separa due pezzi: l’incertezza che rimane nel gruppo, q_R(1−q_R), e la penalità per prevedere una probabilità diversa dalla sua frequenza, (p−q_R)². Si verifica espandendo q_R(1−p)² + (1−q_R)p² e raccogliendo i termini. Il minimo si ottiene a p = q_R. Nella tabella originale, la probabilità costante 0,2 dà 0,16; la regola che distingue R dà circa 0,091228. Sono valori esatti della tabella, calcolati con frazioni prima di arrotondare, non una stima di generalizzazione ottenuta addestrando e testando un classificatore.

Cambiare il protocollo può cambiare il significato del vuoto

Ora manteniamo gli stessi mille casi, gli stessi duecento esiti positivi e gli stessi valori X = 7, ma rendiamo disponibile la misura nella metà di ciascun gruppo. Fra i presenti ci sono 100 positivi e 400 negativi; fra gli assenti altrettanti. Entrambi i gruppi hanno quindi frequenza 20%. Il segnale di R è scomparso, anche se la frequenza generale dell’esito non è cambiata. Congeliamo però la vecchia regola, come farebbe un sistema non aggiornato: continua a prevedere 2/3 e 1/19.

BS_nuovo = 0.5 [0.2(1−2/3)² + 0.8(2/3)²] + 0.5 [0.2(1−1/19)² + 0.8(1/19)²] ≈ 0.279748

I due coefficienti 0,5 rappresentano gruppi ora ugualmente numerosi. Dentro ogni parentesi pesiamo l’errore sui positivi con 0,2 e sui negativi con 0,8. La vecchia regola arriva a circa 0,279748, peggio della previsione costante, che resta a 0,16. Se ricalcolassimo le probabilità condizionate nel nuovo mondo, entrambe tornerebbero 0,2 e anche la regola con R avrebbe Brier 0,16. Il problema non è aver conservato l’indicatore, ma aver considerato stabile la sua associazione con l’esito.

Due tabelle sintetiche, nessun dato clinico. A sinistra le frequenze dell’esito nei gruppi con misura presente e assente: il divario scompare quando cambia il protocollo. A destra il Brier score della probabilità costante e della regola R mantenuta invariata. Un valore più basso è migliore; le barre non sono intervalli di confidenza né misure di beneficio sanitario.
Due tabelle sintetiche, nessun dato clinico. A sinistra le frequenze dell’esito nei gruppi con misura presente e assente: il divario scompare quando cambia il protocollo. A destra il Brier score della probabilità costante e della regola R mantenuta invariata. Un valore più basso è migliore; le barre non sono intervalli di confidenza né misure di beneficio sanitario.

La decomposizione dell’errore chiarisce anche quanto costa l’aggiornamento mancato: nel nuovo mondo q_R = 0,2 per entrambi i gruppi. La penalità aggiuntiva è 0,5(2/3 − 0,2)² + 0,5(1/19 − 0,2)², circa 0,119748, esattamente la differenza fra 0,279748 e 0,16. Non abbiamo bisogno di cambiare la popolazione o il vero valore della misura per produrre questo peggioramento: basta modificare l’osservazione. È una dimostrazione costruita di possibilità, non una stima di quanto spesso accada nei servizi reali.

Non confondere informazione, causalità e disponibilità nel tempo

Dire che R predice Y non significa che richiedere una misura causi l’esito. Le formule sono associazioni condizionate. Un intervento che rende la misura disponibile a più persone può modificare R senza cambiare Y, come nel secondo esempio. Attribuire un significato biologico alla regola sarebbe quindi un salto non giustificato. In un progetto reale occorre conoscere il processo: richiesta, esecuzione, arrivo del risultato e acquisizione informatica sono eventi diversi, con tempi diversi.

Anche “dato mancante informativo” non è sinonimo automatico di Missing Not At Random, o MNAR. Questa classificazione riguarda da quali variabili osservate e non osservate dipende la mancanza. Nella nostra tabella retrospettiva Y è osservato per tutti e il meccanismo dipende da Y: rispetto alla misura X mancante, la dipendenza è da una variabile osservata. Al momento della previsione Y non è invece disponibile. Il nome del meccanismo va quindi accompagnato dall’insieme delle informazioni e dal compito: una sigla, da sola, non autorizza una strategia.

Se R è costruito usando una misura arrivata dopo l’istante in cui il modello avrebbe dovuto decidere, il problema diventa fuga di informazione dal futuro. Un test retrospettivo potrebbe essere eccellente ma irrealizzabile in esercizio. Nel nostro esperimento R è per definizione quello disponibile all’istante di previsione: non simuliamo ritardi. In dati reali questa condizione va verificata con timestamp e regole di disponibilità, non dedotta dalla presenza di una colonna nel database finale.

Stimare la popolazione è un altro problema

Supponiamo di voler recuperare il 20% generale a partire dai soli casi misurati e di conoscere esattamente le probabilità di selezione a = 0,8 e b = 0,1. Possiamo pesare ciascun caso con l’inverso della sua probabilità di osservazione. I 160 positivi rappresentano 160/0,8 = 200 casi; gli 80 negativi rappresentano 80/0,1 = 800. La frequenza pesata è quindi 200/(200 + 800) = 0,2. Questo calcolo spiega una correzione della selezione, non una regola da usare per prevedere Y: il peso qui dipende proprio dall’esito, che nel futuro non conosciamo.

In un archivio reale quelle probabilità potrebbero essere ignote; stimarle male produce un’altra fonte di errore. Devono anche essere positive nei gruppi da rappresentare: se un gruppo non viene mai osservato, un peso infinito non crea dati. Probabilità molto piccole producono pesi molto grandi e risultati instabili. Nella tabella completa il totale era già noto, quindi la pesatura non era necessaria: la mostriamo per distinguere il problema della composizione della popolazione da quello della previsione individuale.

Che cosa non possiamo sapere dai soli valori presenti

Cambiamo ora domanda e ipotesi, separandoci esplicitamente dal mondo precedente in cui sapevamo X = 7 per tutti. Conserviamo soltanto il fatto osservabile che il 24% delle misure è presente e vale 7; per le altre sappiamo solo che il valore sta fra 0 e 10. Se μ₀ è la media dei mancanti, la media dell’intera popolazione è 0,24 × 7 + 0,76 × μ₀. I dati presenti non determinano μ₀: un mondo con mancanti tutti pari a 1 e uno con mancanti tutti pari a 9 producono lo stesso archivio osservato.

μ = 0.24 × 7 + 0.76 × μ₀ 0 ≤ μ₀ ≤ 10 ⇒ 1.68 ≤ μ ≤ 9.28

Nei due mondi la media generale vale rispettivamente 2,44 e 8,52. L’intervallo 1,68–9,28 deriva soltanto dal vincolo fisso sui valori: non è un intervallo di confidenza al 95%. Per restringerlo servono nuove informazioni o ipotesi, come misure aggiuntive o una relazione giustificata con variabili osservate. Riempire tutto con 7 sceglie un’ipotesi sulla parte invisibile; non la dimostra. Anche produrre più imputazioni non elimina automaticamente questa ambiguità: esse riflettono il modello di imputazione e le sue assunzioni.

Riproducibilità, ricerca e limiti della dimostrazione

Il pacchetto scaricabile contiene le due tabelle, le formule e i risultati. Usa Fraction della libreria standard Python per evitare che arrotondamenti intermedi alterino le identità; converte in decimali soltanto per salvare e disegnare. Non c’è campionamento casuale, quindi non serve un seed. Il frammento stampa probabilità condizionate, Brier e limiti della media nel secondo problema. Le asserzioni verificano i rapporti 2/3 e 1/19, la perdita di vantaggio e il recupero della frequenza pesata. Non sono test su cartelle cliniche o modelli addestrati.

Le Morvan, Josse, Scornet e Varoquaux, NeurIPS 2021, distinguono qualità dell’imputazione e qualità predittiva. Studiano ipotesi di consistenza e confrontano procedure su regressioni sintetiche, includendo informazioni di mancanza. Non riproduciamo NeuMiss né i loro esperimenti; la nostra tabella discreta serve una domanda diversa e più circoscritta.

Per valutare un modello reale servirebbero dati temporalmente corretti, un protocollo documentato e gruppi di test che rappresentino anche cambiamenti di sede o raccolta plausibili. Si dovrebbero confrontare valore imputato, valore più indicatore e metodi che trattano direttamente l’assenza, mantenendo identici gli altri fattori. Media e trasformazioni andrebbero stimate sui dati di addestramento, senza usare il test per adattare la procedura. Occorre poi valutare separatamente i principali schemi di mancanza: un buon risultato aggregato può nascondere un gruppo piccolo e problematico. Questo è un disegno di verifica proposto, non svolto qui.

Resta inoltre un limite operativo: monitorare quante misure mancano può segnalare un cambiamento, ma non rivela automaticamente come cambi la relazione con Y. Per misurare quel legame occorrono esiti affidabili, spesso disponibili più tardi. Un aumento della raccolta può essere positivo per il servizio e allo stesso tempo rendere obsoleto un modello che sfruttava la vecchia selezione. L’analisi del dato e quella del processo devono perciò procedere insieme, senza trasformare una correlazione storica in una regola permanente.

Conclusione: conservare il contesto del dato

Una casella vuota non è necessariamente neutra. Nell’esempio, sapere se la misura esisteva migliorava la previsione perché raccontava una selezione; dopo un cambio di protocollo, la stessa regola diventava peggiore della probabilità costante. Questo non giustifica ignorare i mancanti o sfruttarli sempre. Suggerisce una disciplina più precisa: conservare il significato e il tempo dell’assenza, separare imputazione e previsione, verificare la stabilità del processo e dichiarare ciò che i dati osservati non consentono di sapere. La qualità dell’AI dipende anche da questa conoscenza, non soltanto dalla sofisticazione del modello.

Bibliografia e riproducibilità

Le Morvan, Josse, Scornet & Varoquaux — What’s a good imputation to predict with missing values? NeurIPS 2021.

from experiment import run
r = run()
for row in r['scenarios']:
    print(row['scenario'], row['conditional_p'])
    print(round(row['brier_prior'], 6),
          round(row['brier_frozen_mask'], 6))
print(r['separate_nonidentifiability'])

Codice, dati e istruzioni · JSON. Calcoli didattici eseguiti con Python 3.14.0; figure con Matplotlib 3.11.2. Analisi con assistenza AI, senza dichiarare peer review o revisione umana. Copertina originale ImageGen, illustrativa: non documenta persone, sedi o installazioni EL-AI. Fonti consultate il 4 ottobre 2026.