ELAI S.r.l.

Previsione conformale: il 90% globale può nascondere il 50% nel regime raro

Quantile finito, prova per ranghi e 2.000 calibrazioni su due regimi: copertura marginale, gruppi, ampiezza e intervalli infiniti con pochi dati.

Previsione conformale: il 90% globale può nascondere il 50% nel regime raro

Abstract: una garanzia va letta insieme al suo denominatore

Un intervallo predittivo con copertura marginale del 90% non promette il 90% in ogni regime operativo. Studiamo due regimi sintetici di errore di previsione: uno frequente e poco disperso, l’altro raro e sei volte più disperso. Il quantile della miscela copre tutti i casi del primo e soltanto metà del secondo, pur raggiungendo il 90% globale. Una calibrazione separata per gruppo corregge questo squilibrio sotto ipotesi precise, ma può produrre intervalli illimitati quando un gruppo ha pochi dati. Deriviamo entrambi i risultati e li controlliamo con 2.000 calibrazioni riproducibili.

Il contesto illustrativo è una previsione di potenza, con errori in kW; non sono misure di un impianto né risultati di un modello EL-AI. Sono richiesti probabilità, distribuzioni cumulative e statistiche d’ordine. L’esperimento assume dati indipendenti: una vera serie energetica può avere autocorrelazione e cambi di distribuzione, quindi l’esempio non autorizza a trasferire la garanzia senza verificarne le condizioni.

1. La procedura split conformal e il rango corretto

Partiamo da un predittore f già fissato usando dati di addestramento separati. Su n esempi nuovi calcoliamo lo score s_i=|y_i−f(x_i)|. Ordiniamo gli score e prendiamo il k-esimo, con k=ceil((n+1)(1−α)). L’intervallo per una nuova osservazione è [f(x)−q,f(x)+q]. Se k=n+1, poniamo q=∞: scegliere comunque il massimo osservato cambierebbe la garanzia. La correzione n+1 non è un dettaglio software; include il posto che occuperà il nuovo score fra quelli di calibrazione.

s_i = |y_i−f(x_i)| k = ceil((n+1)(1−α)) q = s_(k) if k ≤ n; otherwise +∞ C(x) = [f(x)−q, f(x)+q]

Sotto scambiabilità, e senza pareggi, il rango del nuovo score fra n+1 valori è uniforme. Esattamente k ranghi sono coperti dalla soglia scelta: la probabilità di copertura è k/(n+1), almeno 1−α. Con pareggi il confronto ≤ può essere conservativo. La probabilità media riguarda sia la calibrazione casuale sia la nuova osservazione. Non afferma che ogni calibrazione fissata coprirà esattamente il 90%, né che ogni singolo input abbia quella probabilità condizionata. Addestrare o scegliere lo score usando le etichette di calibrazione può invalidare l’argomento.

Per n=99 e α=0,10 il rango è 90, quindi la copertura marginale teorica con score continui è 90/100. Per n=4 lo stesso obiettivo richiede rango 5 e un intervallo illimitato; il massimo di quattro score coprirebbe soltanto 4/5=80% in media. Il frammento usa aritmetica intera per il livello 90%, evitando ambiguità di arrotondamento. Non usa un’interpolazione generica fra quantili che potrebbe restituire una soglia diversa dalla statistica d’ordine richiesta.

2. Una miscela in cui il gruppo raro paga tutti gli errori

Nel regime A, presente nell’80% dei casi, il residuo assoluto R è uniforme fra 0 e 1 kW. Nel regime B, presente nel 20%, R è uniforme fra 0 e 6 kW. Si può costruire una previsione f=100 kW e aggiungere un errore di segno casuale con modulo R; per la copertura simmetrica basta studiare R. Il gruppo è noto al momento della previsione e la sua definizione è fissata prima della calibrazione. Le scale sono scelte per rendere il calcolo trasparente, non stimate da un impianto.

F(q) = 0.8·min(q/1,1) + 0.2·min(q/6,1), q ≥ 0 F(3) = 0.8·1 + 0.2·0.5 = 0.9 P(R≤3 | A)=1; P(R≤3 | B)=0.5

Il quantile 90% della popolazione è q=3 kW. L’intervallo ha ampiezza totale 6 kW per entrambi i regimi, ma la copertura è 100% in A e 50% in B. Non c’è un fallimento della garanzia marginale: la media ponderata è proprio 90%. C’è invece un disallineamento fra la domanda operativa, “quanto è affidabile l’intervallo nel regime B?”, e la quantità garantita. Usare la media globale per rispondere alla prima domanda è un errore di interpretazione.

3. Ripetere la calibrazione, non inventare un test enorme

Eseguiamo 2.000 estrazioni indipendenti di 99 residui, seed 20260924. Per ogni campione calcoliamo q e poi la copertura della popolazione usando le due CDF note. Non simuliamo milioni di punti test: in questo esempio la probabilità di copertura condizionata al q estratto si calcola esattamente. La media su calibrazioni è invece una stima Monte Carlo. Risultano 90,0234% globale, 99,9559% in A e 50,2937% in B. La deviazione standard della copertura globale fra calibrazioni è circa 3,04 punti percentuali, non l’errore standard della media.

4. Calibrare per gruppo: beneficio e costo informativo

Dividiamo gli stessi 99 residui per gruppo e calcoliamo un quantile con n_A e uno con n_B, usando in entrambi la correzione n_g+1. Sotto scambiabilità all’interno dei gruppi, definiti in anticipo, la prova dei ranghi si applica separatamente. Questo fornisce copertura marginale all’interno di ciascun gruppo, non una garanzia condizionata a ogni possibile x. Nel limite di popolazione q_A=0,9 e q_B=5,4 kW: ampiezze 1,8 e 10,8 kW, con media ponderata 3,6 kW. Il regime difficile riceve finalmente un intervallo più ampio.

CalibrazioneTotaleAB
Pooled0.9002340.9995590.502937
Groupwise0.9091900.9056670.923283
Coperture medie su 2.000 calibrazioni sintetiche; la linea tratteggiata indica il livello 0,90. Ogni copertura di test è calcolata dalla CDF nota, senza campionamento del test.
Coperture medie su 2.000 calibrazioni sintetiche; la linea tratteggiata indica il livello 0,90. Ogni copertura di test è calcolata dalla CDF nota, senza campionamento del test.

La simulazione per gruppi ottiene 90,5667% in A e 92,3283% in B. Il lieve eccesso è coerente con la discretizzazione del rango, più grossolana nel gruppo piccolo. Ma in tre calibrazioni B ha meno di nove osservazioni: la soglia richiesta è infinita. La media delle ampiezze su tutte le repliche è quindi infinita. La media 3,66475 kW vale soltanto per le 1.997 repliche con intervalli finiti e non deve essere presentata come media complessiva. Il risultato limite 3,6 kW non elimina questo problema a campione finito.

5. Limiti e decisione tecnica

Non si deve risolvere l’intervallo infinito sostituendolo silenziosamente con un massimo finito: si perderebbe la garanzia dichiarata. Un limite fisico noto della risposta può restringere l’insieme, ma è un’ipotesi aggiuntiva da documentare. In alternativa servono più dati, gruppi meno frammentati o un diverso obiettivo di copertura. Gruppi scelti dopo aver visto gli errori, o un classificatore di regime che sbaglia al test, richiedono una nuova analisi. Anche un cambio della frequenza dei regimi altera la copertura di una soglia globale fissata.

La guida di Angelopoulos e Bates, versione arXiv v6 del 7 dicembre 2022, è il riferimento consultato per procedura, diagnostica, calibrazione per gruppi e prova in appendice D. Qui la miscela, i parametri e la simulazione sono un esempio didattico autonomo; non riproducono un benchmark degli autori. Il punto conclusivo è operativo: un numero di copertura deve sempre specificare su quale popolazione è mediato, con quale calibrazione e a quale costo in ampiezza. La garanzia marginale è utile proprio quando la si interpreta per ciò che dimostra.

Angelopoulos A. N., Bates S., A Gentle Introduction to Conformal Prediction and Distribution-Free Uncertainty Quantification, arXiv:2107.07511v6 (2022), §§1,3,4.1, Appendix D.

from math import inf
def q90(scores):
    n = len(scores)
    k = (9*(n+1)+9)//10  # ceil(0.9*(n+1)), exact integer arithmetic
    return sorted(scores)[k-1] if k <= n else inf
print(q90([1., 2., 3., 4.]))
q = 3.
print(.8*min(q,1.) + .2*min(q/6.,1.))

Codice, dati e istruzioni · JSON. Calcoli didattici eseguiti con Python 3.14.0; figure con Matplotlib 3.11.2. Analisi con assistenza AI, senza dichiarare peer review o revisione umana. Copertina originale ImageGen, illustrativa: non documenta persone, sedi o installazioni EL-AI. Fonti consultate il 24 settembre 2026.