ELAI S.r.l.

Due sensori concordano: l’umidità è davvero più certa?

Dalla serra alla covarianza: perché due misure simili possono condividere lo stesso errore. Derivazione dei pesi, intervalli e simulazione riproducibile.

Due sensori concordano: l’umidità è davvero più certa?

Il problema: due conferme possono essere la stessa conferma

Un sistema di supporto all’irrigazione riceve due letture di umidità del suolo molto vicine. È naturale pensare che la seconda confermi la prima e che la media sia molto più affidabile. Ma i due sensori possono reagire allo stesso disturbo ambientale o condividere una calibrazione imperfetta. Se sbagliano nella stessa direzione, la loro concordanza non ci protegge da quell’errore. La domanda dell’articolo è quindi: quanta informazione nuova aggiunge davvero una seconda misura?

Abstract. Partiamo da due sensori con errore standard di due punti percentuali, introduciamo la correlazione e ricaviamo l’incertezza della media. Mostriamo poi come scegliere i pesi quando i sensori hanno qualità diversa e perché un peso negativo non è necessariamente un errore di algebra. Una simulazione di 200.000 coppie verifica quanto un intervallo apparentemente al 95% possa essere troppo ottimista. Dati e soglie sono didattici: nessuna misura in campo, raccomandazione agronomica o prestazione EL-AI è dedotta da questi numeri.

Che cosa stiamo misurando e in quali unità

Chiamiamo θ il contenuto volumetrico d’acqua, espresso in percentuale. Un valore 25 significa 25% del volume nel modello dell’esempio. Una variazione da 25 a 27 è di due punti percentuali, non del 2% relativo. Tutti gli errori e le deviazioni standard che seguono sono in punti percentuali; varianze e covarianze sono in punti percentuali al quadrato. Assumiamo che i due strumenti misurino la stessa grandezza nello stesso momento e volume rappresentativo. Se osservano zone diverse, la differenza può essere un segnale fisico, non rumore da cancellare.

Scriviamo y₁=θ+e₁ e y₂=θ+e₂. Le y sono letture; le e sono errori rispetto al valore vero. Assumiamo errori con media zero: ripetendo idealmente le condizioni, le sovrastime e le sottostime si compensano. Questo non significa che ogni lettura sia esatta. La varianza σ² è la media del quadrato dell’errore, e la sua radice σ descrive una scala tipica della dispersione. Un errore sistematico non corretto violerebbe l’ipotesi di media zero: torneremo su questo limite.

La covarianza registra ciò che gli errori fanno insieme

Due errori sono positivamente correlati quando tendono a essere entrambi sopra o entrambi sotto zero. La covarianza c=E[e₁e₂] riassume questa tendenza per errori centrati. Dividendo per σ₁σ₂ otteniamo ρ, la correlazione, senza unità e compresa tra −1 e 1. Correlazione zero non implica in generale indipendenza, ma basta a eliminare il termine incrociato nella varianza di una somma. Nel nostro esperimento useremo una distribuzione gaussiana congiunta, in cui la correlazione descrive interamente la dipendenza lineare tra le due componenti.

La media m=(y₁+y₂)/2 ha errore (e₁+e₂)/2. Per capire quanto sia incerta, eleviamo al quadrato: compaiono e₁², e₂² e due volte e₁e₂. Facendo la media di questi termini ricaviamo la formula. È proprio il prodotto degli errori, spesso omesso, a contenere l’informazione sulla concordanza ingannevole.

Var(m−θ) = (σ₁² + σ₂² + 2c)/4 σ₁ = σ₂ = σ ⇒ σ_m = σ √((1+ρ)/2)

Se ρ=0, otteniamo il noto miglioramento di un fattore √2 nella deviazione standard. Se ρ=1 e i sensori hanno uguale dispersione, la media non migliora affatto: gli errori coincidono. Con σ=2 e ρ=0,8, la deviazione della media è 1,897 punti, non 1,414. La seconda misura aggiunge qualcosa, ma molto meno di quanto suggerirebbe l’indipendenza. La formula vale esattamente per questa combinazione lineare; non abbiamo usato un’approssimazione di piccole perturbazioni.

Perché due letture possono sembrare molto coerenti

Guardiamo ora la differenza y₁−y₂. Il valore vero si cancella, quindi rimane e₁−e₂. La sua varianza è σ₁²+σ₂²−2c: il termine comune entra con segno negativo. Nel caso uguale, aumentando la correlazione la differenza diventa meno variabile, proprio mentre l’incertezza della media aumenta. Con i nostri numeri la deviazione della differenza è 1,265 punti. I sensori sembrano sempre più d’accordo, ma la loro media resta relativamente incerta. La concordanza misura soprattutto quanto differiscono gli errori, non quanto distano dalla verità.

ρDeviazione della media (punti)Misure indipendenti equivalenti
01.4142.000
0.51.7321.333
0.81.8971.111
1.02.0001.000

L’ultima colonna traduce la varianza in un numero intuitivo: quante misure indipendenti, ciascuna con varianza σ², darebbero la stessa varianza della nostra media? Risolvendo σ²/N_eff=σ²(1+ρ)/2 troviamo N_eff=2/(1+ρ). Con ρ=0,8, due letture valgono circa 1,11 letture indipendenti rispetto a questa sola metrica. Non è un conteggio universale dell’informazione e non autorizza ad applicare automaticamente la stessa correzione a qualunque modello AI.

Dal numero alla decisione: un intervallo troppo stretto

Supponiamo che la media letta sia 25. Con errori gaussiani e parametri noti, un intervallo centrato sulla stima con semiampiezza 1,96 σ_m ha copertura circa 95% in ripetute misure del medesimo valore vero. Ignorando la correlazione otteniamo 25±2,772, cioè circa [22,23;27,77]. Tenendone conto otteniamo 25±3,719, cioè [21,28;28,72]. Le letture non sono cambiate; è cambiata la valutazione di quanto possiamo fidarci della loro combinazione.

Immaginiamo una soglia puramente illustrativa a 22: il primo intervallo sembrerebbe completamente sopra la soglia, il secondo la attraversa. Non prescriviamo quando irrigare, perché ciò richiede terreno, coltura, profondità e costi di errore. Mostriamo invece come l’incertezza possa cambiare il grado di supporto a una decisione. Il 95% riguarda la procedura di intervallo sotto il modello, non una certezza su questa singola misura né una garanzia valida con qualsiasi distribuzione.

La simulazione: che cosa abbiamo realmente eseguito

Generiamo due variabili gaussiane standard indipendenti z₁ e z₂. Costruiamo e₁=2z₁ ed e₂=2(0,8z₁+0,6z₂). Il coefficiente 0,6 è √(1−0,8²): mantiene varianza quattro nel secondo errore. Il termine condiviso z₁ produce covarianza 3,2 e correlazione 0,8. Questo meccanismo rende trasparente la dipendenza, invece di invocare una funzione casuale senza spiegare i dati. Usiamo 200.000 coppie, NumPy 2.5.3 e seed 20260929; il programma e le versioni sono allegati.

La deviazione standard empirica della media è 1,8963 punti, vicina all’analitica 1,8974. Gli intervalli costruiti fingendo indipendenza coprono il vero valore nell’85,64% delle repliche, non nel 95%. Quelli con la covarianza corretta raggiungono il 95,05%. Sono frequenze di una simulazione, soggette a variabilità Monte Carlo, non misure di una serra. Il codice controlla che dispersione e coperture siano compatibili con i risultati attesi senza imporre l’uguaglianza numerica esatta tra frequenza campionaria e probabilità teorica.

A sinistra, la deviazione della media cresce con la correlazione degli errori; a destra, coperture osservate in 200.000 repliche gaussiane. Il tratteggio indica il 95% nominale, non una misura in campo.
A sinistra, la deviazione della media cresce con la correlazione degli errori; a destra, coperture osservate in 200.000 repliche gaussiane. Il tratteggio indica il 95% nominale, non una misura in campo.

Nel grafico sinistro osserviamo il ritorno verso i due punti di un solo sensore quando ρ tende a uno. Nel destro la distanza tra la prima barra e la linea tratteggiata mostra il costo dell’ipotesi sbagliata. L’esperimento non dimostra che tutti i sensori abbiano ρ=0,8: mette alla prova una conseguenza matematica di quell’ipotesi, scelta e dichiarata.

Quando i sensori sono diversi: scegliere i pesi

La media semplice è naturale se i sensori hanno la stessa qualità. Se il primo è più preciso, possiamo cercare una stima ŵ=w y₁+(1−w)y₂. La somma dei pesi uguale a uno garantisce che il valore vero resti θ quando gli errori hanno media zero. Non garantisce assenza di distorsione se gli strumenti sono mal calibrati. La varianza della stima è una parabola in w: minimizzarla significa scegliere, tra queste combinazioni lineari non distorte, quella con minore dispersione prevista dal modello.

V(w) = w²σ₁² + (1−w)²σ₂² + 2w(1−w)c V′(w) = 2w(σ₁²+σ₂²−2c) − 2(σ₂²−c) w* = (σ₂²−c)/(σ₁²+σ₂²−2c) V(w*) = (σ₁²σ₂²−c²)/(σ₁²+σ₂²−2c)

La seconda riga è la pendenza della varianza al variare del peso. Ponendola a zero otteniamo w*. Il denominatore è la varianza della differenza tra errori: se è strettamente positivo, la parabola ha un minimo unico. Il caso di errori identici ha denominatore zero e non va risolto dividendo per zero: qualunque combinazione con somma uno conserva lo stesso errore. La covarianza deve inoltre rispettare |c|≤σ₁σ₂; numeri arbitrari che violano questo limite non descrivono una distribuzione valida.

Prendiamo σ₁=1, σ₂=2 e inizialmente c=0. I pesi sono 0,8 e 0,2; per letture 24 e 26 la stima è 24,4, con varianza 0,8. Il sensore più preciso pesa di più. Se la covarianza è invece 1,6, mantenendo le stesse dispersioni, i pesi ottimali diventano 4/3 e −1/3. La stima è 23,333 e la varianza ancora 0,8. Non abbiamo cambiato le letture: abbiamo cambiato il modello di ciò che condividono i loro errori.

Il peso negativo sottrae una parte della componente comune: non significa che un sensore abbia “affidabilità negativa”. È una soluzione statistica condizionata a covarianze note e stabili. Può produrre una stima fuori dall’intervallo delle letture ed essere fragile se il modello degli errori è sbagliato. Se imponiamo pesi tra zero e uno, nel secondo esempio il minimo cade sul bordo w=1: usiamo solo il primo sensore e otteniamo varianza 1. Rinunciamo al miglioramento teorico per impedire l’estrapolazione. Il confronto rende esplicito il compromesso, senza prescrivere pesi negativi sul campo.

Aggiungere sensori non elimina una causa comune

Un modello ancora più intuitivo scrive eᵢ=b+ηᵢ: b è un disturbo condiviso, mentre le η sono disturbi individuali indipendenti e indipendenti da b. Tutti hanno media zero nelle ripetizioni considerate. Scegliamo Var(b)=3,2 e Var(ηᵢ)=0,8, così ciascun sensore ha varianza quattro e ogni coppia correlazione 0,8. La media di N sensori ha errore b più la media delle η. Il primo termine resta intero; soltanto il secondo si riduce.

Var(mean error) = 3.2 + 0.8/N N → ∞ ⇒ standard deviation → √3.2 = 1.789 points

Passare da due a dieci sensori riduce la deviazione da 1,897 a 1,811 punti; cento sensori arrivano a 1,791. Il limite non è zero. Se b fosse invece un errore fisso di calibrazione, non una variabile centrata tra repliche, la media conserverebbe quel bias e la sola varianza non descriverebbe più l’errore complessivo. Occorre correggere o caratterizzare la causa comune, non soltanto acquistare più strumenti dello stesso tipo. Questa è un’analisi del modello, non una previsione economica di un impianto reale.

Che cosa bisogna stimare prima di usare la formula

La correlazione delle letture grezze non è la correlazione degli errori: due sensori corretti seguono entrambi le vere variazioni d’umidità. Servono confronti con un riferimento e residui rispetto allo stesso valore, su condizioni rappresentative. Anche il riferimento può avere incertezza condivisa che va propagata, non scambiata per un difetto dei sensori. Una sola coppia 24/26 non consente di stimare ρ. Servono repliche e una separazione ragionata tra variabilità del suolo, deriva e rumore strumentale.

Se la covarianza è stimata da pochi dati, trattarla come nota nasconde un’altra fonte d’incertezza. È utile confrontare il comportamento per più valori plausibili di ρ, verificare le stime su una campagna separata e distinguere condizioni operative. Una rete AI che riceve le due letture non rende automaticamente indipendenti gli ingressi; anche una fusione appresa va valutata rispetto a errori comuni e cambiamenti ambientali. Non basta aggiungere una colonna al dataset per ottenere una prova indipendente in più.

La risposta e le fonti

Due sensori concordi aiutano davvero quando portano errori almeno in parte diversi, e quando questa diversità è misurata correttamente. Nel nostro esempio la media resta utile, ma ignorare la correlazione trasforma un intervallo nominale al 95% in uno che copre circa l’86% delle simulazioni. La scelta dei pesi può migliorare la stima, ma dipende da ipotesi verificabili. Per progettare un sistema AI alimentato da sensori, il punto non è contare quante letture abbiamo: è capire quali incertezze possono ridursi insieme e quali rimangono condivise.

Il riferimento metrologico è la legge di propagazione dell’incertezza del NIST, che include le covarianze; qui la derivazione è esatta per il caso lineare. Per la notazione gaussiana e i modelli di misura abbiamo consultato Särkkä, Bayesian Filtering and Smoothing (2013), capitolo 3.1 e appendice A.1. Gli esempi agricoli e la simulazione sono una nostra elaborazione didattica, non risultati sperimentali di quelle fonti, ricerca originale o un’installazione EL-AI. Il frammento seguente ricostruisce i casi analitici; il pacchetto allegato include la simulazione completa, seed e figure.

NIST — Combining uncertainty components.

Särkkä (2013) — Bayesian Filtering and Smoothing, 3.1 and A.1.

from math import sqrt
sigma, rho = 2.0, 0.8  # synthetic percentage points
print("independence assumption:", sigma/sqrt(2))
print("correlation-aware sd:", sigma*sqrt((1+rho)/2))
v1, v2, c = 1.0, 4.0, 1.6
w = (v2-c)/(v1+v2-2*c)
print("weights:", w, 1-w)
print("variance:", (v1*v2-c*c)/(v1+v2-2*c))
# Full seeded simulation and data are in the downloadable archive.

Codice, dati e istruzioni · JSON. Calcoli didattici eseguiti con Python 3.14.0; figure con Matplotlib 3.11.2. Analisi con assistenza AI, senza dichiarare peer review o revisione umana. Copertina originale ImageGen, illustrativa: non documenta persone, sedi o installazioni EL-AI. Fonti consultate il 29 settembre 2026.