El problema: dos confirmaciones pueden ser la misma
Un sistema de apoyo al riego recibe dos lecturas de humedad parecidas. Es natural considerar la segunda una confirmación y la media mucho más fiable. Sin embargo, ambos sensores pueden responder a la misma perturbación o compartir una calibración imperfecta. Coincidir no protege frente a un error en la misma dirección. La pregunta es cuánta información nueva añade realmente otra medida.
Resumen. Partimos de sensores con desviación estándar del error de dos puntos porcentuales, introducimos correlación y derivamos incertidumbre de la media. Elegimos pesos para calidades distintas y explicamos por qué un peso negativo no implica error algebraico. Una simulación de 200.000 pares verifica el optimismo de un intervalo nominal del 95%. Datos y umbrales son didácticos: no representan mediciones de campo, recomendaciones agronómicas ni rendimiento EL-AI.
Qué medimos y con qué unidades
Llamamos θ al contenido volumétrico de agua en porcentaje. El valor 25 representa 25% del volumen. Pasar de 25 a 27 son dos puntos porcentuales, no un 2% relativo. Errores y desviaciones se expresan en puntos; varianzas y covarianzas, en puntos cuadrados. Suponemos igual magnitud, instante y volumen representativo. Si observan zonas distintas, las diferencias pueden ser señal física y no ruido eliminable.
Escribimos y₁=θ+e₁ e y₂=θ+e₂. Las y son lecturas y las e errores respecto a la verdad. Suponemos media cero: en repeticiones ideales se compensan sobreestimaciones y subestimaciones. Cada lectura puede ser inexacta. La varianza σ² es aquí el error cuadrático medio; su raíz σ describe la dispersión. Un sesgo sistemático sin corregir viola la media cero; volveremos a ese límite.
La covarianza registra cómo se mueven juntos los errores
Los errores se correlacionan positivamente cuando tienden a estar ambos por encima o por debajo de cero. La covarianza c=E[e₁e₂] resume esa tendencia para errores centrados. Dividir por σ₁σ₂ da correlación ρ, sin unidades entre −1 y 1. Correlación cero no implica siempre independencia, pero elimina el término cruzado de la varianza de una suma. Usaremos una distribución gaussiana conjunta.
La media m=(y₁+y₂)/2 tiene error (e₁+e₂)/2. Al elevarlo al cuadrado aparecen e₁², e₂² y dos veces e₁e₂. Tomamos expectativas y obtenemos la fórmula. El producto de errores, a menudo omitido, contiene la concordancia engañosa.
Con ρ=0 obtenemos la mejora √2 en desviación estándar. Con ρ=1 e igual dispersión, promediar no ayuda: los errores coinciden. Si σ=2 y ρ=0,8, la desviación es 1,897 puntos, no 1,414. Otra lectura ayuda, mucho menos que bajo independencia. La fórmula es exacta para esta combinación lineal, sin aproximación de perturbaciones pequeñas.
Por qué dos lecturas pueden parecer muy coherentes
Examinemos y₁−y₂: se cancela la verdad y queda e₁−e₂, con varianza σ₁²+σ₂²−2c. El término común entra negativamente. En sensores iguales, más correlación reduce variabilidad de la diferencia mientras aumenta incertidumbre de la media. Aquí la desviación de la diferencia es 1,265 puntos. Coinciden más, pero la media sigue incierta. Concordancia mide diferencia de errores, no distancia a la verdad.
| ρ | Desviación de la media (puntos) | Medidas independientes equivalentes |
|---|---|---|
| 0 | 1.414 | 2.000 |
| 0.5 | 1.732 | 1.333 |
| 0.8 | 1.897 | 1.111 |
| 1.0 | 2.000 | 1.000 |
La última columna pregunta cuántas lecturas independientes de varianza σ² igualarían esa varianza. Resolver σ²/N_eff=σ²(1+ρ)/2 da N_eff=2/(1+ρ). Con ρ=0,8, dos equivalen a unas 1,11 independientes solo para esta métrica. No es un conteo universal de información ni una corrección automática de cualquier modelo de IA.
Del número a la decisión: un intervalo demasiado estrecho
Supongamos media observada 25. Con errores gaussianos y parámetros conocidos, un intervalo centrado con semianchura 1,96 σ_m cubre aproximadamente 95% de las repeticiones del valor verdadero fijo. Ignorar correlación da 25±2,772, unos [22,23;27,77]. Considerarla da 25±3,719, unos [21,28;28,72]. No cambiaron las lecturas, sino la incertidumbre asignada.
Imaginemos un umbral exclusivamente ilustrativo de 22: el primer intervalo queda encima; el segundo lo cruza. No prescribimos riego: harían falta suelo, cultivo, profundidad y costes de error. Mostramos cómo la incertidumbre cambia el apoyo a una decisión. El 95% es cobertura del procedimiento bajo el modelo, no certeza sobre esta medida ni garantía para toda distribución.
La simulación: qué ejecutamos realmente
Generamos gaussianas estándar independientes z₁ y z₂ y hacemos e₁=2z₁, e₂=2(0,8z₁+0,6z₂). El 0,6=√(1−0,8²) mantiene varianza cuatro. Compartir z₁ produce covarianza 3,2 y correlación 0,8. Así queda explícita la dependencia. Usamos 200.000 pares, NumPy 2.5.3 y semilla 20260929; se adjuntan código y versiones.
La desviación empírica de la media es 1,8963, cerca de 1,8974 analítica. Los intervalos que fingen independencia cubren el 85,64%, no el 95%; con covarianza correcta, el 95,05%. Son frecuencias simuladas con variación Monte Carlo, no medidas de invernadero. El código verifica compatibilidad con tolerancia, no igualdad exacta entre frecuencia y probabilidad.

En la izquierda se vuelve hacia los dos puntos de un sensor al acercarse ρ a uno. En la derecha, la distancia entre primera barra y línea muestra el coste del supuesto erróneo. No demostramos que todos los sensores tengan ρ=0,8, sino una consecuencia de esa hipótesis explícita.
Sensores distintos: elegir pesos
La media simple sirve para igual calidad. Si el primero es más preciso, buscamos ŵ=w y₁+(1−w)y₂. Los pesos suman uno y preservan θ con errores centrados, pero no eliminan sesgo de calibración. La varianza es cuadrática en w; minimizarla elige menor dispersión prevista entre combinaciones lineales insesgadas.
La segunda línea es la pendiente de varianza respecto al peso. Igualarla a cero da w*. El denominador es la varianza de la diferencia; si es positivo hay mínimo único. Errores idénticos dan denominador cero: no se divide por cero, cualquier combinación de suma uno conserva el error. Debe cumplirse |c|≤σ₁σ₂; fuera de ello no hay distribución válida.
Con σ₁=1, σ₂=2 y c=0, los pesos son 0,8 y 0,2. Lecturas 24 y 26 dan 24,4 y varianza 0,8; pesa más el preciso. Si la covarianza pasa a 1,6 con igual dispersión, los pesos son 4/3 y −1/3, estimación 23,333 y varianza 0,8. Cambiamos el modelo de error compartido, no las lecturas.
El peso negativo resta parte común, no significa «fiabilidad negativa». Supone covarianzas conocidas y estables. Puede salir del intervalo de lecturas y ser frágil ante un modelo incorrecto. Restringir pesos a [0,1] lleva el segundo mínimo a w=1: solo el primer sensor, varianza 1. Renunciamos a mejora teórica para evitar extrapolar; no prescribimos pesos negativos en campo.
Más sensores no eliminan una causa común
Escribimos eᵢ=b+ηᵢ: b es perturbación compartida; las η son individuales e independientes entre sí y de b. Todas tienen media cero en las repeticiones consideradas. Con Var(b)=3,2 y Var(ηᵢ)=0,8, cada varianza es cuatro y correlación 0,8. Promediar N conserva b y reduce solo la media de las η.
De dos a diez sensores la desviación baja de 1,897 a 1,811 puntos; cien dan 1,791. El límite no es cero. Si b fuese sesgo fijo de calibración, no variable centrada entre repeticiones, la media lo conservaría y la varianza no describiría el error total. Hay que corregir o caracterizar la causa común, no solo añadir instrumentos iguales. Es análisis del modelo, no economía de una instalación real.
Qué estimar antes de usar la fórmula
Correlación de lecturas no equivale a correlación de errores: ambos sensores correctos siguen cambios reales. Hacen falta referencia y residuos respecto al mismo valor en condiciones representativas. La referencia puede añadir incertidumbre compartida, que debe propagarse. Un par 24/26 no estima ρ; se necesitan repeticiones y separar variación del suelo, deriva y ruido.
Estimar covarianza con pocos datos y tratarla como conocida oculta incertidumbre. Conviene comparar valores plausibles de ρ, validar en otra campaña y distinguir condiciones. Una red de IA no vuelve independientes sus entradas; la fusión aprendida también debe evaluarse ante errores comunes y cambios ambientales. Otra columna no añade automáticamente evidencia independiente.
La respuesta y las fuentes
Sensores concordantes ayudan si sus errores son parcialmente distintos y se caracteriza bien esa diferencia. La media sigue siendo útil, pero ignorar correlación convierte 95% nominal en cerca de 86% simulado. Los pesos mejoran bajo hipótesis verificables. En IA con sensores importa qué incertidumbres se reducen y cuáles siguen compartidas, no solo contar lecturas.
La referencia metrológica es NIST y su propagación con covarianzas; la derivación lineal es exacta. Para notación gaussiana y medidas consultamos Särkkä, Bayesian Filtering and Smoothing (2013), sección 3.1 y apéndice A.1. Ejemplos y simulación son análisis didáctico propio, no experimentos de esas fuentes, investigación original ni instalación EL-AI. El fragmento reproduce casos analíticos; el archivo incluye simulación, semilla y gráficos.
NIST — Combining uncertainty components.
Särkkä (2013) — Bayesian Filtering and Smoothing, 3.1 and A.1.
from math import sqrt
sigma, rho = 2.0, 0.8 # synthetic percentage points
print("independence assumption:", sigma/sqrt(2))
print("correlation-aware sd:", sigma*sqrt((1+rho)/2))
v1, v2, c = 1.0, 4.0, 1.6
w = (v2-c)/(v1+v2-2*c)
print("weights:", w, 1-w)
print("variance:", (v1*v2-c*c)/(v1+v2-2*c))
# Full seeded simulation and data are in the downloadable archive.
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 29 de septiembre de 2026.

