问题:两次确认可能只是同一次确认
灌溉决策支持系统收到两条很接近的土壤湿度读数。人们容易把第二条当作确认,认为平均值可靠得多。但两个传感器可能受到相同环境扰动,或共享不完善的校准。若误差方向相同,一致性并不能消除误差。本文要回答:第二次测量究竟增加了多少新信息?
摘要。从误差标准差均为两个百分点的传感器出发,引入相关性并推导平均值的不确定性。再为精度不同的传感器选择权重,解释负权重为何不一定是代数错误。模拟200,000对误差,检验标称95%区间如何过于乐观。数据和阈值仅用于教学,不代表田间测量、农艺建议或EL-AI性能。
测量什么,使用什么单位?
用θ表示以百分数计的体积含水率,25表示示例中的体积占比25%。从25到27是增加两个百分点,而非相对增加2%。后文误差和标准差以百分点计,方差与协方差以百分点平方计。假设两仪器测量同一时刻、同一代表体积中的同一量。若观察不同区域,差异可能是真实信号,不能简单消除。
写成y₁=θ+e₁、y₂=θ+e₂,y为读数,e为相对真值的误差。假设误差均值为零,即理想重复中高估和低估相互抵消,并非每条读数准确。这里方差σ²为误差平方的期望,平方根σ描述典型离散程度。未校正的系统偏差违反零均值假设,后文会讨论。
协方差描述误差如何共同变化
当两个误差倾向同时高于零或低于零时,它们正相关。对于中心化误差,协方差c=E[e₁e₂]概括这种关系,除以σ₁σ₂得到无量纲相关系数ρ,介于−1与1。零相关通常不等于独立,但足以消除和的方差中的交叉项。实验使用联合高斯分布,以相关系数描述两分量间线性依赖。
平均值m=(y₁+y₂)/2的误差是(e₁+e₂)/2。平方后出现e₁²、e₂²和两倍e₁e₂,再求期望便得下式。常被忽略的误差乘积正包含误导性一致的信息。
ρ=0时标准差改善√2倍;ρ=1且离散相同,误差一致,平均毫无改善。σ=2、ρ=0.8时,平均标准差为1.897个百分点,而非1.414。第二条读数有帮助,但远小于独立假设所暗示的程度。对这种线性组合公式是精确的,无需小扰动近似。
为什么两个读数看起来很一致
再看差值y₁−y₂,真值抵消,剩e₁−e₂,方差为σ₁²+σ₂²−2c。共同项带负号。相同传感器的相关性越高,差值波动越小,平均值不确定性却越大。本例差值标准差1.265个百分点。传感器更一致,平均仍不确定。一致性主要反映误差之间的差异,而非距真值多远。
| ρ | 平均值标准差(百分点) | 等效独立测量数 |
|---|---|---|
| 0 | 1.414 | 2.000 |
| 0.5 | 1.732 | 1.333 |
| 0.8 | 1.897 | 1.111 |
| 1.0 | 2.000 | 1.000 |
末列问:每条方差σ²的独立测量,需要多少条才与当前平均方差相同?由σ²/N_eff=σ²(1+ρ)/2得N_eff=2/(1+ρ)。ρ=0.8时,仅就该指标,两条约等效1.11条独立测量。这不是通用信息计数,也不能自动用于任何AI模型。
从数字到决策:区间过窄
假设平均读数25。在高斯误差且参数已知时,以估计值为中心、半宽1.96 σ_m的区间对固定真值有约95%的重复测量覆盖率。忽略相关得到25±2.772,约[22.23,27.77];计入相关得到25±3.719,约[21.28,28.72]。读数没变,改变的是组合不确定性的评估。
设纯教学阈值22,第一区间完全高于阈值,第二区间跨过阈值。这不是灌溉处方,实际还需土壤、作物、深度和错误成本。例子说明不确定性如何改变决策证据。95%是模型下区间程序的覆盖率,不是对本次读数的确定性,也不是任意分布下的保证。
模拟:实际执行了什么
生成独立标准高斯z₁、z₂,构造e₁=2z₁、e₂=2(0.8z₁+0.6z₂)。0.6=√(1−0.8²),保持第二误差方差为4。共享z₁产生协方差3.2、相关0.8,明确展示依赖来源。使用200,000对、NumPy 2.5.3、种子20260929,附代码和版本。
平均误差的经验标准差为1.8963,接近理论1.8974。假装独立的区间仅85.64%覆盖真值,而非95%;正确协方差区间达到95.05%。这些是有蒙特卡洛波动的模拟频率,不是温室测量。代码用容差检查一致性,不要求经验频率精确等于理论概率。

左图ρ趋近1时,不确定性回到单传感器的两个百分点。右图第一柱与虚线的差距显示错误假设的代价。实验没有证明所有传感器ρ都为0.8,只检验明确选定假设的数学后果。
传感器不同:选择权重
精度相同时可取简单平均。若第一传感器更精确,寻找ŵ=w y₁+(1−w)y₂。权重和为1,在误差零均值时保持真值θ,但不能消除校准偏差。方差是w的二次函数,最小化它即在这些无偏线性组合中选择模型预测离散最小者。
第二行是方差对权重的斜率,设为零得到w*。分母为误差差值的方差,严格为正时最小值唯一。误差相同会使分母为零,不能除以零,此时任何权重和为1的组合都保留相同误差。协方差还必须满足|c|≤σ₁σ₂,违反此条件的数字不能表示有效分布。
取σ₁=1、σ₂=2,先设c=0,权重0.8和0.2,读数24与26给出估计24.4、方差0.8,较精确传感器权重更大。若离散不变而协方差为1.6,最优权重变成4/3和−1/3,估计23.333、方差仍0.8。变的是共享误差模型,不是读数。
负权重减去部分共同成分,不代表“负可靠性”。它依赖已知且稳定的协方差,估计可超出读数范围,误差模型不准时也可能脆弱。若限制权重在[0,1],第二例最小值在w=1,只用第一传感器,方差1。牺牲理论改善以避免外推,并非建议田间直接用负权重。
增加传感器不能消除共同原因
写作eᵢ=b+ηᵢ,b为共同扰动,η为彼此独立且与b独立的个体扰动,在所讨论重复中均为零均值。设Var(b)=3.2、Var(ηᵢ)=0.8,每个方差4,两两相关0.8。N个平均后的误差仍是完整b加η的平均,只有后者缩小。
从2个到10个,标准差仅由1.897降到1.811,100个为1.791,极限不是零。若b是固定校准偏差而非跨重复中心化变量,平均会保留偏差,仅方差不能描述总误差。应校正或刻画共同原因,而非只增加同类仪器。这是模型分析,不是真实设施经济预测。
使用公式前必须估计什么
原始读数相关不等于误差相关,正确传感器也会共同跟随真实湿度变化。需要参考值和相对同一真值的残差,覆盖代表性条件。参考本身也可能引入共享不确定性,应传播它而非误判为传感器缺陷。一对24/26无法估计ρ,需要重复并区分土壤变异、漂移和仪器噪声。
少量数据估计协方差却视为已知,会隐藏额外不确定性。应比较多个合理ρ,在独立测试中验证并区分工况。AI网络接收两条读数并不会使其独立,学习式融合也需评估共同误差与环境变化。多一列数据不自动意味着多一次独立证据。
结论与来源
一致的传感器只有在误差至少部分不同、且正确刻画这种差异时才真正有帮助。本例平均仍有用,但忽略相关会使标称95%区间只覆盖约86%的模拟。权重可在可验证假设下改善估计。设计传感器驱动AI时,重要的不只是读数数量,而是哪些不确定性可缩小、哪些仍共享。
计量参考为NIST包含协方差的不确定性传播定律,本文线性推导是精确的。高斯记号与测量模型参考Särkkä《Bayesian Filtering and Smoothing》(2013)第3.1节及附录A.1。农业例子和模拟是教学分析,不是来源中的实验、原创研究或EL-AI安装项目。下方片段重建解析例子,附件含完整模拟、种子和图。
NIST — Combining uncertainty components.
Särkkä (2013) — Bayesian Filtering and Smoothing, 3.1 and A.1.
from math import sqrt
sigma, rho = 2.0, 0.8 # synthetic percentage points
print("independence assumption:", sigma/sqrt(2))
print("correlation-aware sd:", sigma*sqrt((1+rho)/2))
v1, v2, c = 1.0, 4.0, 1.6
w = (v2-c)/(v1+v2-2*c)
print("weights:", w, 1-w)
print("variance:", (v1*v2-c*c)/(v1+v2-2*c))
# Full seeded simulation and data are in the downloadable archive.
代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 9 月 29 日。

