成本不在拍照,而在赋予图像含义
农业企业在巡检中收集大量图像,却只能请专家标注一部分。标注意味着给图像添加类别或其他经验证信息,用于训练和评估模型。选择 AI 最不确定的图像,是否就能用好专家时间?未必。同一片叶子的连续两张照片都可能很难,却几乎描述同一个问题,其他拍摄条件仍未被探索。
问题限定为:预算只有两个新标签,如何避免都花在已被代表的区域?我们用平面上的六个点表示六张虚构图像,比较不确定性选择与几何覆盖,推导保证并揭示局限。坐标和概率都是合成的,不含农艺测量、不诊断植物,也不展示 EL-AI 项目成果。
这是图像地图,不是田地地图
嵌入是对象的数值表示,网络可将图像变为向量。如果表示适合任务,相关特征相似的图像可能具有相近向量。“如果”很关键:距离可能反映光照和背景,而非要识别的性质。本例只用两个任意单位的抽象分量展示推理,不是经纬度,也不是真实图像投影。
L 是原点处已标注图像。A、B 接近 L,C、D 构成第二区域,E、F 构成第三区域。每个候选还有合成二分类置信度。这里最不确定是指获胜置信度最接近 0.5;所有置信度至少为 0.5,因此选择最小的两个,即 A、B。该规则不考虑两者之间多么相似。
| 点 | x₁ | x₂ | 置信度 |
|---|---|---|---|
| L | 0 | 0 | — |
| A | 0.2 | 0 | 0.5 |
| B | 0.3 | 0.1 | 0.51 |
| C | 4 | 0 | 0.8 |
| D | 4.2 | 0.2 | 0.78 |
| E | 0 | 4 | 0.9 |
| F | 0.2 | 4.1 | 0.88 |
覆盖一个集合意味着什么
将每个点连接到最近的已标注表示。最长线段指向代表最不足的区域,其长度就是覆盖半径。最小化它,意味着不让任何候选离所选示例太远,但不意味着已知邻近点标签,也不保证同类。这是几何替代指标,只有几何相关时才有用。
U 含六个候选,S 含两个待标注点,d 为欧氏距离。内层最小值为每点选择最近中心,外层最大值选择最差点。所选点到自身距离为零,L 不占预算但始终可用。这避免忘记已有标注,或优化平均距离却声称最坏情况保证的错误。
S = {A,B} 时,F 到最近中心 B 的距离为 √[(0.2−0.3)² + (4.1−0.1)²] = √16.01,约 4.00125,也是最终半径。两个原点附近标签充分覆盖一块区域,却几乎忽略其他区域。这是构造示例,并不证明不确定性采样总是错误;若重要类别边界恰在此处,这些标签可能很有价值。
每次选择代表最不足的点
最远优先是贪心算法:每步做当前最合适的选择,不枚举全部未来组合。从 L 开始,计算各候选到最近中心的距离,选最大者并加入中心,再更新距离,直到预算用尽。更新很重要:选 D 后,附近 C 不应保留旧优先级。
最初 D 距 L 为 √17.68 ≈ 4.20476,比其他候选都远,因此先选 D。C 随即距 D 约 0.28284,而 F 距 L 仍约 4.10488,成为第二选择。有了 {L,D,F},最大剩余距离是 B 到 L,约 0.31623;C 到 D、E 到 F 更小。覆盖半径于是从不确定性选择的 4.00125 降到几何选择的 0.31623。

这个选择有多好?有边界的保证
可以比较全部配对:六个候选共有 6 × 5 / 2 = 15 种组合。脚本枚举发现 {C,E} 属于最优解,半径 0.31623。这里贪心达到最优,但并非总能如此。一般保证更弱:采用度量距离、固定初始中心时,贪心半径至多为最优半径的两倍。两倍指距离,不是分类错误或节省标签数量。
设预算为 b,最终贪心半径为 r。取 b 个已选点,再加最后一步后的最远点。这 b + 1 个点两两至少相距 r:每个新点当时离现有中心最远,增加中心不会增大最大距离。它们距初始中心也至少为 r。反设 r 大于 2r_opt,则初始中心无法在 r_opt 内覆盖任何一个。最优解仅有 b 个新中心,却要覆盖 b + 1 点,必有两点共享中心。三角不等式使它们距离不超过 2r_opt,与至少为 r 矛盾,公式得证。
证明也说明如何避免误用。任意相似度未必满足三角不等式,例如欧氏距离的平方就不具有同样性质。证明不涉及标签、噪声或植物疾病。要将覆盖转为准确率承诺,还需模型及表示与类别关系的额外假设;我们没有验证这些假设。
当多样性追逐孤立点
加入 O = (7,7),合成置信度为 0.99。它可能代表不同背景、采集错误,或真正重要的罕见情况;几何无法判别。贪心选 O、D,半径约 4.10488。枚举 21 对后,{B,O} 属于最佳覆盖,半径 4.00125。这是贪心非最优但仍满足已证界限的具体例子。
| 加入 O | 新中心 | 最大半径 | 平均距离 |
|---|---|---|---|
| Greedy | O,D | 4.10488 | 1.27199 |
| min max | B,O | 4.00125 | 2.23669 |
| min mean | D,E | 7.35391 | 1.19666 |
表中均值包含全部七个候选,已选点贡献零。最小化均值会选 {D,E}:多数点表示良好,但 O 很远。最小化最大值则牺牲平均覆盖来保护最差情况。不存在脱离目标的赢家。若 O 是拍摄故障,追逐它可能浪费预算;若记录重要罕见情况,忽略它可能才是错误。应检查数据和目的,而非自动删除所有异常。
距离取决于如何表示图像
另一项计算把第一坐标乘以 0.1。在不含 O 的原池上,贪心变为先 F 后 D:最终集合不变,但顺序改变。新半径约 0.20100,不代表优于 0.31623,因为尺子变了,数值不能直接比较。真实系统中权重、归一化、表示网络可能放大颜色、纹理或背景。标准化分量本身并不保证农业意义上的距离。
预算也需明确定义。这里两幅图恰好花两单位。类别标签和逐像素轮廓耗时可能差异很大,模糊图像可能需专家。优化两项不等于优化二十分钟。不等成本改变组合问题,不能将上述保证自动移植到距离除以成本的启发式。
代码、计算成本与实地验证
下载包含坐标、置信度、贪心选择及配对枚举。末尾代码调用 run,打印情景、方法、选择及半径;JSON 还保存平均距离。数据和规则确定,平局按字母顺序,无需随机种子。不训练网络,也未获取真实农业图像。贪心与最优半径比例断言仅检查这些有限实例;证明解释假设下的一般结果。
设 N 个候选、维度 d、新标签 b。缓存当前最小距离的实现,每步更新 N 个距离,成本 O(Nbd),另加与已有中心的初始比较。保存最小值需 O(N) 额外内存,不需完整 N × N 矩阵。我们的脚本优先可读性,重算全部中心距离,成本 O(Nb(|L| + b)d)。枚举所有配对并评价 N 点为 O(N³d)。这些是运算计数,不是设备延迟或内存测量。
要确认农业价值,还需实际标注,在可比预算下训练同一模型,并包含随机选择基线。当相关性重要时,测试应按地块、季节或采集序列隔离;训练与测试近重复帧会让任何策略显得有效。需多次重复并记录专家投入。这是尚未执行的实验建议,不报告准确率提升、经济节省或 EL-AI 结果。
研究与结论:覆盖只是一个问题
Sener 与 Savarese 的 ICLR 2018 论文联系代表子集选择与主动学习,分析理论假设并用图像网络测试稳健优化。本文只研究基础几何,不复现其网络、基准或稳健优化。
研究不限于 k-center。Cohen-Addad 等人的 ICML 2026 论文利用低秩结构和损失敏感度研究选择与加权。其目标、假设与这里的几何覆盖不同,并不使最远点选择普遍最优。
最初问题有了明确答案:预算少时,仅看不确定性可能两次购买几乎相同的几何信息。每次选择后更新覆盖可避免这类冗余,并具有可证明的度量保证。但它不判断表示是否相关、罕见点是否值得关注,或新标签是否改善模型。真正有用的是分开并测量这些决定,始终围绕标注所服务的农业问题。
参考文献与可复现性
Cohen-Addad et al. — ICML 2026, PMLR 306:21154–21175.
Cohen-Addad et al. — full methods and experiments, arXiv 2606.16045 v1.
from experiment import run
r = run()
for case in r['results']:
print(case['scenario'])
for m in case['methods']:
print(m['method'], m['selected'], round(m['radius'], 6))
代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 10 月 4 日。

