ELAI S.r.l.

¿Qué imágenes agrícolas etiquetar? Cuando la incertidumbre elige dos veces el mismo problema

Aprendizaje activo con dos etiquetas de presupuesto: diversidad geométrica, algoritmo voraz, prueba del factor dos y límites de cobertura y atípicos.

¿Qué imágenes agrícolas etiquetar? Cuando la incertidumbre elige dos veces el mismo problema

El coste no es la foto, sino darle significado

Una empresa agrícola recoge muchas imágenes de inspección, pero los expertos solo pueden etiquetar algunas. Etiquetar asigna una categoría u otra información verificada para entrenar y evaluar un modelo. ¿Elegir las imágenes donde la IA duda más aprovecha el tiempo? Quizá. Dos fotos consecutivas de una hoja pueden ser difíciles y describir casi el mismo problema, dejando otras condiciones sin explorar.

La pregunta es limitada: con presupuesto para dos etiquetas nuevas, ¿cómo evitar gastarlas en una zona ya representada? Seis imágenes imaginarias serán puntos en un plano. Comparamos incertidumbre y cobertura geométrica, derivamos una garantía y exponemos límites. Coordenadas y probabilidades son sintéticas: no son medidas agronómicas, diagnósticos vegetales ni resultados de EL-AI.

Un mapa de imágenes, no del terreno

Un embedding es una representación numérica: una red transforma imágenes en vectores. Si sirve al objetivo, imágenes similares en características relevantes tendrán vectores cercanos. Ese «si» importa: la cercanía puede reflejar luz y fondo, no lo que queremos reconocer. Usamos dos componentes abstractas en unidades arbitrarias para visualizar el razonamiento. No son coordenadas geográficas ni proyección de imágenes reales.

L es una imagen etiquetada en el origen. A y B están cerca; C y D forman otra zona; E y F una tercera. Asignamos confianza sintética de clasificación binaria. Máxima incertidumbre significa confianza ganadora cercana a 0,5. Todas superan o igualan 0,5: elegimos las dos menores, A y B. La regla ignora la similitud entre ambas elecciones.

Puntox₁x₂Confianza
L00—
A0.200.5
B0.30.10.51
C400.8
D4.20.20.78
E040.9
F0.24.10.88

Qué significa cubrir un conjunto

Conectemos cada punto a la representación etiquetada más cercana. El segmento más largo señala la zona peor representada. Su longitud es el radio de cobertura: minimizarlo busca que ningún candidato quede demasiado lejos. No revela etiquetas vecinas ni garantiza una clase común. Es una medida geométrica sustituta, útil solo si la geometría es pertinente.

d(x,y) = √[(x₁−y₁)² + (x₂−y₂)²] r(S) = maxₓ∈U min_c∈({L}∪S) d(x,c); |S| = 2

U contiene seis candidatos y S los dos por etiquetar. d es euclídea. El mínimo busca el centro más cercano; el máximo el peor punto. Los seleccionados están a distancia cero de sí mismos y L no consume presupuesto. Evitamos olvidar etiquetas previas u optimizar la media mientras declaramos una garantía del peor caso.

Con S = {A,B}, F queda a √[(0,2−0,3)² + (4,1−0,1)²] = √16,01 ≈ 4,00125 del centro más cercano B. Es el radio final. Dos etiquetas cercanas al origen cubren una zona e ignoran casi las otras. Es un ejemplo construido, no prueba de que incertidumbre siempre falle: si ahí está un límite entre clases importantes, las etiquetas podrían ser valiosas.

Elegir cada vez el punto menos representado

Farthest-first, «primero el más lejano», es voraz: elige lo mejor del paso sin enumerar combinaciones futuras. Desde L calcula distancias al centro más cercano, toma la mayor y añade el punto. Actualiza y repite hasta agotar presupuesto. Actualizar importa: tras elegir D, C no debe conservar su prioridad antigua.

x* = argmaxₓ∈U\S d_min(x) S ← S ∪ {x*}; d_min(x) ← min[d_min(x), d(x,x*)]

Al inicio D dista √17,68 ≈ 4,20476 de L, más que cualquier candidato. Después C queda a 0,28284 de D, mientras F sigue a 4,10488 de L y se elige segundo. Con {L,D,F}, la mayor distancia residual es B a L, aproximadamente 0,31623; C a D y E a F son menores. El radio baja de 4,00125 por incertidumbre a 0,31623 por geometría.

Dos selecciones del mismo conjunto sintético. Círculos verdes: etiquetas nuevas; cuadrado L: existente. Las líneas unen candidatos al centro más cercano. A la izquierda quedan segmentos largos hacia dos zonas; a la derecha la cobertura es uniforme. No son mapas agrícolas ni medidas de exactitud.
Dos selecciones del mismo conjunto sintético. Círculos verdes: etiquetas nuevas; cuadrado L: existente. Las líneas unen candidatos al centro más cercano. A la izquierda quedan segmentos largos hacia dos zonas; a la derecha la cobertura es uniforme. No son mapas agrícolas ni medidas de exactitud.

¿Es buena la selección? Una garantía acotada

Podemos comparar las 6 × 5 / 2 = 15 parejas. El programa encuentra {C,E} entre los óptimos, con radio 0,31623. Aquí el método voraz alcanza el óptimo, pero no siempre. La garantía general es más débil: con distancia métrica y centros iniciales fijos, el radio voraz no supera dos veces el óptimo. Dos se refiere a distancias, no a errores de clasificación ni etiquetas ahorradas.

r_greedy ≤ 2 r_opt

Sea b el presupuesto y r el radio voraz final. Tomamos los b puntos elegidos y el más lejano tras la última elección. Los b + 1 puntos distan entre sí al menos r: cada nuevo punto era el más lejano y añadir centros nunca aumenta el máximo. También distan al menos r de los centros iniciales. Supongamos r mayor que 2r_opt. Ninguno queda cubierto por centros iniciales dentro de r_opt. Los b centros nuevos óptimos deben cubrir b + 1 puntos: dos comparten centro. La desigualdad triangular limita su distancia a 2r_opt, contradiciendo su separación mínima r. Así se demuestra la fórmula.

La prueba evita abusos. Una similitud arbitraria no necesariamente cumple desigualdad triangular; la distancia euclídea al cuadrado, por ejemplo, no la cumple en la misma forma. La prueba nada sabe de etiquetas, ruido ni enfermedades vegetales. Prometer exactitud exige hipótesis adicionales sobre modelos y relaciones entre representación y clase, no verificadas aquí.

Cuando la diversidad persigue un punto aislado

Añadimos O = (7,7), confianza sintética 0,99. Puede representar otro fondo, un error de captura o una condición rara importante; la geometría no decide. El algoritmo elige O y D, dejando radio 4,10488. Entre las 21 parejas, {B,O} logra cobertura óptima de radio 4,00125. Es un caso concreto de selección voraz no óptima que respeta la cota demostrada.

Con OCentros nuevosRadio máximoDistancia media
GreedyO,D4.104881.27199
min maxB,O4.001252.23669
min meanD,E7.353911.19666

La media incluye siete candidatos y ceros de puntos elegidos. Minimizarla selecciona {D,E}: representa bien a la mayoría, pero deja O lejos. Minimizar el máximo sacrifica la media para proteger el peor caso. No hay ganador independiente del objetivo. Si O es un fallo de captura, perseguirlo desperdicia presupuesto; si registra una condición rara importante, ignorarlo puede ser el error. Hay que revisar dato y finalidad, no eliminar automáticamente anomalías.

La distancia depende de cómo representamos las imágenes

Otra prueba multiplica la primera coordenada por 0,1. Sin O, se elige F y después D: mismo conjunto final, distinto orden. El radio nuevo es 0,20100. No mejora 0,31623: cambiamos la regla de medida y las cifras no son comparables. Pesos, normalización y redes pueden amplificar color, textura o contexto. Estandarizar componentes no garantiza distancia agronómicamente significativa.

El presupuesto requiere definición. Dos imágenes cuestan aquí dos unidades. Una clase y un contorno píxel a píxel pueden exigir esfuerzos distintos; casos ambiguos requieren expertos. Optimizar dos elementos no equivale a veinte minutos. Costes diferentes cambian el problema y no trasladan automáticamente la garantía a una heurística distancia dividida por coste.

Código, coste computacional y validación de campo

La descarga incluye coordenadas, confianzas, selección y enumeración. El fragmento final llama run e imprime escenario, método, selección y radio; JSON guarda medias. No necesita semilla: datos y reglas deterministas, desempate alfabético. No se entrena una red ni se adquieren imágenes reales. La aserción comprueba estos casos finitos; la demostración explica el resultado general bajo sus hipótesis.

Con N candidatos, dimensión d y b etiquetas, guardar mínimas distancias actualiza N por elección: O(Nbd), más comparaciones iniciales. Requiere O(N) memoria adicional, sin matriz N × N. Nuestro código legible recalcula todos los centros: O(Nb(|L| + b)d). Enumerar parejas y evaluar N puntos cuesta O(N³d). Son recuentos, no mediciones de latencia o memoria en hardware.

Para demostrar utilidad agrícola habría que etiquetar, entrenar el mismo modelo con presupuestos comparables e incluir selección aleatoria. Separar parcelas, estaciones o secuencias cuando importan las correlaciones: fotogramas casi duplicados entre entrenamiento y prueba favorecen cualquier estrategia. Harían falta repeticiones y esfuerzo experto registrado. Es un experimento propuesto, no ejecutado; no declaramos mejoras, ahorros ni resultados EL-AI.

Investigación y conclusión: cobertura es una pregunta, no toda la respuesta

Sener y Savarese, ICLR 2018, relacionan subconjuntos representativos y aprendizaje activo, analizan supuestos y prueban optimización robusta con redes de imágenes. Aquí estudiamos geometría elemental, sin reproducir redes, evaluaciones ni optimización robusta.

La investigación supera k-center. Cohen-Addad y colegas, ICML 2026, estudian selección y ponderación mediante bajo rango y sensibilidad de pérdida. Objetivos e hipótesis difieren de nuestra cobertura; no hacen universalmente óptimo elegir el punto más lejano.

La respuesta inicial es precisa: con poco presupuesto, incertidumbre sola puede comprar casi dos veces la misma información geométrica. Actualizar cobertura evita esa redundancia y ofrece garantía métrica demostrable. No decide si la representación importa, si un punto raro merece atención o si las etiquetas mejorarán el modelo. Conviene separar y medir esas decisiones, manteniendo central el problema agrícola.

Bibliografía y reproducibilidad

Sener & Savarese — Active Learning for Convolutional Neural Networks: A Core-Set Approach, ICLR 2018; arXiv v4, 1 June 2018.

Cohen-Addad et al. — ICML 2026, PMLR 306:21154–21175.

Cohen-Addad et al. — full methods and experiments, arXiv 2606.16045 v1.

from experiment import run
r = run()
for case in r['results']:
    print(case['scenario'])
    for m in case['methods']:
        print(m['method'], m['selected'], round(m['radius'], 6))

Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 4 de octubre de 2026.