ELAI S.r.l.

Quali immagini agricole far annotare? Quando l’incertezza sceglie due volte lo stesso problema

Active learning spiegato con un budget di due etichette: diversità geometrica, algoritmo greedy, prova del fattore due e limiti di copertura e outlier.

Quali immagini agricole far annotare? Quando l’incertezza sceglie due volte lo stesso problema

Il costo non è scattare la foto: è darle un significato

Un’impresa agricola raccoglie molte immagini durante le ispezioni, ma può chiedere agli esperti di annotarne soltanto una parte. Annotare significa associare all’immagine una categoria o un’altra informazione verificata, necessaria per addestrare e valutare un modello. Se scegliamo le immagini sulle quali l’AI è più incerta, useremo bene quel tempo? Forse. Ma due fotografie consecutive della stessa foglia possono risultare entrambe difficili e raccontare quasi lo stesso problema, lasciando inesplorate altre condizioni di ripresa.

Affrontiamo una domanda circoscritta: con un budget di due nuove annotazioni, come evitare di spendere entrambe in una zona già rappresentata? Useremo sei immagini immaginarie descritte da punti su un piano. Confronteremo una scelta basata sull’incertezza con una scelta basata sulla copertura geometrica, derivandone una garanzia e mostrandone i limiti. Le coordinate e le probabilità sono sintetiche: non contengono misure agronomiche, non descrivono diagnosi sulle piante e non dimostrano risultati di un progetto EL-AI.

Una mappa delle immagini, non del terreno

Un embedding è una rappresentazione numerica di un oggetto: una rete può trasformare un’immagine in un vettore. Se la rappresentazione è utile al compito, immagini simili secondo caratteristiche rilevanti possono avere vettori vicini. Questo “se” è decisivo: la vicinanza potrebbe riflettere illuminazione e sfondo invece del carattere che vogliamo riconoscere. Nel nostro esempio usiamo soltanto due componenti astratte, in unità arbitrarie, per rendere visibile il ragionamento. Non sono latitudine, longitudine o una proiezione di immagini reali.

L è un’immagine già annotata, posta all’origine. A e B sono vicine a L; C e D formano una seconda zona; E e F una terza. A ogni candidato attribuiamo anche una confidenza sintetica per una classificazione binaria. Scegliere i più incerti significa qui scegliere la confidenza vincente più vicina a 0,5. Poiché tutte le confidenze sono almeno 0,5, coincide con prendere i due valori più piccoli: A e B. La regola non considera quanto le due scelte siano simili fra loro.

Puntox₁x₂Confidenza
L00—
A0.200.5
B0.30.10.51
C400.8
D4.20.20.78
E040.9
F0.24.10.88

Che cosa significa coprire un insieme

Immaginiamo di collegare ogni punto alla rappresentazione annotata più vicina. Il segmento più lungo individua la zona peggio rappresentata. Il raggio di copertura è proprio la lunghezza di quel segmento: minimizzarlo significa cercare un insieme che non lasci nessun candidato troppo lontano da un esempio scelto. Non significa conoscere già l’etichetta dei punti vicini, né garantire che appartengano alla stessa classe. È una misura geometrica sostitutiva, utile solo se la geometria è pertinente.

d(x,y) = √[(x₁−y₁)² + (x₂−y₂)²] r(S) = maxₓ∈U min_c∈({L}∪S) d(x,c); |S| = 2

U è l’insieme dei sei candidati, S contiene i due da annotare. La distanza d è euclidea. Il minimo sceglie il centro più vicino a ogni x; il massimo prende il caso peggiore fra tutti gli x. Le immagini selezionate hanno distanza zero da se stesse, mentre L resta disponibile senza consumare budget. Questi dettagli evitano due errori frequenti: dimenticare ciò che abbiamo già annotato oppure ottimizzare distanze medie mentre si dichiara una garanzia sul caso peggiore.

Con S = {A,B}, il punto F resta a distanza √[(0,2−0,3)² + (4,1−0,1)²] = √16,01, circa 4,00125, dal centro B, il suo più vicino. Questo è anche il raggio finale. Aggiungere due etichette vicino all’origine ha coperto molto bene una zona e quasi ignorato le altre. È un risultato costruito, non una prova che campionare per incertezza sia sempre sbagliato: se proprio lì si trova il confine fra classi importanti, quelle annotazioni potrebbero essere preziose.

Scegliere ogni volta il punto meno rappresentato

L’algoritmo farthest-first, letteralmente “prima il più lontano”, procede in modo greedy: compie la scelta che appare migliore al passo corrente senza enumerare tutte le combinazioni future. Parte da L, calcola per ogni candidato la distanza dal centro più vicino, sceglie il maggiore e lo aggiunge ai centri. Poi aggiorna le distanze e ripete fino a esaurire il budget. Aggiornare è essenziale: dopo aver scelto D, il vicino C non deve conservare la vecchia priorità.

x* = argmaxₓ∈U\S d_min(x) S ← S ∪ {x*}; d_min(x) ← min[d_min(x), d(x,x*)]

All’inizio D dista √17,68 ≈ 4,20476 da L, più di ogni altro candidato, e viene scelto. C ora è a circa 0,28284 da D; F resta lontano circa 4,10488 da L e diventa la seconda scelta. Con {L,D,F}, le distanze residue più grandi sono quella di B da L, circa 0,31623, e quelle più piccole di C da D ed E da F. Il raggio scende quindi da 4,00125 della selezione incerta a 0,31623 della selezione geometrica.

Due scelte sullo stesso insieme sintetico. I cerchi verdi indicano le nuove annotazioni, il quadrato L quella già disponibile. Le linee collegano ogni candidato al centro più vicino. A sinistra restano segmenti lunghi verso due zone; a destra la copertura è più uniforme. Non sono mappe di campi né misure di accuratezza.
Due scelte sullo stesso insieme sintetico. I cerchi verdi indicano le nuove annotazioni, il quadrato L quella già disponibile. Le linee collegano ogni candidato al centro più vicino. A sinistra restano segmenti lunghi verso due zone; a destra la copertura è più uniforme. Non sono mappe di campi né misure di accuratezza.

Quanto è buona questa scelta? Una garanzia con confini precisi

Possiamo confrontare tutte le coppie: sei candidati producono 6 × 5 / 2 = 15 combinazioni. Lo script le enumera e trova, fra gli ottimi, {C,E}, con raggio 0,31623: in questo esempio il greedy raggiunge lo stesso valore ottimo. Non segue che lo faccia sempre. La garanzia generale è più debole e più interessante: con una vera distanza metrica e centri iniziali fissi, il raggio greedy non supera due volte quello ottimo. Il numero due riguarda distanze, non errori di classificazione o numero di etichette risparmiate.

r_greedy ≤ 2 r_opt

Per capire il perché, chiamiamo b il budget e r il raggio finale greedy. Prendiamo i b punti selezionati e aggiungiamo il punto ancora più lontano dopo l’ultima scelta. Sono b + 1 punti: ogni coppia dista almeno r, perché ogni nuovo punto era il più lontano dai centri disponibili e il massimo delle distanze non aumenta aggiungendo centri. Anche ciascuno di questi punti dista almeno r dai centri iniziali. Supponiamo per assurdo r maggiore di 2r_opt. Nessuno dei b + 1 punti può allora essere coperto dai centri iniziali entro r_opt. Devono coprirli i soli b centri nuovi della soluzione ottima: almeno due punti condividono quindi un centro. La disuguaglianza triangolare limita la loro distanza a 2r_opt, in contraddizione con la distanza almeno r. La contraddizione dimostra la formula.

La dimostrazione aiuta anche a non usare male il risultato. Una similarità arbitraria non è necessariamente una distanza con disuguaglianza triangolare. Il quadrato della distanza euclidea, per esempio, non possiede quella proprietà nella stessa forma. E la prova non sa nulla di etichette, rumore o malattie delle piante. Trasformare la copertura in una promessa di accuratezza richiede ipotesi ulteriori sul modello e sul rapporto fra rappresentazioni e classi: non le abbiamo verificate.

Quando la varietà insegue un punto isolato

Aggiungiamo O = (7,7), con confidenza sintetica 0,99. Potrebbe rappresentare uno sfondo diverso, un errore di acquisizione oppure una condizione rara davvero importante: la geometria non può decidere quale interpretazione sia corretta. Il greedy sceglie O e D; resta un raggio di circa 4,10488. Enumerando le 21 coppie disponibili, la migliore copertura è invece ottenuta anche da {B,O}, con raggio 4,00125. Abbiamo quindi un caso concreto in cui il greedy non è ottimo, pur rispettando il limite dimostrato.

Con OCentri nuoviRaggio massimoDistanza media
GreedyO,D4.104881.27199
min maxB,O4.001252.23669
min meanD,E7.353911.19666

La media della tabella considera tutti i sette candidati, inclusi quelli selezionati che contribuiscono con zero. Minimizzare questa media porta a {D,E}: rappresenta bene la maggior parte dell’insieme ma lascia O molto lontano. Minimizzare il massimo sacrifica invece la media per non abbandonare il caso peggiore. Non esiste un vincitore indipendente dall’obiettivo. Se O è un guasto fotografico, inseguirlo può sprecare budget; se documenta una condizione rara rilevante, ignorarlo può essere proprio l’errore da evitare. Serve un controllo del dato e della finalità, non una cancellazione automatica di ogni anomalia.

La distanza dipende da come guardiamo le immagini

Un’altra prova moltiplica la prima coordinata per 0,1. Sul gruppo originale, senza O, il greedy sceglie ora prima F e poi D: l’insieme finale coincide, ma l’ordine cambia. Il nuovo raggio è circa 0,20100. Non è un miglioramento rispetto a 0,31623: abbiamo cambiato il metro, quindi i numeri non sono direttamente comparabili. In un sistema reale pesi, normalizzazione e rete che produce gli embedding possono amplificare il colore, la texture o il contesto. Standardizzare le componenti non garantisce da solo che la distanza diventi agronomicamente significativa.

Anche il budget va definito con attenzione. Qui due immagini costano esattamente due unità. Un’etichetta di classe e un contorno pixel per pixel possono invece richiedere tempi molto diversi; immagini ambigue possono richiedere un esperto. Ottimizzare due elementi non equivale a ottimizzare venti minuti di lavoro. Con costi diversi cambia il problema combinatorio e non possiamo trasferire automaticamente la garanzia precedente a una regola improvvisata di distanza divisa per costo.

Codice, costo computazionale e verifica sul campo

Il codice scaricabile contiene coordinate, confidenze, selezione greedy ed enumerazione delle coppie. Il frammento finale richiama run e stampa scenario, metodo, selezioni e raggio; il JSON conserva anche le distanze medie. Non serve un seed: tutti i dati e le regole sono deterministici, con ordine alfabetico per i pareggi. Nessuna rete viene addestrata e nessuna immagine agricola reale viene acquisita. L’asserzione sul rapporto fra raggio greedy e ottimo controlla questi casi finiti, mentre la dimostrazione spiega il risultato generale sotto le sue ipotesi.

Con N candidati, dimensione d e b nuove annotazioni, un’implementazione che conserva la minima distanza corrente aggiorna N distanze per scelta: O(Nbd), oltre al confronto iniziale con i centri già annotati. Richiede O(N) memoria aggiuntiva per quelle minime distanze, senza una matrice completa N × N. Il nostro script privilegia la leggibilità e ricalcola le distanze da tutti i centri: il costo è O(Nb(|L| + b)d). Enumerare tutte le coppie e valutarle su N punti costa invece O(N³d). Sono conteggi delle operazioni, non misure di latenza o memoria su un dispositivo.

Per stabilire utilità agricola servirebbe poi annotare davvero, addestrare lo stesso modello con budget confrontabili e confrontare anche una selezione casuale. Il test dovrebbe separare appezzamenti, stagioni o sequenze di acquisizione quando queste correlazioni contano: fotogrammi quasi uguali fra addestramento e test possono far apparire efficace qualsiasi scelta. Occorrerebbero più ripetizioni e costi degli esperti registrati. È un esperimento proposto, non svolto; non riportiamo aumenti di accuratezza, risparmi economici o risultati EL-AI.

Ricerca e conclusione: copertura è una domanda, non tutta la risposta

Sener e Savarese, ICLR 2018, collegano selezione di un sottoinsieme rappresentativo e apprendimento attivo; analizzano ipotesi teoriche e sperimentano anche un’ottimizzazione robusta con reti su immagini. Qui riprendiamo il problema geometrico elementare, senza riprodurre reti, benchmark o ottimizzazione robusta del lavoro.

La ricerca non si esaurisce nel k-center. Cohen-Addad e colleghi, ICML 2026, studiano selezione e pesatura mediante struttura a basso rango e sensibilità della perdita. Obiettivi e ipotesi differiscono dalla copertura geometrica qui usata: il loro lavoro non rende universalmente ottimo scegliere il punto più lontano.

Alla domanda iniziale rispondiamo quindi in modo preciso: quando il budget è piccolo, considerare solo l’incertezza può comprare due volte quasi la stessa informazione geometrica. Aggiornare la copertura dopo ogni scelta evita quella specifica ridondanza e dispone di una garanzia metrica dimostrabile. Però non decide se le rappresentazioni siano pertinenti, se un punto raro meriti attenzione o se le nuove etichette miglioreranno il modello. Il risultato utile è separare queste decisioni e misurarle, mantenendo al centro il problema agricolo che ha giustificato l’annotazione.

Bibliografia e riproducibilità

Sener & Savarese — Active Learning for Convolutional Neural Networks: A Core-Set Approach, ICLR 2018; arXiv v4, 1 June 2018.

Cohen-Addad et al. — ICML 2026, PMLR 306:21154–21175.

Cohen-Addad et al. — full methods and experiments, arXiv 2606.16045 v1.

from experiment import run
r = run()
for case in r['results']:
    print(case['scenario'])
    for m in case['methods']:
        print(m['method'], m['selected'], round(m['radius'], 6))

Codice, dati e istruzioni · JSON. Calcoli didattici eseguiti con Python 3.14.0; figure con Matplotlib 3.11.2. Analisi con assistenza AI, senza dichiarare peer review o revisione umana. Copertina originale ImageGen, illustrativa: non documenta persone, sedi o installazioni EL-AI. Fonti consultate il 4 ottobre 2026.