Una pratica, due percorsi, una domanda in più
Un agente AI deve instradare una pratica aziendale: proseguire con la lavorazione ordinaria oppure inviarla a una revisione manuale. Può interrogare un archivio aggiuntivo, ma ogni consultazione costa tempo e risorse. Cercare ancora sembra prudente; fermarsi sembra rischioso. La domanda utile è più precisa: la prossima risposta può cambiare la scelta abbastanza da giustificare il suo costo? In questo articolo arriveremo a calcolarlo, senza assumere che più chiamate agli strumenti significhino automaticamente un agente migliore.
Abstract. Costruiamo un problema decisionale sintetico con due azioni, un’eccezione nascosta e strumenti imperfetti. Deriviamo la soglia di intervento, aggiorniamo le probabilità dopo una risposta e confrontiamo il costo atteso prima e dopo la consultazione. Il primo controllo utile porta il costo da 12 a 8,88 unità, includendo il prezzo della domanda. Un controllo meno discriminante ha valore decisionale nullo nel medesimo caso. Infine, una strategia che decide se ripetere il controllo in base alla prima risposta raggiunge 8,448 unità, sotto ipotesi più forti. Sono calcoli didattici eseguiti, non misure di un prodotto EL-AI né risultati di un modello linguistico.
Prima dei numeri: che cosa può decidere l’agente
Per seguire il ragionamento bastano percentuali, medie pesate e la distinzione fra un fatto e ciò che sappiamo di quel fatto. Indichiamo con H la presenza di un’eccezione nella pratica: H vale 1 se l’eccezione esiste, 0 altrimenti. Il controllo non crea né risolve l’eccezione; offre soltanto un indizio. Le azioni disponibili sono S, lavorazione standard, e R, revisione. Questa separazione è essenziale: stiamo valutando una richiesta informativa, non uno strumento che modifica direttamente la pratica o che esegue una transazione.
Assegniamo costi sintetici nella stessa unità convenzionale. Se scegliamo S e c’è un’eccezione, la perdita è 100; se l’eccezione non c’è, è zero. R costa sempre 12 e, nel modello, evita ulteriori perdite. Non sono euro, tempi misurati o tariffe aziendali. L’ipotesi che la revisione sia risolutiva semplifica il conto: una revisione reale può commettere errori e avrebbe bisogno di una diversa tabella dei costi. Anche il prezzo del controllo, fissato a 2, è una scelta didattica e deve essere espresso nella stessa unità.
| Azione | H = 0 | H = 1 |
|---|---|---|
| S | 0 | 100 |
| R | 12 | 12 |
Ora introduciamo p, probabilità che la pratica contenga un’eccezione prima del controllo. Nel caso guida p = 0,20: una popolazione ipotetica con il 20% di eccezioni. Non è una dichiarazione di sicurezza del modello, né una percentuale estratta da una frase dell’assistente. Nel nostro esperimento è un parametro assegnato. In un’applicazione andrebbe stimato e verificato sui casi pertinenti, evitando di trasferire senza controllo una frequenza osservata su un insieme molto diverso. Per ora assumiamolo noto, così possiamo isolare il problema della decisione.
Quanto costa decidere senza altre informazioni?
La prima formula risponde a una domanda semplice: quale delle due azioni costa meno, in media, con le informazioni disponibili? Il costo atteso di S è 100p, perché la perdita 100 si verifica con probabilità p. Quello di R resta 12. Chiamiamo L₀ il minore dei due. Il pedice zero ricorda che non abbiamo ancora acquistato alcun controllo. La media descrive casi ripetuti con le stesse ipotesi, non garantisce il costo della singola pratica.
La soglia p* vale 0,12. Sotto il 12% conviene S, sopra conviene R; alla soglia le azioni sono equivalenti nel modello. Con p = 20% invieremmo dunque la pratica in revisione. Abbiamo così una base concreta con cui confrontare qualsiasi proposta di ricerca. Senza questa base, frasi come “lo strumento è accurato” o “l’agente ha raccolto molte evidenze” non dicono se la consultazione abbia migliorato il risultato. Occorre una scelta da migliorare e una conseguenza rispetto alla quale misurarla.
Lo strumento risponde: come cambia ciò che sappiamo
Lo strumento A restituisce un segnale positivo, +, oppure negativo, −. Positivo significa “indizio di eccezione”, non “eccezione certamente presente”. Definiamo s = P(+ | H = 1) = 0,8, sensibilità: fra le vere eccezioni il segnale è positivo nell’80% dei casi. Definiamo f = P(+ | H = 0) = 0,1, tasso di falsi positivi: fra le pratiche ordinarie il 10% produce comunque un allarme. Le barre verticali si leggono “a condizione che”. Anche questi valori sono ipotesi sintetiche, non prestazioni dichiarate di un archivio o servizio esistente.
Prima di aggiornare la probabilità dobbiamo sapere quanto spesso arriverà ciascuna risposta. Un positivo può nascere da una vera eccezione rilevata oppure da un falso allarme. Sommiamo le due possibilità, che non possono verificarsi insieme per la stessa pratica. Chiamando z la probabilità di risposta positiva, otteniamo 0,24. Su 1.000 casi ipotetici distribuiti esattamente secondo il modello, 160 sarebbero veri positivi e 80 falsi positivi: 240 positivi complessivi. È un conteggio atteso costruito dai parametri, non un campione realmente raccolto.
Le ultime due righe applicano la regola di Bayes: fra tutti i casi compatibili con la risposta, quale quota contiene davvero l’eccezione? Dopo un positivo, 160 dei 240 casi attesi sono eccezioni: p₊ = 2/3, circa 66,67%. Dopo un negativo rimangono 40 eccezioni fra 760 casi: p₋ = 1/19, circa 5,26%. Abbiamo attraversato la soglia del 12% soltanto nel ramo negativo. Quindi dopo + scegliamo ancora R, mentre dopo − possiamo scegliere S. Il segnale negativo non certifica l’assenza dell’eccezione: cambia il bilancio dei costi.
Il valore dell’informazione si misura prima di conoscere la risposta
Al momento di interrogare lo strumento non sappiamo quale ramo si realizzerà. Dobbiamo quindi pesare il costo della migliore decisione in ciascun ramo con la probabilità di quel ramo. Indichiamo con L₁ il costo dopo avere osservato il segnale, ma prima di aggiungere il prezzo della consultazione. Il valore lordo V è la riduzione rispetto a L₀. La parola “lordo” serve a evitare un equivoco pratico: un’informazione può essere utile e tuttavia troppo cara. Il costo netto della strategia con controllo è c + L₁, con c = 2.
Il risultato significa che, ripetendo idealmente la procedura sulla popolazione ipotizzata, il costo medio scende da 12 a 8,88 unità: un beneficio netto di 3,12. Non significa che ogni consultazione risparmi 3,12. Nel ramo positivo paghiamo 2 e inviamo comunque in revisione; il vantaggio complessivo nasce dalla possibilità di evitare molte revisioni nel ramo negativo, accettando le perdite residue previste dal modello. Se il prezzo superasse 5,12, il controllo non converrebbe più in questo confronto a una sola domanda. A prezzo esattamente uguale le strategie pareggiano.
Perché il valore lordo non è negativo? Perché l’agente potrebbe ignorare il segnale e mantenere la scelta iniziale. Formalmente, per qualsiasi azione fissa a, il costo minimo condizionato al segnale non supera il costo di a nello stesso ramo. Facendo la media e scegliendo come a l’azione ottima iniziale, otteniamo L₁ ≤ L₀. La dimostrazione richiede che le azioni restino disponibili, che l’informazione possa essere ignorata e che il controllo non alteri direttamente il caso. Un servizio che blocca la pratica, espone dati o consuma una scadenza non è descritto soltanto da questo vantaggio informativo.
Sapere qualcosa in più può valere zero
Confrontiamo A con uno strumento B, avente s = 0,6 e f = 0,4. Al medesimo p iniziale, il positivo arriva con probabilità 0,44 e porta la probabilità di eccezione a 3/11, circa 27,27%; il negativo arriva con probabilità 0,56 e la porta a 1/7, circa 14,29%. Il controllo distingue qualcosa: le due probabilità sono diverse fra loro e da quella iniziale. Tuttavia entrambe restano sopra il 12%. Dopo ciascuna risposta scegliamo R e spendiamo 12. L₁ resta quindi 12 e V vale zero.
Qui incontriamo la differenza fra ridurre l’incertezza e migliorare una decisione. L’informazione mutua misura una riduzione media dell’incertezza probabilistica, usando come unità i bit; non conosce la nostra tabella dei costi. Per B, nel caso guida, il calcolo restituisce circa 0,01864 bit, ma nessun beneficio decisionale. Non occorre padroneggiare l’entropia per capire il motivo: l’indizio muove la stima senza farle attraversare la soglia operativa. B può avere valore con altre probabilità iniziali o altri costi. Non lo stiamo dichiarando inutile in ogni situazione.
Per chi vuole ricostruire anche quel numero, definiamo h(x) = −x log₂(x) − (1−x) log₂(1−x), con contributi nulli agli estremi x = 0 e x = 1. L’incertezza della risposta è h(z); conoscendo H resterebbe la media p h(s) + (1−p) h(f). La loro differenza I(H;Z) è l’informazione mutua. Per B vale h(0,44) − h(0,6), perché h(0,4) = h(0,6). Questo dettaglio mostra che il valore nullo non deriva dall’avere costruito uno strumento completamente indipendente dal problema.

Nel grafico non bisogna cercare la curva più alta in assoluto, ma la sua altezza nel punto che descrive la pratica. A p = 0,20, A supera la linea del costo e B no. Agli estremi, quando sappiamo già quasi certamente quale sia lo stato, resta poco da guadagnare. Le curve cambierebbero modificando la perdita dell’errore o il costo della revisione. L’affidabilità dello strumento e la situazione decisionale lavorano insieme: una graduatoria unica degli strumenti, separata dal compito, perderebbe questa dipendenza.
Un limite superiore: conoscere perfettamente lo stato
Prima di progettare strumenti più costosi possiamo chiederci quanto varrebbe una risposta perfetta. Se conoscessimo H, sceglieremmo S nelle pratiche ordinarie e R nelle eccezioni. Il costo residuo sarebbe 0,8 × 0 + 0,2 × 12 = 2,4. L’informazione perfetta varrebbe quindi 12 − 2,4 = 9,6 unità. Attenzione: non vale 12, perché conoscere l’eccezione non elimina il costo della revisione. Nessuno strumento puramente informativo sullo stesso stato può migliorare questo limite, nelle azioni e nei costi qui fissati. Non avrebbe senso pagarne più di 9,6 prima ancora di esaminarne l’accuratezza.
Una seconda domanda: il valore dipende dalla prima risposta
Finora avevamo una sola opportunità di controllo. Consentiamone al massimo due, entrambe con le prestazioni di A e costo 2. Aggiungiamo un’ipotesi forte: le risposte sono indipendenti condizionatamente a H. Significa che, una volta fissata la presenza o assenza dell’eccezione, conoscere il primo segnale non cambia le probabilità del secondo. Non significa che le risposte siano indipendenti senza conoscere H. Potremmo immaginare due verifiche con errori separati, ma questa è soltanto una costruzione probabilistica: due archivi che copiano la stessa fonte non la soddisfano automaticamente.
Dopo un primo positivo partiamo da p = 2/3. Anche se il secondo controllo fosse negativo, la probabilità scenderebbe soltanto a 4/13, circa 30,77%, ancora sopra la soglia. Se fosse positivo salirebbe ulteriormente. Entrambi gli esiti portano a R: il secondo controllo ha valore lordo zero e ci fermiamo. Dopo un primo negativo, invece, partiamo da 1/19. Un secondo positivo porta a 4/13 e quindi a R; un secondo negativo porta a 1/82, circa 1,22%, e quindi a S. In questo ramo il controllo può davvero cambiare l’azione.
Svolgiamo il conto nel ramo negativo per non nascondere la convenienza dietro un algoritmo. Senza un secondo controllo spenderemmo in media 100/19 = 5,26316 unità. Con il controllo il costo delle azioni successive, esclusa la nuova domanda, scende a 2,69474; aggiungendo 2 arriviamo a 4,69474. Il guadagno condizionato al primo negativo è circa 0,56842. Quel ramo si verifica con probabilità 0,76: il risparmio iniziale atteso aggiuntivo è quindi 0,432. La strategia completa costa 8,88 − 0,432 = 8,448. Le cifre arrotondate spiegano il conto; il programma conserva frazioni esatte.
Possiamo scrivere la regola generale per un budget di n domande residue. Wₙ(p) è il costo minimo raggiungibile dal punto corrente; con zero domande resta L₀. Con almeno una domanda confrontiamo il fermarci subito con il pagare c e proseguire ottimamente da ciascuna risposta. La somma sui segnali y comprende + e −, e pᵧ è la probabilità aggiornata. È una ricorsione a orizzonte finito: risolve il piccolo modello specificato, non qualsiasi problema di pianificazione di un agente reale.
Questa formulazione chiarisce anche un limite della regola “chiedi soltanto se la prossima risposta conviene da sola”. Con più passi disponibili, una prima osservazione può preparare un controllo successivo più utile: il criterio corretto deve considerare il seguito, come Wₙ. Nel nostro caso il primo controllo conviene già da solo, ma non possiamo promuovere quella coincidenza a principio universale. L’enumerazione ingenua di due risposte per h passi cresce come 2ʰ; memorizzare stati equivalenti evita ricalcoli, senza cancellare in generale la difficoltà della pianificazione.
La stessa risposta ripetuta non è una seconda evidenza
Se la seconda chiamata restituisce esattamente lo stesso dato memorizzato della prima, condizionatamente a ciò che sappiamo il nuovo esito è già determinato. La probabilità dell’eccezione non cambia: il valore informativo aggiuntivo è zero. Applicare di nuovo la formula di Bayes come se fosse un test indipendente conterebbe due volte la stessa evidenza. Questo vale anche quando la risposta è riformulata in parole diverse. Prima di stimare il valore di un nuovo strumento, l’agente deve quindi distinguere una nuova osservazione da una nuova presentazione della vecchia osservazione.
Riprodurre il calcolo e capire che cosa manca
Il pacchetto allegato esegue tutte le medie con Fraction, la rappresentazione razionale di Python, e verifica mediante assert i risultati principali. Non c’è campionamento casuale e quindi non serve un seed. Il grafico usa 1.001 valori di p fra zero e uno; le conversioni in numeri decimali avvengono per esportazione e visualizzazione. La funzione risk sceglie il costo minore, branches calcola probabilità delle risposte e probabilità aggiornate, voi sottrae i costi attesi, value applica la ricorsione. Il frammento finale importa queste funzioni da experiment.py: va eseguito nella cartella estratta dall’archivio, non come programma privo di dipendenze locali.
Il limite principale non è l’aritmetica, ma la conoscenza dei parametri. Servono probabilità attendibili sul contesto corrente, una tabella dei costi coerente e un modello degli errori congiunti quando si concatenano strumenti. Una probabilità dichiarata con sicurezza da un modello linguistico non soddisfa da sola queste condizioni. Inoltre il costo di attendere può dipendere dallo stato della pratica; una revisione può avere capacità limitata; lo stato può cambiare durante la ricerca. In tali casi occorre ampliare il modello, non continuare ad applicare gli stessi numeri attribuendo loro una precisione che non possiedono.
Per trasferire il ragionamento in un progetto aziendale, una prova proposta potrebbe confrontare tre politiche su casi separati da quelli usati per stimare i parametri: nessuna consultazione, una consultazione fissa, consultazione adattiva. Andrebbero registrati esiti, costi, chiamate e dipendenze fra fonti, distinguendo la qualità delle probabilità dalla qualità delle decisioni. Qui quella prova non è stata eseguita: non abbiamo coinvolto archivi aziendali, lettori o operatori. Il modello è un’ipotesi applicativa per progettare e valutare agenti; non documenta una funzionalità già disponibile di EL-AI.
La risposta alla domanda iniziale
Conviene chiedere quando il miglioramento atteso delle decisioni future supera il costo complessivo della richiesta. Nel nostro esempio una risposta utile vale 5,12 unità prima del prezzo; una risposta meno discriminante vale zero a parità di situazione; una seconda verifica indipendente conviene soltanto dopo il primo negativo. Il punto non è rendere l’agente avaro di domande. È collegare ciascuna domanda a una scelta che potrebbe cambiare, e quella scelta a conseguenze esplicite. Così possiamo spiegare perché l’agente continua oppure si ferma, invece di misurarne l’intelligenza dal numero delle consultazioni.
Fonti e natura del contributo
Riferimento concettuale: David L. Poole e Alan K. Mackworth, Artificial Intelligence: Foundations of Computational Agents, terza edizione, 2023, sezioni 12.3 e 12.4. Consultati il formalismo delle decisioni sequenziali, l’ottimizzazione delle politiche e le proprietà del valore dell’informazione. È un manuale, non un nuovo preprint o un benchmark di agenti. Esempio amministrativo, parametri, derivazione numerica, grafico e codice di questo articolo sono costruiti per la presente spiegazione e non riproducono gli esempi del libro. L’articolo è una monografia didattica con assistenza AI, non ricerca originale sottoposta a peer review.
Poole & Mackworth (2023), §12.3 — Sequential Decisions.
Poole & Mackworth (2023), §12.4 — The Value of Information and Control.
from fractions import Fraction as F
from experiment import risk, branches, voi, value, STRONG, WEAK
p = F(1, 5)
print('baseline', float(risk(p)))
for name, tool in [('A', STRONG), ('B', WEAK)]:
print(name, [(float(w), float(q)) for w, q in branches(p, *tool)])
print('gross value', float(voi(p, *tool)))
print('one query', float(value(p, 1)))
print('adaptive two queries', float(value(p, 2)))
Codice, dati e istruzioni · JSON. Calcoli didattici eseguiti con Python 3.14.0; figure con Matplotlib 3.11.2. Analisi con assistenza AI, senza dichiarare peer review o revisione umana. Copertina originale ImageGen, illustrativa: non documenta persone, sedi o installazioni EL-AI. Fonti consultate il 9 ottobre 2026.

