Abstract: la distanza nei pesi non misura ciò che si dimentica
Adattare un modello a un dominio può migliorare il nuovo compito e degradare capacità precedenti. Un aggiornamento piccolo in norma euclidea non garantisce una piccola regressione: dipende dalla direzione e dalla curvatura della perdita precedente. Costruiamo due compiti quadratici con soluzione esatta. A parità di perdita precedente pari a 0,5, una penalità informata dalla curvatura raggiunge perdita nuova 0,459957 contro 0,810894 della penalità isotropa, pur spostandosi molto di più nei parametri. Poi ruotiamo il problema per mostrare che conservare soltanto la diagonale può perdere proprio l’informazione utile.
Questa è un’analisi di ottimizzazione didattica, non un esperimento su un modello linguistico, su materiali o su prodotti EL-AI. Le perdite e i parametri sono adimensionali. Servono algebra lineare, derivate e forme quadratiche. Il caso isola un meccanismo della specializzazione: non dimostra che un metodo di continual learning conservi qualsiasi capacità di un modello reale. Il precedente approfondimento LoRA riguarda rappresentazione e rango dell’aggiornamento; qui studiamo la funzione che decide quanto quell’aggiornamento danneggia un compito precedente.
1. Due compiti, una geometria esplicita
Il modello ha due parametri θ=(θ₁,θ₂). Il compito A ha minimo nell’origine e penalizza la prima direzione cento volte più della seconda. Il nuovo compito B vorrebbe invece entrambi i parametri uguali a uno. La specializzazione senza vincoli arriva a (1,1): B ha perdita zero, A sale a 50,5. Le due funzioni sono note ovunque, quindi non introduciamo errori di stima o di ottimizzazione. Questa semplicità serve a separare il conflitto fra obiettivi da altri problemi di addestramento.
All’origine il gradiente di A è zero. Un controllo basato soltanto sul prodotto scalare fra gradienti non rileva dunque un conflitto di primo ordine. Ma un passo di discesa su B con tasso η produce θ=(η,η), per cui L_A=50,5η² e L_B=(1−η)². Con η=0,1 la perdita precedente è già 0,505. Il danno qui è di secondo ordine. La formula di Taylor ΔL_A≈g_AᵀΔθ+½ΔθᵀH_AΔθ è esatta per questa quadratica; per una rete sarebbe locale e avrebbe un resto da controllare.
2. Penalizzare tutto allo stesso modo o seguire la curvatura
Una penalità isotropa minimizza L_B+λ||θ−θ_A||²/2. Le derivate danno θ₁=θ₂=1/(1+λ). Blocca allo stesso modo una direzione sensibile e una flessibile. Una penalità anisotropa usa invece λθᵀH_Aθ/2: annullando le derivate si ottengono θ₁=1/(1+100λ) e θ₂=1/(1+λ). In questo problema H_A è la curvatura esatta e la penalità coincide con λL_A, non con una stima approssimata della capacità precedente.
Confrontare i metodi allo stesso λ sarebbe fuorviante: λ moltiplica quantità geometriche diverse. Fissiamo invece un budget comune L_A≤0,5 e minimizziamo il danno su B. Per l’isotropa serve λ=√101−1≈9,049876. Per l’anisotropa risolviamo la funzione monotona 50/(1+100λ)²+0,5/(1+λ)²=0,5 mediante bisezione: λ≈0,178844891. Il codice conserva la soluzione e verifica il vincolo con tolleranza 10^−12. Le perdite sono comparabili perché misurate sulle stesse due funzioni.
| Metodo | θ₁ | θ₂ | L_A | L_B |
|---|---|---|---|---|
| Libero | 1.000000 | 1.000000 | 50.500000 | 0.000000 |
| Isotropo | 0.099504 | 0.099504 | 0.500000 | 0.810894 |
| Anisotropo | 0.052954 | 0.848288 | 0.500000 | 0.459957 |
| Congelamento | 0.000000 | 1.000000 | 0.500000 | 0.500000 |
Il punto anisotropo è circa (0,052954;0,848288): quasi non muove la direzione delicata, sfruttando invece la seconda. La distanza dall’origine è 0,849939, contro appena 0,140720 per l’isotropa. Eppure entrambe hanno L_A=0,5. Congelare del tutto θ₁ e portare θ₂ a uno darebbe L_B=0,5: una soluzione semplice, ma leggermente peggiore dell’ottimo anisotropo 0,459957. Un piccolo movimento coordinato di entrambi i parametri può sfruttare meglio il budget rispetto al congelamento assoluto.

3. Perché questa soluzione è ottima nel caso costruito
Il problema min L_B soggetto a L_A≤ε è convesso, e per ε=0,5 l’origine è strettamente ammissibile. Il minimo libero di B, (1,1), viola il vincolo, quindi quello ottimo è attivo. La Lagrangiana L_B+λ(L_A−ε), con λ≥0, dà proprio le equazioni anisotrope. Convessità e condizioni di ottimalità rendono la soluzione globale per queste quadratiche. Non stiamo deducendo una superiorità generale da una sola curva: conosciamo il problema e possiamo verificarne la soluzione analiticamente. Nelle reti non convesse questa giustificazione non si trasferisce automaticamente.
4. Ruotare il problema rivela il limite della diagonale
Consideriamo la stessa anisotropia in una base ruotata: H=[[50,5;49,5],[49,5;50,5]]. Le direzioni normalizzate u_+=(1,1)/√2 e u_−=(1,−1)/√2 hanno curvatura rispettivamente 100 e 1. Uno spostamento di norma uno produce perdita 50 nel primo caso e 0,5 nel secondo. Se eliminiamo gli elementi fuori diagonale, entrambe le direzioni ricevono perdita prevista 25,25. La diagonale sovrastima il danno lungo una direzione e lo sottostima lungo l’altra: non è solo una versione meno precisa dello stesso ordinamento.
Per p parametri una matrice piena richiede O(p²) memoria, una diagonale O(p): la semplificazione ha una ragione pratica. Ma la qualità della protezione dipende dalla parametrizzazione e dalle correlazioni ignorate. Il nostro script salva questi valori; non stima una Fisher da dati. Nelle applicazioni occorre anche distinguere Hessiana della perdita, Fisher attesa e Fisher empirica: non sono intercambiabili senza ipotesi. Presentare una diagonale stimata come la geometria esatta delle capacità sarebbe una conclusione eccessiva.
5. Dalla geometria alla valutazione di un modello verticale
EWC, introdotto da Kirkpatrick e coautori, usa una penalità legata all’importanza dei parametri; nella versione consultata la precisione diagonale è basata sulla Fisher. Abbiamo letto metodo, esperimenti su permutazioni MNIST e risultati sulle sequenze di giochi Atari. Sono protocolli specifici, non una prova di conservazione universale per LLM. Il nostro esempio usa curvature note e due sole variabili: illustra una motivazione della regolarizzazione selettiva, senza riprodurre EWC su una rete o attribuirgli i nostri numeri.
Per una specializzazione reale bisogna definire separatamente il nuovo dominio e le capacità da preservare, mantenere test indipendenti dai dati di adattamento e confrontare il nuovo checkpoint con quello base. Un punteggio medio può nascondere la regressione di una capacità rara: servono risultati per compito e criteri di accettazione stabiliti prima della selezione. Replay di dati precedenti, distillazione delle uscite, congelamento e penalità hanno costi e ipotesi diversi. Una buona curva di training nel dominio nuovo non è evidenza sufficiente della conservazione.
La conclusione è che “cambiare poco” deve essere misurato nello spazio delle prestazioni, non soltanto contando parametri o calcolandone la norma. Nel problema costruito una distanza sei volte maggiore preserva esattamente lo stesso budget di perdita e apprende meglio B. Questa è una proprietà verificata delle due quadratiche; per un modello verticale reale resta necessario misurare il compromesso sui compiti che contano, invece di dedurlo dall’etichetta della tecnica di adattamento.
from math import sqrt
def losses(x,y):
return .5*(100*x*x+y*y), .5*((x-1)**2+(y-1)**2)
lo,hi=0.,100.
for _ in range(100):
lam=(lo+hi)/2
if losses(1/(1+100*lam),1/(1+lam))[0]>.5: lo=lam
else: hi=lam
lam=(lo+hi)/2
print(lam, losses(1/(1+100*lam),1/(1+lam)))
print(losses(1/sqrt(101),1/sqrt(101)))
Codice, dati e istruzioni · JSON. Calcoli didattici eseguiti con Python 3.14.0; figure con Matplotlib 3.11.2. Analisi con assistenza AI, senza dichiarare peer review o revisione umana. Copertina originale ImageGen, illustrativa: non documenta persone, sedi o installazioni EL-AI. Fonti consultate il 24 settembre 2026.

