Resumen: la distancia entre pesos no mide el olvido
Adaptar al dominio puede mejorar la tarea nueva y degradar capacidades anteriores. Una actualización euclídea pequeña no garantiza poca regresión: importan dirección y curvatura. Construimos dos tareas cuadráticas exactas. Con pérdida anterior 0,5, una penalización informada por curvatura alcanza pérdida nueva 0,459957 frente a 0,810894 de la isótropa, moviéndose mucho más en parámetros. Después rotamos el problema y mostramos qué información pierde la diagonal.
Es análisis didáctico de optimización, no experimento con modelos lingüísticos, materiales ni productos EL-AI. Parámetros y pérdidas son adimensionales. Requiere álgebra lineal, derivadas y formas cuadráticas. Aísla un mecanismo, no demuestra preservar toda capacidad real. El estudio LoRA anterior trata representación y rango; aquí estudiamos la función que determina el daño al trabajo previo.
1. Dos tareas y una geometría explícita
El modelo tiene θ=(θ₁,θ₂). A minimiza en el origen y penaliza la primera dirección cien veces más. B quiere ambos parámetros iguales a uno. Adaptar sin restricciones llega a (1,1): pérdida B cero y A 50,5. Conocemos ambas funciones en todo punto, sin errores de estimación u optimización, separando conflicto de objetivos de otros problemas.
En el origen el gradiente A es cero: un producto escalar de gradientes no detecta conflicto de primer orden. Pero un paso sobre B con tasa η da θ=(η,η), L_A=50,5η² y L_B=(1−η)². Con η=0,1 la pérdida anterior ya es 0,505. El daño es de segundo orden. Taylor ΔL_A≈g_AᵀΔθ+½ΔθᵀH_AΔθ es exacto aquí; en una red sería local con un resto por evaluar.
2. Penalizar uniformemente o seguir la curvatura
La penalización isótropa minimiza L_B+λ||θ−θ_A||²/2 y da θ₁=θ₂=1/(1+λ), restringiendo igual direcciones sensibles y flexibles. La anisótropa usa λθᵀH_Aθ/2 y da θ₁=1/(1+100λ), θ₂=1/(1+λ). Aquí H_A es curvatura exacta y la penalización equivale a λL_A, no una estimación de la capacidad previa.
Comparar el mismo λ engaña: multiplica geometrías distintas. Fijamos presupuesto común L_A≤0,5 y comparamos pérdida B. La isótropa requiere λ=√101−1≈9,049876. La anisótropa resuelve por bisección 50/(1+100λ)²+0,5/(1+λ)²=0,5: λ≈0,178844891. El código guarda la solución y verifica tolerancia 10^−12. Son pérdidas comparables sobre las mismas funciones.
| Método | θ₁ | θ₂ | L_A | L_B |
|---|---|---|---|---|
| Libre | 1.000000 | 1.000000 | 50.500000 | 0.000000 |
| Isótropo | 0.099504 | 0.099504 | 0.500000 | 0.810894 |
| Anisótropo | 0.052954 | 0.848288 | 0.500000 | 0.459957 |
| Congelación | 0.000000 | 1.000000 | 0.500000 | 0.500000 |
El punto anisótropo es (0,052954;0,848288): apenas mueve la dirección sensible y aprovecha la segunda. Su distancia al origen es 0,849939 frente a 0,140720 isótropa, pero ambas tienen L_A=0,5. Congelar θ₁ y llevar θ₂ a uno da L_B=0,5, algo peor que 0,459957. Mover coordinadamente ambos parámetros aprovecha mejor el presupuesto que congelar por completo.

3. Por qué la solución construida es óptima
Minimizar L_B sujeto a L_A≤ε es convexo y el origen es estrictamente factible con ε=0,5. El mínimo libre de B viola la restricción, por lo que esta queda activa. La Lagrangiana L_B+λ(L_A−ε), λ≥0, da las ecuaciones anisótropas. Convexidad y optimalidad prueban mínimo global para estas cuadráticas. No inferimos superioridad universal de una curva: resolvemos un problema conocido. Las redes no convexas no heredan automáticamente la justificación.
4. Rotar el problema revela el límite de la diagonal
En una base rotada, H=[[50,5;49,5],[49,5;50,5]]. Las direcciones unitarias u_+=(1,1)/√2 y u_−=(1,−1)/√2 tienen curvaturas 100 y 1: desplazamientos unitarios causan pérdidas 50 y 0,5. Eliminar elementos fuera de diagonal predice 25,25 en ambas. La diagonal sobreestima un daño y subestima otro: pierde el orden, no solo precisión numérica.
Una matriz completa para p parámetros cuesta O(p²) memoria; una diagonal O(p), justificando la simplificación. La protección depende de parametrización y correlaciones ignoradas. El script guarda valores, no estima Fisher. Hay que distinguir Hessiana, Fisher esperada y empírica: no son intercambiables sin hipótesis. Una diagonal estimada no es geometría exacta de capacidades.
5. De la geometría a evaluar un modelo vertical
EWC de Kirkpatrick y colegas penaliza cambios según importancia; la versión consultada usa precisión diagonal basada en Fisher. Leímos método, MNIST permutado y resultados Atari secuenciales. Son protocolos concretos, no pruebas universales para LLM. Nuestro caso de dos variables y curvatura conocida ilustra regularización selectiva, sin reproducir EWC ni atribuirle nuestros números.
Especializar exige definir dominio nuevo y capacidades conservadas, pruebas independientes y comparación con el checkpoint base. Una media puede ocultar regresión rara: hacen falta resultados por tarea y criterios previos. Replay, destilación, congelación y penalizaciones tienen costes e hipótesis distintos. Una buena curva del dominio nuevo no basta como evidencia de conservación.
“Cambiar poco” debe medirse en rendimiento, no solo en cantidad o norma de parámetros. Aquí un desplazamiento unas seis veces mayor conserva el mismo presupuesto y aprende mejor B. Es una propiedad verificada de estas cuadráticas. Un modelo real exige medir el compromiso en tareas relevantes, no deducirlo del nombre de la técnica.
from math import sqrt
def losses(x,y):
return .5*(100*x*x+y*y), .5*((x-1)**2+(y-1)**2)
lo,hi=0.,100.
for _ in range(100):
lam=(lo+hi)/2
if losses(1/(1+100*lam),1/(1+lam))[0]>.5: lo=lam
else: hi=lam
lam=(lo+hi)/2
print(lam, losses(1/(1+100*lam),1/(1+lam)))
print(losses(1/sqrt(101),1/sqrt(101)))
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 24 de septiembre de 2026.

