ELAI S.r.l.

垂直模型:保留能力不只是让更新幅度小

用两个二次任务分离适配与保留的权衡:曲率、惩罚、同等损失比较及对角近似限制。

垂直模型:保留能力不只是让更新幅度小

摘要:权重距离不能衡量遗忘

领域适配可改善新任务,却损害已有能力。欧氏范数小的更新不保证退化小,方向和旧损失曲率很重要。本文构造两个可精确求解的二次任务。在旧损失同为 0.5 时,曲率惩罚的新损失为 0.459957,各向同性惩罚为 0.810894,尽管前者参数移动远得多。随后旋转问题,说明只保留对角项可能恰好丢掉关键信息。

这是教学优化分析,不是语言模型、材料或 EL-AI 产品实验。参数与损失均无量纲,需要线性代数、导数及二次型基础。实例隔离一种专门化机制,不证明任何持续学习方法能保留真实模型所有能力。此前 LoRA 分析讨论更新表示和秩;本文讨论决定更新如何伤害旧任务的函数。

1. 两个任务与明确几何

模型有两个参数 θ=(θ₁,θ₂)。任务 A 在原点最小,对第一方向的惩罚为第二方向的一百倍;新任务 B 希望两参数都为一。无约束适配到 (1,1),B 损失零,A 升至 50.5。函数处处已知,无估计或优化误差,因此可将目标冲突与其他训练问题分开。

L_A(θ)=½(100θ₁²+θ₂²), θ_A=(0,0) L_B(θ)=½[(θ₁−1)²+(θ₂−1)²] H_A=diag(100,1)

原点处 A 梯度为零,因此只看梯度内积无法发现一阶冲突。但对 B 做学习率 η 的梯度步,得到 θ=(η,η),故 L_A=50.5η²、L_B=(1−η)²。η=0.1 时旧损失已为 0.505。这里损害是二阶的。Taylor 式 ΔL_A≈g_AᵀΔθ+½ΔθᵀH_AΔθ 对此二次函数精确;对神经网络只是局部近似,需检查余项。

2. 均匀惩罚与曲率惩罚

各向同性惩罚最小化 L_B+λ||θ−θ_A||²/2,求导得 θ₁=θ₂=1/(1+λ),同等限制敏感与灵活方向。各向异性惩罚用 λθᵀH_Aθ/2,得到 θ₁=1/(1+100λ)、θ₂=1/(1+λ)。本例 H_A 为精确曲率,惩罚恰等于 λL_A,并非旧能力的估计近似。

θ_iso(λ)=(1/(1+λ),1/(1+λ)) θ_aniso(λ)=(1/(1+100λ),1/(1+λ))

相同 λ 比较会误导,因为它乘的是不同几何量。改用共同预算 L_A≤0.5,比较 B 损失。各向同性 λ=√101−1≈9.049876;各向异性通过二分求解单调方程 50/(1+100λ)²+0.5/(1+λ)²=0.5,得 λ≈0.178844891。代码保存解并以 10^−12 容差检查约束。两方法使用相同损失函数,因此可比较。

方法θ₁θ₂L_AL_B
无约束1.0000001.00000050.5000000.000000
各向同性0.0995040.0995040.5000000.810894
各向异性0.0529540.8482880.5000000.459957
冻结0.0000001.0000000.5000000.500000

各向异性点约为 (0.052954,0.848288),几乎不动敏感方向,主要利用第二方向。离原点距离为 0.849939,而各向同性仅 0.140720,但 L_A 都为 0.5。完全冻结 θ₁、令 θ₂=1,可得 L_B=0.5,简单但略差于最优值 0.459957。两参数协调移动可比绝对冻结更充分利用预算。

曲线由 301 个对数间隔 λ 计算,竖线固定同一退化预算 L_A=0.5,并非真实数据训练曲线。
曲线由 301 个对数间隔 λ 计算,竖线固定同一退化预算 L_A=0.5,并非真实数据训练曲线。

3. 为什么构造案例中的解最优

min L_B 且 L_A≤ε 是凸问题;ε=0.5 时原点严格可行。B 的无约束最优点违反约束,因此最优点位于边界。Lagrangian L_B+λ(L_A−ε)、λ≥0,正好给出各向异性方程。凸性与最优性条件保证该二次问题的全局最优。不是从一条曲线推断普遍优越,而是解析验证已知问题;非凸网络不自动继承这一论证。

4. 旋转问题揭示对角近似限制

将同一各向异性写在旋转坐标中:H=[[50.5,49.5],[49.5,50.5]]。单位方向 u_+=(1,1)/√2 与 u_−=(1,−1)/√2 曲率分别为 100、1。单位移动分别造成损失 50、0.5。删去非对角项后,两方向预测损失均为 25.25。对角近似高估一方向、低估另一方向,可能连排序也丢失,而不只是精度下降。

H_rot = [[50.5,49.5],[49.5,50.5]] ½u_+ᵀH_rot u_+ = 50 ½u_−ᵀH_rot u_− = 0.5 ½u_±ᵀdiag(H_rot)u_± = 25.25

p 参数的完整矩阵需 O(p²) 内存,对角仅 O(p),因此简化有实际理由。但保护质量取决于参数化及被忽略相关性。脚本保存这些值,不从数据估计 Fisher。应用中需区分损失 Hessian、期望 Fisher 与经验 Fisher,它们不能无条件互换。不能把估计对角项说成能力的精确几何。

5. 从几何到垂直模型评估

Kirkpatrick 等提出 EWC,按参数重要性惩罚变化;所读版本使用基于 Fisher 的对角精度矩阵。已阅读方法、排列 MNIST 实验及序列 Atari 结果。这些是特定协议,不是 LLM 普遍保留能力的证明。本例只有两变量、曲率已知,用于解释选择性正则动机,不复现网络 EWC,也不把本文数字归于该方法。

真实专门化需分别定义新领域与待保留能力,使用独立于适配数据的测试,并与基础 checkpoint 比较。平均分可能掩盖稀有能力退化,因此需逐任务结果和选择前设定的验收标准。旧数据回放、输出蒸馏、冻结与惩罚各有成本和假设。新领域训练曲线良好,不足以证明保留能力。

“少改变”应在性能空间衡量,而不只是参数数量或范数。本例约六倍的位移保持同一旧损失预算,却更好学习 B。这是两二次函数的已验证性质;真实垂直模型仍需在相关任务上测量权衡,不能从适配技术名称推断。

Kirkpatrick J. et al. (25 January 2017), Overcoming catastrophic forgetting in neural networks, arXiv:1612.00796v2, method §2 and experiments §§2.1–2.2.

from math import sqrt
def losses(x,y):
    return .5*(100*x*x+y*y), .5*((x-1)**2+(y-1)**2)
lo,hi=0.,100.
for _ in range(100):
    lam=(lo+hi)/2
    if losses(1/(1+100*lam),1/(1+lam))[0]>.5: lo=lam
    else: hi=lam
lam=(lo+hi)/2
print(lam, losses(1/(1+100*lam),1/(1+lam)))
print(losses(1/sqrt(101),1/sqrt(101)))

代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 9 月 24 日。