一个正确答案可能包含的信息太少
相机需要区分三类零件:外形相似的支架A和B,以及明显不同的隔套C。大模型正确识别出A,同时认为B是合理备选,而C几乎不可能。现在希望小模型学会同一任务。如果只给它标签A,就丢掉了部分教学信息:在教师模型看来,把A认成B,与把A认成C并不是一回事。
知识蒸馏把教师模型输出中的信息传递给学生模型。本文的问题是:备选类别的概率究竟传递了什么信息,为什么改变温度会影响学习?我们用三分类算例推导目标函数、更新信号和高温极限。结论有助于设计评估,但不能证明某个学生模型已经准确、快速或适合生产线。
教师并不直接交出自己的权重
模型先为输入产生一组称为logit的分数,再转换为概率。学生可以采用不同架构,不必复制教师的每个参数,而是尝试在迁移输入集合上复现教师行为。教师与学生的类比仅描述这种功能关系,不代表人类意图或理解。如果教师存在系统性错误,这些错误行为同样可能被学走。
合成算例中,教师logit为v = (4, 3, 0),学生初始logit为z = (2, 0, 0),顺序均为A、B、C,正确类别为A。这些数字为说明机制而设定,并非来自真实图像、已训练模型或EL-AI项目。学生能区分A与其他类别,却给B、C相同分数;教师则明确区分了这两个备选类别。
从分数到概率:温度的作用
比较模型需要概率分布,即总和为一的正数。Softmax对分数取指数后归一化。温度T是正的无量纲量,在取指数之前用于除以logit。它不是物理温度,也不表示处理器热量。T越大,分数差异作用越弱,分布越不集中。只要对同一模型所有分数采用同一T,类别排序就不会改变。
p表示教师,q表示学生;i指定一个类别,分母中的j遍历所有类别。T=1时教师约输出(0.721399, 0.265388, 0.013213),T=2时约为(0.574097, 0.348207, 0.077696)。C仍最不可能,但概率不再那么接近零。这里并未给教师增加信息,而是改变其差异以何种程度呈现给学习目标。
| T | p(A) | p(B) | p(C) |
|---|---|---|---|
| 1 | 0.721399 | 0.265388 | 0.013213 |
| 2 | 0.574097 | 0.348207 | 0.077696 |
| 4 | 0.465836 | 0.362793 | 0.171371 |
| 20 | 0.361016 | 0.343409 | 0.295575 |
横向读取表格可比较备选类别,纵向读取可观察T的影响。比值p(B)/p(C)为exp((3−0)/T),从T=1时约20.09降到T=2时约4.48。因此,温度并不会让备选类别的概率比更分离,反而使其更平缓。可能的收益来自目标函数如何利用完整分布,而非神奇地放大差异。
一个目标函数中的两种教学信号
学生可同时接收正确标签和教师概率。第一项惩罚给予A的概率过低;第二项用Kullback–Leibler散度,简称KL,衡量分布之间有方向性的差异。当p固定时,最小化KL(p||q)与最小化教师交叉熵等价,因为两者只差一个与学生无关的项。这里使用自然对数,对类别求和,不再除以类别数量。
α控制教师相对标签的权重:α=0忽略教师,α=1在损失中忽略标签。它不是经过认证的信任概率。监督项使用T=1,迁移项对教师与学生使用相同T。此次更新中教师保持固定;如果意外更新教师参数,就执行了另一种算法。T²为何出现,将通过梯度来解释:梯度决定模型实际如何被修正。
学习信号:哪个分数应该上升?
对某个logit的梯度,表示其他分数不变时,该分数略微增加会怎样改变损失。梯度下降减去与该值成比例的小量,因此正梯度降低分数,负梯度提高分数。标签项给出q_i(1)−y_i,其中y=(1,0,0)。本例约为(−0.213014, 0.106507, 0.106507):标签提高A,并以相同方式降低B和C。
对教师项,从log q_i(T) = z_i/T − log Σ_j exp(z_j/T)出发,对z_k求导得到(δ_ik−q_k)/T;i=k时δ_ik为一,否则为零。在按p_i加权求和时,教师项是常数,且Σ_i p_i=1。因此最终是学生分配值减去教师目标,再除以T。该推导要求两模型描述相同类别,且类别顺序一致。
T=2时,补偿后的蒸馏梯度为(0.004040, −0.272532, 0.268492)。主要修正不在A,因为该温度下A几乎与教师一致,而在B和C:B应上升,C应下降,单靠标签无法区分两者。α=0.5时,总梯度为(−0.104487, −0.083012, 0.187499),使A、B提高,C降低。这只是该输入的logit更新方向,并非其他输入准确率提升的证明。
为什么乘以T²,却不能保证完全不变
当T远大于logit差异时,两分布趋近均匀。它们的差值近似按1/T缩小,softmax求导又引入一个1/T,因此未补偿梯度为1/T²量级。损失乘以T²,可以避免教师项仅因这种缩放而变得微不足道,但不能保证各种温度下学习完全相同:有限T下,分布和信号方向都仍会改变。

先看左图:T增大时信号压向零;右图中即使T=100仍能区分。再看A,其梯度在T=2与T=4之间变号,直接反驳了“T²消除一切温度影响”的说法。温度决定比较怎样的差异,补偿因子控制部分信号尺度,两者相关但并不相同。
进一步推导:比较中心化logit
给全部logit加同一个常数,不改变softmax,因为该因子在分子分母中抵消。因此,无法从概率识别分数的绝对水平。比较前,应分别减去各自均值v̄和z̄。对K个类别,高温展开得到p_i ≈ 1/K + (v_i−v̄)/(KT),q同理。T大于一并不够,还必须相对分数离散程度足够大。
本例T=100时,补偿梯度约为(−0.109414, −0.441091, 0.550505),接近所示极限。这把蒸馏与中心化logit的二次误差比较联系起来。中心化很重要:仅相差一个常数的向量表示相同概率,不应被当作不同行为惩罚。但不能据此认为温度越高越好;数学极限描述目标函数,不描述模型泛化。
奠基研究展示了什么,本例没有展示什么
Hinton、Vinyals与Dean在2015年预印本Distilling the Knowledge in a Neural Network中介绍此方法。我们阅读了方法、推导和MNIST实验:教师为两层各1200单元,学生为两层各800单元,并有特定数据及正则化。作者报告教师67个错误、基线学生146个、T=20蒸馏后74个。这是作者历史结果,不是本次复现,也不能预测工业图像性能。缺失数字实验还包含测试集上的偏置调整,与独立验证选择必须区分。
本程序没有训练网络,只计算所述向量的概率、KL和梯度,再用有限差分核对解析导数:分别把某logit增加与减少0.0001,计算损失差并除以0.0002。检查允许的最大误差为10⁻⁷。还验证梯度和为零,以及教师全部logit加100后概率不变。没有随机过程,无需种子。这些验证机制,不是准确率基准。
领域模型需要怎样的对照评估
要判断是否适合支架领域,应比较同一个学生架构仅用标签训练,以及标签加蒸馏训练的结果。声明数据、预算、初始化和流程;在验证集选择T、α,并保持测试集独立。若多张图来自同一零件或批次,按图随机划分可能让测试过于接近训练。除总体准确率,还应测量A↔B混淆、新情况表现及概率校准问题。
模型更小并不自动意味着设备延迟更低,仍需明确架构、运行时、数值精度并测量完整流程。训练成本也会变化:教师必须为迁移输入生成输出,可选择缓存;K类情况下,每样本损失运算随K线性增长,网络本身成本另计。量化与蒸馏解决不同问题,组合后需联合评估。本次未进行这些硬件测量。
答案:传递差异,同时验证教师
大模型不仅能教选择哪个类别,还能教如何在备选类别之间分配合理性。本例中,标签同等对待B与C,而蒸馏提高B、降低C。温度与教师权重决定信息如何影响学生;T²只补偿一种尺度效应,不保证等价或改进。实际价值取决于教师质量、数据覆盖和学生容量。数值演示说明了机制,领域验证仍需开展。
参考资料与可复现材料
Geoffrey Hinton、Oriol Vinyals、Jeff Dean,Distilling the Knowledge in a Neural Network,arXiv:1503.02531v1,2015年3月9日。已阅读第2、2.1及3节,作为奠基参考,不把它称为2026年前沿水平。本文为AI辅助教学专论,不是经过同行评审的原创研究,也不证明EL-AI拥有专有模型或已上线应用。
Hinton, Vinyals & Dean (2015) — Distilling the Knowledge in a Neural Network.
import math
def softmax(values, T):
maximum = max(values)
exps = [math.exp((x-maximum)/T) for x in values]
return [x/sum(exps) for x in exps]
v, z, T = [4., 3., 0.], [2., 0., 0.], 2.
p, q = softmax(v, T), softmax(z, T)
gradient = [T*(s-t) for s,t in zip(q,p)]
print([round(x, 6) for x in p])
print([round(x, 6) for x in gradient])
代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 9 月 28 日。

