ELAI S.r.l.

¿Qué enseña un modelo grande además de la respuesta correcta?

Destilación con tres clases: por qué importan las alternativas, cómo actúa la temperatura y qué señal recibe el modelo pequeño. Derivación y cálculos verificados.

¿Qué enseña un modelo grande además de la respuesta correcta?

Una respuesta correcta puede contener muy poca información

Una cámara debe distinguir tres componentes: dos escuadras parecidas, A y B, y un separador C muy diferente. Un modelo grande reconoce A, pero considera B una alternativa plausible y C casi imposible. Queremos enseñar la tarea a uno pequeño. Darle solo la etiqueta A pierde parte de la lección: para el docente, confundir A con B no equivale a confundirlo con C.

La destilación transfiere información de las salidas de un modelo docente a uno estudiante. La pregunta es precisa: ¿qué información transmiten las probabilidades de las alternativas y por qué la temperatura cambia el aprendizaje? Un ejemplo de tres clases conduce a la función objetivo, la señal de actualización y el límite de alta temperatura. Ayuda a diseñar una comparación; no demuestra que un estudiante sea ya preciso, rápido o apto para producción.

El docente no transfiere sus pesos

Un modelo asigna a una entrada puntuaciones llamadas logits antes de convertirlas en probabilidades. El estudiante puede tener otra arquitectura: no necesita copiar cada parámetro del docente. Intenta reproducir su comportamiento sobre entradas de transferencia. La analogía docente–estudiante describe esa relación funcional, no intenciones ni comprensión humanas. Si el docente se equivoca sistemáticamente, ese comportamiento también puede formar parte de la lección.

En el ejemplo sintético, los logits del docente son v = (4, 3, 0) y los iniciales del estudiante z = (2, 0, 0), en orden A, B, C. A es correcta. Son números para aislar el mecanismo, no proceden de imágenes reales, un modelo entrenado ni un proyecto EL-AI. El estudiante distingue A de las alternativas, pero asigna igual puntuación a B y C. El docente las diferencia claramente.

De puntuaciones a probabilidades: qué hace la temperatura

Para comparar modelos necesitamos distribuciones: números positivos que sumen uno. Softmax exponencia y normaliza las puntuaciones. La temperatura T, positiva y sin unidades, divide los logits antes de exponenciar. No es temperatura física ni calor del procesador. Con mayor T las diferencias pesan menos y la distribución se concentra menos. El orden de clases no cambia si aplicamos el mismo T a todos los scores de un modelo.

p_i(T) = exp(v_i/T) / Σ_j exp(v_j/T) q_i(T) = exp(z_i/T) / Σ_j exp(z_j/T)

p designa al docente y q al estudiante; i selecciona una clase y j recorre todas en el denominador. A T=1 el docente produce aproximadamente (0,721399; 0,265388; 0,013213); a T=2, (0,574097; 0,348207; 0,077696). C sigue siendo la menos plausible, pero su probabilidad está menos suprimida. No añadimos información al docente: cambiamos cómo se exponen sus diferencias al objetivo de aprendizaje.

Tp(A)p(B)p(C)
10.7213990.2653880.013213
20.5740970.3482070.077696
40.4658360.3627930.171371
200.3610160.3434090.295575

Leamos por filas para comparar alternativas y por columnas para ver T. La razón p(B)/p(C) vale exp((3−0)/T): aproximadamente 20,09 con T=1 y 4,48 con T=2. La temperatura no separa más las alternativas en términos de razón; las suaviza. El posible beneficio nace de cómo el objetivo usa toda la distribución, no de amplificar mágicamente diferencias.

Dos enseñanzas en un mismo objetivo

El estudiante puede recibir la etiqueta correcta y las probabilidades del docente. El primer término penaliza dar poca probabilidad a A. El segundo mide una discrepancia direccional mediante la divergencia de Kullback–Leibler, KL. Con p fija, minimizar KL(p||q) equivale a minimizar la entropía cruzada del docente: difieren en un término independiente del estudiante. Usamos logaritmos naturales y suma sobre clases, sin dividir por su número.

L_hard = -log q_A(1) KL(p||q) = Σ_i p_i(T) log[p_i(T)/q_i(T)] L = (1 - α)L_hard + α T² KL(p(T)||q(T)), 0 ≤ α ≤ 1

α controla el peso del docente frente a la etiqueta: α=0 ignora al docente y α=1 ignora la etiqueta en la pérdida. No es una probabilidad certificada de confianza. El término supervisado usa T=1; el de transferencia, igual T en ambos modelos. El docente permanece fijo durante la actualización. Actualizar también sus parámetros sería otro algoritmo. El motivo de T² se verá en el gradiente, la dirección concreta de corrección.

La señal de aprendizaje: ¿qué puntuación sube?

El gradiente respecto a un logit indica cómo cambia la pérdida al aumentar ligeramente esa puntuación dejando las otras fijas. El descenso resta una pequeña cantidad proporcional: un gradiente positivo baja la puntuación y uno negativo la sube. El término de etiquetas da q_i(1)−y_i, con y=(1,0,0). Aquí vale aproximadamente (−0,213014; 0,106507; 0,106507). La etiqueta sube A y baja B y C por igual.

Para el término del docente partimos de log q_i(T) = z_i/T − log Σ_j exp(z_j/T). Su derivada respecto a z_k es (δ_ik−q_k)/T; δ_ik vale uno si i=k y cero en otro caso. En la suma ponderada por p_i, el docente es constante y Σ_i p_i=1. Queda la diferencia entre lo asignado por el estudiante y lo pedido por el docente, dividida entre T. Ambos deben describir las mismas clases en el mismo orden.

∂KL/∂z_k = [q_k(T) - p_k(T)]/T ∂(T² KL)/∂z_k = T[q_k(T) - p_k(T)]

A T=2 el gradiente compensado es (0,004040; −0,272532; 0,268492). La corrección principal no afecta a A, casi alineada con el docente a esa temperatura, sino a B y C. B debe subir y C bajar; las etiquetas solas no las distinguían. Con α=0,5 el gradiente total es (−0,104487; −0,083012; 0,187499): suben A y B, baja C. Son direcciones de logits para esta entrada, no evidencia de mejor precisión en otras.

Por qué multiplicar por T² sin prometer invariancia

Si T crece mucho frente a las diferencias de logits, ambas distribuciones se acercan a la uniforme. Su diferencia decrece aproximadamente como 1/T y la derivada introduce otro 1/T. El gradiente sin compensar es de orden 1/T². Multiplicar la pérdida por T² evita que el docente se vuelva despreciable solo por ese escalado. No hace idéntico el aprendizaje a cualquier temperatura: con T finita cambian distribuciones y direcciones.

Caso sintético v=(4,3,0), z=(2,0,0). Izquierda: gradiente sin compensar; derecha: multiplicado por T². Un signo negativo significa que el descenso aumenta ese logit. Los puntos son cálculos, no resultados de entrenamiento.
Caso sintético v=(4,3,0), z=(2,0,0). Izquierda: gradiente sin compensar; derecha: multiplicado por T². Un signo negativo significa que el descenso aumenta ese logit. Los puntos son cálculos, no resultados de entrenamiento.

Observemos primero la izquierda: al subir T, las señales se acercan a cero. A la derecha siguen diferenciadas incluso a T=100. Después miremos A: su gradiente cambia de signo entre T=2 y T=4. Es un contraejemplo a que T² cancele todos los efectos de temperatura. La temperatura determina qué diferencias comparar; el factor controla parte de la escala. Son funciones relacionadas pero distintas.

El límite técnico: comparar logits centrados

Sumar una constante común a todos los logits no cambia softmax: el factor se cancela entre numerador y denominador. El nivel absoluto no es identificable desde las probabilidades. Restemos a cada vector su propia media, v̄ o z̄. Con K clases, la expansión da p_i ≈ 1/K + (v_i−v̄)/(KT), y análogamente para q. No basta T mayor que uno: debe ser grande frente a la dispersión de puntuaciones.

T[q_i(T) - p_i(T)] → [(z_i-z̄) - (v_i-v̄)]/K K = 3: limit = (-0.111111, -0.444444, 0.555556)

Con nuestros vectores, a T=100 el gradiente compensado es aproximadamente (−0,109414; −0,441091; 0,550505), cercano al límite. Esto conecta la destilación con una comparación cuadrática de logits centrados. Centrar importa: vectores que solo difieren en una constante representan las mismas probabilidades y no deberían penalizarse como comportamientos distintos. No significa que una temperatura arbitrariamente alta sea mejor: el límite describe el objetivo, no la generalización.

Qué mostró el trabajo fundacional y qué no muestra este ejemplo

Hinton, Vinyals y Dean describen el método en el preprint de 2015 Distilling the Knowledge in a Neural Network. Leímos método, derivación y experimentos MNIST: docente de dos capas de 1200 unidades, estudiante de 800 y datos y regularización específicos. Reportan 67 errores del docente, 146 del estudiante base y 74 con destilación a T=20. Son resultados históricos de los autores, no nuestra reproducción ni una predicción industrial. La sección de dígitos ausentes ajusta sesgos sobre test, algo distinto de seleccionar con validación independiente.

Nuestro programa no entrena redes. Calcula probabilidades, KL y gradientes, y compara la derivada analítica con diferencias finitas: sube y baja un logit en 0,0001, evalúa la pérdida y divide la diferencia por 0,0002. El error máximo permitido es 10⁻⁷. Comprueba suma nula del gradiente e invariancia al añadir 100 a todos los logits del docente. No hay azar ni semilla. Verificamos el mecanismo, no la precisión.

La comparación necesaria para un modelo de dominio

Para valorar el dominio de las escuadras hay que comparar el mismo estudiante con etiquetas solas y con etiquetas más destilación. Declarar datos, presupuesto, inicializaciones y protocolo; elegir T y α en validación y separar test. Si varias imágenes comparten pieza o lote, dividirlas al azar puede hacer test demasiado parecido al entrenamiento. Medir confusiones A↔B, casos nuevos y mala calibración, además de exactitud global.

Un modelo menor no implica automáticamente menos latencia en el dispositivo. Hacen falta arquitectura, runtime, precisión numérica y medidas del recorrido completo. Cambia también el coste de entrenamiento: el docente produce salidas de transferencia, quizá almacenadas; con K clases, la pérdida por ejemplo crece linealmente con K, pero el coste de las redes es aparte. Cuantización y destilación abordan problemas distintos y combinarlas exige evaluación conjunta. Aquí no hicimos esas medidas hardware.

Respuesta: transferir diferencias y verificar al docente

El modelo grande enseña cómo repartir plausibilidad entre alternativas, no solo qué clase elegir. En el ejemplo, destilar sube B y baja C donde la etiqueta las trataba igual. Temperatura y peso del docente determinan su influencia; T² compensa un efecto de escala sin garantizar equivalencia ni mejora. El valor depende de calidad docente, cobertura de datos y capacidad del estudiante. La demostración explica el mecanismo; falta validar en el dominio.

Bibliografía y material reproducible

Geoffrey Hinton, Oriol Vinyals, Jeff Dean, Distilling the Knowledge in a Neural Network, arXiv:1503.02531v1, 9 de marzo de 2015. Referencia fundacional, leídas secciones 2, 2.1 y 3; no se presenta como estado del arte de 2026. Es una monografía didáctica asistida por IA, no investigación original revisada por pares. No acredita un modelo propio EL-AI ni una aplicación disponible.

Hinton, Vinyals & Dean (2015) — Distilling the Knowledge in a Neural Network.

import math
def softmax(values, T):
    maximum = max(values)
    exps = [math.exp((x-maximum)/T) for x in values]
    return [x/sum(exps) for x in exps]
v, z, T = [4., 3., 0.], [2., 0., 0.], 2.
p, q = softmax(v, T), softmax(z, T)
gradient = [T*(s-t) for s,t in zip(q,p)]
print([round(x, 6) for x in p])
print([round(x, 6) for x in gradient])

Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 28 de septiembre de 2026.