Una petición precisa puede producir resultados demasiado similares
Un equipo busca imágenes variadas de un objeto, coherentes con una descripción, y aumenta guía para mayor adherencia. Pero adherencia, variedad y calidad visual difieren: restringir posibilidades elimina alternativas útiles y empujar demasiado puede sobrepasar la región deseada. ¿Cómo entender el cambio sin llamar calidad a una simple perilla?
Resumen. Explicamos classifier-free guidance, CFG, como combinación de direcciones estimadas. Construimos un ejemplo de una variable calculable: la distribución sugerida en un instante difiere de la producida por toda la trayectoria. Con γ=3, varianza estática 0,4 frente a transportada 0,06265. No mide belleza: demuestra una distinción matemática para interpretar control. Lo conectamos con investigación reciente sin llamar benchmark visual a nuestros cálculos.
Del ruido a una dirección: qué indica el score
Un modelo de difusión aprende a reconstruir datos corrompidos progresivamente. Sin red concreta, imaginemos densidad p_t(x) en nivel de ruido t. Su score es derivada del logaritmo respecto a x, o vector gradiente en varias dimensiones. No es nota de calidad de imagen, sino dirección local de aumento de log-densidad.
N(μ,v) es normal de media μ y varianza v. A la derecha el score es negativo; a la izquierda positivo. Menor varianza da mayor intensidad a igual distancia. Se deriva −(x−μ)²/(2v); la normalización independiente de x desaparece. Así separamos dirección local y distribución de puntos transportados.
La guía compara dos descripciones del mismo punto
Sea s_c dirección condicionada por c y s_u referencia sin condición. s_u+γ(s_c−s_u) amplifica diferencia. γ=0 usa referencia, γ=1 dirección condicionada, γ>1 extrapola. Una media ponderada ordinaria usa pesos no negativos; aquí 1−γ es negativo. Guía implica extrapolación, no simple selección de muestras existentes.
Con s_u=−1 y s_c=0,5, γ=3 da −1+3·1,5=3,5. No triplicamos calidad; cambiamos campo de direcciones. Importa convención: en (1+w)s_c−w s_u, γ=1+w. Comparar guía 3 sin leer fórmulas puede comparar operaciones distintas.
Una fotografía matemática con ruido fijo
Con scores exactos, combinar gradientes equivale al gradiente del logaritmo de p_c(x)^γ p_u(x)^(1−γ). Una densidad exige integral finita Z. Es identidad a ruido fijo, no prueba de que recorrer todos los niveles produzca esa densidad final. Mapa local y viaje completo son afirmaciones distintas.
Elegimos gaussianas sintéticas con x sin unidad: condicionada media 1 varianza 1, referencia media 0 varianza 4. Combinar términos cuadráticos da a_γ y término lineal γx. Completando cuadrado obtenemos media γ/a_γ y varianza 1/a_γ. Con γ=3: 1,2 y 0,4. La densidad estática se estrecha y sobrepasa 1; es dispersión abstracta, no diversidad semántica.
Hagamos evolucionar puntos, no solo fórmula
Añadimos ruido gaussiano de varianza t: N(1,1+t) y N(0,4+t). t mide varianza, no segundos de cómputo. Score combinado −a(t)x+b(t), con a(t)=γ/(1+t)+(1−γ)/(4+t), b(t)=γ/(1+t). Usamos probability flow dx/dt=−s_γ/2 de T=100 hacia cero, con incrementos negativos. Cambiar signo sin invertir recorrido describe otro proceso.
La primera mueve cada punto. Un movimiento afín conserva gaussianidad: basta seguir media μ y varianza v. La media sigue al centro; desviaciones evolucionan con a/2, y elevar al cuadrado introduce factor dos: dv/dt=av. Describen densidad transportada. No impusimos v=1/a(t), varianza de la fotografía estática.
Inicializamos con densidad estática en T: μ(T)=b(T)/a(T), v(T)=1/a(T). Es elección declarada, no exactamente prior común de generador visual. Para γ=3: aproximadamente N(2,83636;95,49091). Inicios distintos por γ aclaran prueba: partir de fotografía correcta no obliga a seguir todas las posteriores.
El resultado se verifica sin generar muestras
Integrar d log v/dt=a(t) de T a cero da varianza final exacta. 1/(1+T) procede del logaritmo de varianza condicionada; 4/(4+T), de referencia. Exponentes son pesos de guía. Factores positivos evitan ambigüedad de potencias o normalización.
| γ | Media estática | Varianza estática | Media ODE | Varianza ODE |
|---|---|---|---|---|
| 0 | 0 | 4 | 0 | 4 |
| 1 | 1 | 1 | 1 | 1 |
| 3 | 1.2 | 0.4 | 1.497286 | 0.0626534 |
ODE significa ecuación diferencial ordinaria. Integramos con Runge–Kutta de cuarto orden, paso −0,025, repitiendo −0,05. Para γ=3 diferencia máxima menor de 6,4×10⁻⁸; varianza numérica a menos de 4,1×10⁻⁹ de analítica. γ=0 y 1 recuperan distribuciones previstas, verificando signos e inicio. No hay azar ni semilla. Se adjuntan Python y resultados.

Varianza transportada 0,06265 es muy inferior a 0,4 y media sobrepasa más el centro. Identidad instantánea de scores no determina distribución final. No prueba colapso universal, imágenes erróneas ni γ=3 siempre malo. Usamos gaussianas, scores exactos y proceso continuo concreto. Campo local, dinámica y distribución deben analizarse juntos.
Qué aportan los papers y qué verificamos
Ho y Salimans, versión arXiv del 26 de julio de 2022, combinan estimaciones y omiten condiciones aleatoriamente al entrenar. Evalúan ImageNet de 64 y 128 píxeles con 50.000 muestras por guía. Comparar métricas no establece calidad universal.
Jiang y Ma, preprint arXiv:2607.19725v2 del 6 de agosto de 2026, estudian corrección de trayectoria y proponen DG-CFG. Evalúan DDIM en SD1.5, SD2.1 y SDXL: 1.000 prompts COCO; diversidad, 100 prompts con 16 imágenes cada uno. No reproducimos sus resultados.
Solo verificamos ecuaciones gaussianas declaradas. No entrenamos redes, comparamos checkpoints ni medimos adherencia. Un preprint es investigación, no certificación: scores exactos no eliminan errores de aprendizaje, discretización o diferencias de sampler. Métricas pueden premiar una propiedad y omitir otra. Un proceso creativo puede valorar alternativas más que un índice; una visualización restringida, lo contrario. Primero problema, después parámetro.
Diseñar una comparación experimental útil
Para un generador real fijaría modelo, versión, prompt, resolución, sampler y presupuesto de evaluaciones. Compararía fuerzas y aparte guía variable con ruido. Reutilizar semillas permite comparación apareada, pero hacen falta muchas semillas y prompts: una imagen buena no caracteriza distribución. Protocolo propuesto, no ejecutado. Registrar fallos, alternativas semánticas y restricciones además de métricas.
También importa coste. Sin clasificador no significa sin trabajo adicional: ambas predicciones deben producirse cuando se necesitan. Pueden agruparse o reutilizar cálculo; pasos solos no describen tiempo, memoria ni evaluaciones. Referencia de prompt negativo tampoco equivale automáticamente a incondicional: cambia origen de extrapolación. Estos detalles alteran experimento manteniendo igual número visible.
Conclusión: elegir compromiso, no maximizar perilla
Aumentar guía cambia direcciones de construcción y puede alterar centro y dispersión. Mostramos además que fórmula instantánea válida puede fallar como distribución final. Control consciente exige qué preservar, qué dinámica ejecutar y cómo evaluar conjunto de salidas. Más fuerza no da calidad automática; hay que definirla y comprobarla en la tarea.
Bibliografía y material verificable
El programa breve calcula varianza exacta. experiment.py integra media y varianza, verifica controles y reduce paso; plot.py dibuja densidades desde resultados. Figuras calculadas, portada ilustrativa. Es análisis didáctico asistido por IA, no investigación original ni resultado experimental EL-AI.
T = 100.0
for gamma in (0, 1, 3):
a0 = gamma + (1-gamma)/4
aT = gamma/(1+T) + (1-gamma)/(4+T)
static_variance = 1/a0
transported_variance = (1/aT)*(1/(1+T))**gamma*(4/(4+T))**(1-gamma)
print(gamma, static_variance, transported_variance)
# Exact variance of the specified Gaussian ODE, not an image benchmark.
Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 29 de septiembre de 2026.

