ELAI S.r.l.

Guiar un generador de imágenes: por qué más fuerza no significa más calidad

Classifier-free guidance cambia el proceso generativo. Un ejemplo gaussiano separa dirección local, distribución final y pérdida de variedad.

Guiar un generador de imágenes: por qué más fuerza no significa más calidad

Una petición precisa puede producir resultados demasiado similares

Un equipo busca imágenes variadas de un objeto, coherentes con una descripción, y aumenta guía para mayor adherencia. Pero adherencia, variedad y calidad visual difieren: restringir posibilidades elimina alternativas útiles y empujar demasiado puede sobrepasar la región deseada. ¿Cómo entender el cambio sin llamar calidad a una simple perilla?

Resumen. Explicamos classifier-free guidance, CFG, como combinación de direcciones estimadas. Construimos un ejemplo de una variable calculable: la distribución sugerida en un instante difiere de la producida por toda la trayectoria. Con γ=3, varianza estática 0,4 frente a transportada 0,06265. No mide belleza: demuestra una distinción matemática para interpretar control. Lo conectamos con investigación reciente sin llamar benchmark visual a nuestros cálculos.

Del ruido a una dirección: qué indica el score

Un modelo de difusión aprende a reconstruir datos corrompidos progresivamente. Sin red concreta, imaginemos densidad p_t(x) en nivel de ruido t. Su score es derivada del logaritmo respecto a x, o vector gradiente en varias dimensiones. No es nota de calidad de imagen, sino dirección local de aumento de log-densidad.

score(x) = d log p(x) / dx p(x) = N(μ,v) ⇒ score(x) = −(x−μ)/v

N(μ,v) es normal de media μ y varianza v. A la derecha el score es negativo; a la izquierda positivo. Menor varianza da mayor intensidad a igual distancia. Se deriva −(x−μ)²/(2v); la normalización independiente de x desaparece. Así separamos dirección local y distribución de puntos transportados.

La guía compara dos descripciones del mismo punto

Sea s_c dirección condicionada por c y s_u referencia sin condición. s_u+γ(s_c−s_u) amplifica diferencia. γ=0 usa referencia, γ=1 dirección condicionada, γ>1 extrapola. Una media ponderada ordinaria usa pesos no negativos; aquí 1−γ es negativo. Guía implica extrapolación, no simple selección de muestras existentes.

s_γ = s_u + γ(s_c−s_u) = γ s_c + (1−γ)s_u

Con s_u=−1 y s_c=0,5, γ=3 da −1+3·1,5=3,5. No triplicamos calidad; cambiamos campo de direcciones. Importa convención: en (1+w)s_c−w s_u, γ=1+w. Comparar guía 3 sin leer fórmulas puede comparar operaciones distintas.

Una fotografía matemática con ruido fijo

Con scores exactos, combinar gradientes equivale al gradiente del logaritmo de p_c(x)^γ p_u(x)^(1−γ). Una densidad exige integral finita Z. Es identidad a ruido fijo, no prueba de que recorrer todos los niveles produzca esa densidad final. Mapa local y viaje completo son afirmaciones distintas.

r_γ(x) = p_c(x)^γ p_u(x)^(1−γ) / Z p_c = N(1,1), p_u = N(0,4) a_γ = γ + (1−γ)/4 μ_static = γ/a_γ, v_static = 1/a_γ

Elegimos gaussianas sintéticas con x sin unidad: condicionada media 1 varianza 1, referencia media 0 varianza 4. Combinar términos cuadráticos da a_γ y término lineal γx. Completando cuadrado obtenemos media γ/a_γ y varianza 1/a_γ. Con γ=3: 1,2 y 0,4. La densidad estática se estrecha y sobrepasa 1; es dispersión abstracta, no diversidad semántica.

Hagamos evolucionar puntos, no solo fórmula

Añadimos ruido gaussiano de varianza t: N(1,1+t) y N(0,4+t). t mide varianza, no segundos de cómputo. Score combinado −a(t)x+b(t), con a(t)=γ/(1+t)+(1−γ)/(4+t), b(t)=γ/(1+t). Usamos probability flow dx/dt=−s_γ/2 de T=100 hacia cero, con incrementos negativos. Cambiar signo sin invertir recorrido describe otro proceso.

dx/dt = (a(t)x − b(t))/2 dμ/dt = (a(t)μ − b(t))/2 dv/dt = a(t)v

La primera mueve cada punto. Un movimiento afín conserva gaussianidad: basta seguir media μ y varianza v. La media sigue al centro; desviaciones evolucionan con a/2, y elevar al cuadrado introduce factor dos: dv/dt=av. Describen densidad transportada. No impusimos v=1/a(t), varianza de la fotografía estática.

Inicializamos con densidad estática en T: μ(T)=b(T)/a(T), v(T)=1/a(T). Es elección declarada, no exactamente prior común de generador visual. Para γ=3: aproximadamente N(2,83636;95,49091). Inicios distintos por γ aclaran prueba: partir de fotografía correcta no obliga a seguir todas las posteriores.

El resultado se verifica sin generar muestras

Integrar d log v/dt=a(t) de T a cero da varianza final exacta. 1/(1+T) procede del logaritmo de varianza condicionada; 4/(4+T), de referencia. Exponentes son pesos de guía. Factores positivos evitan ambigüedad de potencias o normalización.

v(0) = v(T) [1/(1+T)]^γ [4/(4+T)]^(1−γ)
γMedia estáticaVarianza estáticaMedia ODEVarianza ODE
00404
11111
31.20.41.4972860.0626534

ODE significa ecuación diferencial ordinaria. Integramos con Runge–Kutta de cuarto orden, paso −0,025, repitiendo −0,05. Para γ=3 diferencia máxima menor de 6,4×10⁻⁸; varianza numérica a menos de 4,1×10⁻⁹ de analítica. γ=0 y 1 recuperan distribuciones previstas, verificando signos e inicio. No hay azar ni semilla. Se adjuntan Python y resultados.

Densidades gaussianas en t=0, γ=3: condicionada deseada, producto estático normalizado y distribución transportada por ODE indicada. x no tiene unidad; cada curva integra uno. Mayor altura indica concentración, no calidad.
Densidades gaussianas en t=0, γ=3: condicionada deseada, producto estático normalizado y distribución transportada por ODE indicada. x no tiene unidad; cada curva integra uno. Mayor altura indica concentración, no calidad.

Varianza transportada 0,06265 es muy inferior a 0,4 y media sobrepasa más el centro. Identidad instantánea de scores no determina distribución final. No prueba colapso universal, imágenes erróneas ni γ=3 siempre malo. Usamos gaussianas, scores exactos y proceso continuo concreto. Campo local, dinámica y distribución deben analizarse juntos.

Qué aportan los papers y qué verificamos

Ho y Salimans, versión arXiv del 26 de julio de 2022, combinan estimaciones y omiten condiciones aleatoriamente al entrenar. Evalúan ImageNet de 64 y 128 píxeles con 50.000 muestras por guía. Comparar métricas no establece calidad universal.

Jiang y Ma, preprint arXiv:2607.19725v2 del 6 de agosto de 2026, estudian corrección de trayectoria y proponen DG-CFG. Evalúan DDIM en SD1.5, SD2.1 y SDXL: 1.000 prompts COCO; diversidad, 100 prompts con 16 imágenes cada uno. No reproducimos sus resultados.

Solo verificamos ecuaciones gaussianas declaradas. No entrenamos redes, comparamos checkpoints ni medimos adherencia. Un preprint es investigación, no certificación: scores exactos no eliminan errores de aprendizaje, discretización o diferencias de sampler. Métricas pueden premiar una propiedad y omitir otra. Un proceso creativo puede valorar alternativas más que un índice; una visualización restringida, lo contrario. Primero problema, después parámetro.

Diseñar una comparación experimental útil

Para un generador real fijaría modelo, versión, prompt, resolución, sampler y presupuesto de evaluaciones. Compararía fuerzas y aparte guía variable con ruido. Reutilizar semillas permite comparación apareada, pero hacen falta muchas semillas y prompts: una imagen buena no caracteriza distribución. Protocolo propuesto, no ejecutado. Registrar fallos, alternativas semánticas y restricciones además de métricas.

También importa coste. Sin clasificador no significa sin trabajo adicional: ambas predicciones deben producirse cuando se necesitan. Pueden agruparse o reutilizar cálculo; pasos solos no describen tiempo, memoria ni evaluaciones. Referencia de prompt negativo tampoco equivale automáticamente a incondicional: cambia origen de extrapolación. Estos detalles alteran experimento manteniendo igual número visible.

Conclusión: elegir compromiso, no maximizar perilla

Aumentar guía cambia direcciones de construcción y puede alterar centro y dispersión. Mostramos además que fórmula instantánea válida puede fallar como distribución final. Control consciente exige qué preservar, qué dinámica ejecutar y cómo evaluar conjunto de salidas. Más fuerza no da calidad automática; hay que definirla y comprobarla en la tarea.

Bibliografía y material verificable

Jonathan Ho, Tim Salimans — Classifier-Free Diffusion Guidance, arXiv:2207.12598v1, 26 July 2022; sections 3–4.

Enze Jiang, Zheng Ma — Analytic Distribution of Classifier-Free Guidance for Schedule Design, arXiv:2607.19725v2, 6 August 2026, preprint; sections 4–6.

El programa breve calcula varianza exacta. experiment.py integra media y varianza, verifica controles y reduce paso; plot.py dibuja densidades desde resultados. Figuras calculadas, portada ilustrativa. Es análisis didáctico asistido por IA, no investigación original ni resultado experimental EL-AI.

T = 100.0
for gamma in (0, 1, 3):
    a0 = gamma + (1-gamma)/4
    aT = gamma/(1+T) + (1-gamma)/(4+T)
    static_variance = 1/a0
    transported_variance = (1/aT)*(1/(1+T))**gamma*(4/(4+T))**(1-gamma)
    print(gamma, static_variance, transported_variance)
# Exact variance of the specified Gaussian ODE, not an image benchmark.

Código, datos e instrucciones · JSON. Cálculos didácticos ejecutados con Python 3.14.0; figuras con Matplotlib 3.11.2. Análisis asistido por IA, sin afirmar revisión por pares ni humana. Portada original ImageGen ilustrativa: no documenta personas, sedes ni instalaciones de EL-AI. Fuentes consultadas el 29 de septiembre de 2026.