ELAI S.r.l.

引导图像生成器:为什么更强不等于更好

无分类器引导改变生成过程。用完整高斯例子区分局部方向、最终分布及多样性损失。

引导图像生成器:为什么更强不等于更好

明确要求也可能得到过于相似的结果

设计团队想得到同一物体的不同图像,都符合描述,于是提高引导参数。但符合描述、多样性与视觉质量并不相同:限制可能性会去掉有用变体,过强推动还会越过目标区域。如何理解改变,而不把引导当成标着质量的旋钮?

摘要。把无分类器引导CFG解释为模型估计方向的组合,再构造完全可计算的单变量例子:某时刻组合所暗示的分布,不同于整条轨迹实际产生的分布。γ=3时静态方差0.4,运输后约0.06265。这不衡量图像美感,而证明解释控制所需的数学区别,并联系近期研究,不把计算称为视觉模型基准。

从噪声到方向:score表示什么

扩散模型学习重建逐渐被噪声破坏的数据。无需了解特定网络:在噪声水平t,密度p_t(x)描述数值的可能程度。score是对x的对数密度导数,多维时为梯度向量。它不是图像质量评分,而是局部对数密度上升方向。

score(x) = d log p(x) / dx p(x) = N(μ,v) ⇒ score(x) = −(x−μ)/v

N(μ,v)是均值μ、方差v的正态分布。均值右侧score为负,左侧为正;同距离下方差越小方向强度越大。对数密度中的−(x−μ)²/(2v)求导即得公式,独立于x的归一化项消失。这个简单情形可区分局部方向与沿它移动的点的分布。

引导比较同一点的两种描述

记s_c为条件c下方向,s_u为无该条件的参考。s_u+γ(s_c−s_u)放大条件带来的差异。γ=0用参考,γ=1用条件方向,γ>1越过条件方向外推。普通加权平均权重非负,此处参考权重1−γ却为负。因此引导是外推,而非仅选择已有样本。

s_γ = s_u + γ(s_c−s_u) = γ s_c + (1−γ)s_u

某坐标s_u=−1、s_c=0.5时,γ=3得−1+3·1.5=3.5。不是质量变三倍,而是方向场改变。参数约定也重要:在(1+w)s_c−w s_u中,本例γ=1+w。不读公式就跨实现比较引导3,可能比较不同操作。

固定噪声下的数学快照

若score精确,梯度组合等于p_c(x)^γ p_u(x)^(1−γ)的对数梯度;成为密度还需除以有限积分Z。此恒等式只在固定噪声水平成立,并未证明穿过所有噪声水平后生成该最终密度。局部地图的性质与整段旅程的性质不同。

r_γ(x) = p_c(x)^γ p_u(x)^(1−γ) / Z p_c = N(1,1), p_u = N(0,4) a_γ = γ + (1−γ)/4 μ_static = γ/a_γ, v_static = 1/a_γ

选无物理单位x的合成高斯:条件均值1方差1,参考均值0方差4。合并对数二次项得到x²系数a_γ和线性项γx,配方得均值γ/a_γ、方差1/a_γ。γ=3时为1.2、0.4,静态密度已收窄并越过1。这是抽象轴离散程度,不是语义多样性指标。

让点真正演化,而非只看公式

加入方差t的高斯噪声,密度变N(1,1+t)、N(0,4+t)。t是噪声方差,不是计算秒数。组合score为−a(t)x+b(t),a(t)=γ/(1+t)+(1−γ)/(4+t),b(t)=γ/(1+t)。取概率流方程dx/dt=−s_γ/2,从T=100走到零,t增量为负。只改符号不改方向会描述另一个过程。

dx/dt = (a(t)x − b(t))/2 dμ/dt = (a(t)μ − b(t))/2 dv/dt = a(t)v

第一式移动每个点。x的仿射运动保持高斯性,因此只追踪均值μ和方差v即可。均值遵循中心点规律;偏差以系数a/2变化,平方带来因子二,得dv/dt=av。这描述运输密度,并未强制v=1/a(t),后者属于静态快照。

为控制比较,从T时刻静态密度初始化:μ(T)=b(T)/a(T),v(T)=1/a(T)。这是明确选择,并非图像生成器的共同先验。γ=3时约N(2.83636,95.49091)。不同γ采用不同初始分布,使检验明确:即便起点符合静态快照,运输也不必符合所有后续快照。

不抽样也能核查结果

从T到零积分d log v/dt=a(t),得到最终方差精确式。1/(1+T)来自条件方差对数,4/(4+T)来自参考方差,指数是引导权重。本例因子均正,幂和归一化无歧义。

v(0) = v(T) [1/(1+T)]^γ [4/(4+T)]^(1−γ)
γ静态均值静态方差ODE均值ODE方差
00404
11111
31.20.41.4972860.0626534

ODE是常微分方程。用四阶Runge–Kutta以步长−0.025积分均值方差,再用−0.05复核。γ=3时两结果最大差小于6.4×10⁻⁸,数值与解析方差差小于4.1×10⁻⁹。γ=0和1恢复预期分布,检查符号与初值。无随机抽样,无需种子,附Python代码和结果。

γ=3、t=0的高斯密度:目标条件分布、归一化静态乘积及指定ODE运输分布。x无量纲,各曲线积分为一。峰更高表示更集中,不是质量更高。
γ=3、t=0的高斯密度:目标条件分布、归一化静态乘积及指定ODE运输分布。x无量纲,各曲线积分为一。峰更高表示更集中,不是质量更高。

运输方差0.06265远小于0.4,均值更远越过条件中心。故逐时刻score恒等不足以决定最终分布。但这不证明所有引导都会塌缩、图像必错或γ=3普遍不好。本例采用高斯、精确score和特定连续过程;重点是局部场、采样动力学及输出分布需联合分析。

论文补充什么,本文核查什么

Ho与Salimans的2022年7月26日arXiv版本组合条件与无条件估计,训练时随机丢弃条件。对64和128像素ImageNet,每引导设置评估50,000样本。指标比较不等于通用质量排名。

Jiang与Ma的2026年8月6日预印本arXiv:2607.19725v2研究轨迹修正并提出DG-CFG。DDIM评估使用SD1.5、SD2.1、SDXL与1,000个COCO提示;多样性用100提示各16图。这是作者结果,本文未复现。

本文只核查所列高斯方程,未训练网络、比较检查点或测提示遵循。近期预印本是研究而非认证,精确score理论不消除学习误差、离散步长及采样器差异。自动指标可奖励某属性而忽略另一属性。企业创意流程可能更重有用替代方案,严格约束可视化则可能不同。应先定义问题,再选参数。

如何设计有意义的实验比较

迁移到真实生成器时固定模型、版本、提示、分辨率、采样器和网络评估预算。比较多个强度,并单独比较随噪声变化的引导。配置间复用种子有利配对比较,但需很多种子和提示,一张成功图像不能代表分布。这是未执行的建议流程。除自动指标,还应记录失败、语义不同的替代方案和约束满足。

成本也需谨慎比较。无分类器不等于无额外工作:需要条件和参考预测时,两者都要算。实现可批处理或复用计算,步数不等于时间、内存或评估次数。负提示参考也不自动等于无条件参考,它改变外推起点。这些细节能在面板数值相同时改变实验含义。

结论:选择权衡,而非把旋钮开满

提高引导改变构造样本的方向,可能同时改变结果中心与离散程度。本例进一步说明,正确的瞬时密度公式也可能不能描述最终分布。知情使用需明确保留什么、执行何种动力学以及怎样评估输出集合。更强不会自动更优,质量应在具体任务中定义并验证。

参考文献与可核查材料

Jonathan Ho, Tim Salimans — Classifier-Free Diffusion Guidance, arXiv:2207.12598v1, 26 July 2022; sections 3–4.

Enze Jiang, Zheng Ma — Analytic Distribution of Classifier-Free Guidance for Schedule Design, arXiv:2607.19725v2, 6 August 2026, preprint; sections 4–6.

短程序计算精确方差。归档experiment.py还积分均值方差、检查控制例及减半步长;plot.py依据保存结果绘密度。图为计算生成,封面为示意。这是AI辅助教学分析,不是原创研究或EL-AI实验成果。

T = 100.0
for gamma in (0, 1, 3):
    a0 = gamma + (1-gamma)/4
    aT = gamma/(1+T) + (1-gamma)/(4+T)
    static_variance = 1/a0
    transported_variance = (1/aT)*(1/(1+T))**gamma*(4/(4+T))**(1-gamma)
    print(gamma, static_variance, transported_variance)
# Exact variance of the specified Gaussian ODE, not an image benchmark.

代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 9 月 29 日。