明确要求也可能得到过于相似的结果
设计团队想得到同一物体的不同图像,都符合描述,于是提高引导参数。但符合描述、多样性与视觉质量并不相同:限制可能性会去掉有用变体,过强推动还会越过目标区域。如何理解改变,而不把引导当成标着质量的旋钮?
摘要。把无分类器引导CFG解释为模型估计方向的组合,再构造完全可计算的单变量例子:某时刻组合所暗示的分布,不同于整条轨迹实际产生的分布。γ=3时静态方差0.4,运输后约0.06265。这不衡量图像美感,而证明解释控制所需的数学区别,并联系近期研究,不把计算称为视觉模型基准。
从噪声到方向:score表示什么
扩散模型学习重建逐渐被噪声破坏的数据。无需了解特定网络:在噪声水平t,密度p_t(x)描述数值的可能程度。score是对x的对数密度导数,多维时为梯度向量。它不是图像质量评分,而是局部对数密度上升方向。
N(μ,v)是均值μ、方差v的正态分布。均值右侧score为负,左侧为正;同距离下方差越小方向强度越大。对数密度中的−(x−μ)²/(2v)求导即得公式,独立于x的归一化项消失。这个简单情形可区分局部方向与沿它移动的点的分布。
引导比较同一点的两种描述
记s_c为条件c下方向,s_u为无该条件的参考。s_u+γ(s_c−s_u)放大条件带来的差异。γ=0用参考,γ=1用条件方向,γ>1越过条件方向外推。普通加权平均权重非负,此处参考权重1−γ却为负。因此引导是外推,而非仅选择已有样本。
某坐标s_u=−1、s_c=0.5时,γ=3得−1+3·1.5=3.5。不是质量变三倍,而是方向场改变。参数约定也重要:在(1+w)s_c−w s_u中,本例γ=1+w。不读公式就跨实现比较引导3,可能比较不同操作。
固定噪声下的数学快照
若score精确,梯度组合等于p_c(x)^γ p_u(x)^(1−γ)的对数梯度;成为密度还需除以有限积分Z。此恒等式只在固定噪声水平成立,并未证明穿过所有噪声水平后生成该最终密度。局部地图的性质与整段旅程的性质不同。
选无物理单位x的合成高斯:条件均值1方差1,参考均值0方差4。合并对数二次项得到x²系数a_γ和线性项γx,配方得均值γ/a_γ、方差1/a_γ。γ=3时为1.2、0.4,静态密度已收窄并越过1。这是抽象轴离散程度,不是语义多样性指标。
让点真正演化,而非只看公式
加入方差t的高斯噪声,密度变N(1,1+t)、N(0,4+t)。t是噪声方差,不是计算秒数。组合score为−a(t)x+b(t),a(t)=γ/(1+t)+(1−γ)/(4+t),b(t)=γ/(1+t)。取概率流方程dx/dt=−s_γ/2,从T=100走到零,t增量为负。只改符号不改方向会描述另一个过程。
第一式移动每个点。x的仿射运动保持高斯性,因此只追踪均值μ和方差v即可。均值遵循中心点规律;偏差以系数a/2变化,平方带来因子二,得dv/dt=av。这描述运输密度,并未强制v=1/a(t),后者属于静态快照。
为控制比较,从T时刻静态密度初始化:μ(T)=b(T)/a(T),v(T)=1/a(T)。这是明确选择,并非图像生成器的共同先验。γ=3时约N(2.83636,95.49091)。不同γ采用不同初始分布,使检验明确:即便起点符合静态快照,运输也不必符合所有后续快照。
不抽样也能核查结果
从T到零积分d log v/dt=a(t),得到最终方差精确式。1/(1+T)来自条件方差对数,4/(4+T)来自参考方差,指数是引导权重。本例因子均正,幂和归一化无歧义。
| γ | 静态均值 | 静态方差 | ODE均值 | ODE方差 |
|---|---|---|---|---|
| 0 | 0 | 4 | 0 | 4 |
| 1 | 1 | 1 | 1 | 1 |
| 3 | 1.2 | 0.4 | 1.497286 | 0.0626534 |
ODE是常微分方程。用四阶Runge–Kutta以步长−0.025积分均值方差,再用−0.05复核。γ=3时两结果最大差小于6.4×10⁻⁸,数值与解析方差差小于4.1×10⁻⁹。γ=0和1恢复预期分布,检查符号与初值。无随机抽样,无需种子,附Python代码和结果。

运输方差0.06265远小于0.4,均值更远越过条件中心。故逐时刻score恒等不足以决定最终分布。但这不证明所有引导都会塌缩、图像必错或γ=3普遍不好。本例采用高斯、精确score和特定连续过程;重点是局部场、采样动力学及输出分布需联合分析。
论文补充什么,本文核查什么
Ho与Salimans的2022年7月26日arXiv版本组合条件与无条件估计,训练时随机丢弃条件。对64和128像素ImageNet,每引导设置评估50,000样本。指标比较不等于通用质量排名。
Jiang与Ma的2026年8月6日预印本arXiv:2607.19725v2研究轨迹修正并提出DG-CFG。DDIM评估使用SD1.5、SD2.1、SDXL与1,000个COCO提示;多样性用100提示各16图。这是作者结果,本文未复现。
本文只核查所列高斯方程,未训练网络、比较检查点或测提示遵循。近期预印本是研究而非认证,精确score理论不消除学习误差、离散步长及采样器差异。自动指标可奖励某属性而忽略另一属性。企业创意流程可能更重有用替代方案,严格约束可视化则可能不同。应先定义问题,再选参数。
如何设计有意义的实验比较
迁移到真实生成器时固定模型、版本、提示、分辨率、采样器和网络评估预算。比较多个强度,并单独比较随噪声变化的引导。配置间复用种子有利配对比较,但需很多种子和提示,一张成功图像不能代表分布。这是未执行的建议流程。除自动指标,还应记录失败、语义不同的替代方案和约束满足。
成本也需谨慎比较。无分类器不等于无额外工作:需要条件和参考预测时,两者都要算。实现可批处理或复用计算,步数不等于时间、内存或评估次数。负提示参考也不自动等于无条件参考,它改变外推起点。这些细节能在面板数值相同时改变实验含义。
结论:选择权衡,而非把旋钮开满
提高引导改变构造样本的方向,可能同时改变结果中心与离散程度。本例进一步说明,正确的瞬时密度公式也可能不能描述最终分布。知情使用需明确保留什么、执行何种动力学以及怎样评估输出集合。更强不会自动更优,质量应在具体任务中定义并验证。
参考文献与可核查材料
短程序计算精确方差。归档experiment.py还积分均值方差、检查控制例及减半步长;plot.py依据保存结果绘密度。图为计算生成,封面为示意。这是AI辅助教学分析,不是原创研究或EL-AI实验成果。
T = 100.0
for gamma in (0, 1, 3):
a0 = gamma + (1-gamma)/4
aT = gamma/(1+T) + (1-gamma)/(4+T)
static_variance = 1/a0
transported_variance = (1/aT)*(1/(1+T))**gamma*(4/(4+T))**(1-gamma)
print(gamma, static_variance, transported_variance)
# Exact variance of the specified Gaussian ODE, not an image benchmark.
代码、数据与说明 · JSON. 教学计算使用 Python 3.14.0,图使用 Matplotlib 3.11.2。分析由 AI 辅助,不声称经过同行评审或人工审核。原创 ImageGen 封面仅作示意,不记录 EL-AI 人员、场所或实际安装。来源查阅于 2026 年 9 月 29 日。

