AIGC 扩散学习:从生成模型进化史到加噪-去噪
对应课程 P24–P30:发展史 → 正向加噪 → 采样技巧 → 反向去噪 → 反直觉现象 → 代码实战
生成模型四代演进
VAE 变分自编码器
2013 · 压缩-重建
训练稳定生成偏模糊
学潜空间分布再采样,均值化倾向导致细节丢失
GAN 生成对抗网络
2014 · 对抗博弈
出图快且锐利训练易崩
生成器判别器互卷,模式崩塌是家常便饭
Flow 流模型
2015+ · 可逆变换
似然可精确算结构受限
必须可逆且雅可比好算,网络设计束手束脚
Diffusion 扩散模型
2020 · DDPM
稳定+高质+多样推理慢
把生成拆成 T 步去噪小任务,当前文生图主流
t=0:原图,信息完整
正向加噪步数 t(图像 → 纯噪声)0 / 100
一步加噪公式(第 3 集采样技巧)
xt = √ᾱt · x0 + √(1−ᾱt) · ε
任意 t 一步到位,不必循环 t 次——训练提速的关键
反向过程就是把滑块从右往左拖,交给训练好的 UNet 逐步执行
正向过程(无需学习)
真实图 x₀
↓ 逐步加高斯噪声
q(xt|xt-1) 马尔可夫链
↓ T 步后
纯噪声 xT ~ N(0, I)
反向过程(神经网络学习)
纯噪声 xT
↓ UNet 预测当前噪声 ε̂
扣除噪声,得 xt-1
↓ 迭代 T 次
生成图 x₀
训练目标(极简损失)
随机采 t 与噪声 ε
用公式一步造出 xt
L = ‖ε − ε̂(xt, t)‖²
预测噪声 ≠ 预测图像
第 5 集:三个反直觉现象
预测噪声反而更稳
直接预测上一步图像是学不动的硬任务;改预测"当初掺进去的噪声",目标边界清晰、梯度稳定,效果反而更好
加了噪还能算回来
加噪千步听起来不可逆,但每步只加一点点,条件分布在数学上可逼近高斯,反向才有解析可学
慢工出细活的代价
GAN 一步出图,扩散要几十上百步——质量、多样性、稳定性全赢了,唯独输了速度,于是有了 DDIM 等加速采样
七集速览
P24 · 第1集
生成模型的发展
VAE/GAN/Flow 为何让位扩散
P25 · 第2集
正向学习
马尔可夫加噪链的数学定义
P26 · 第3集
正向采样技巧
重参数化与一步加噪公式
P27 · 第4集
反向过程
从噪声到图像的逐步去噪
P28 · 第5集
反直觉现象
为何预测噪声而非图像
P29 · 第6集
代码实战 1
加噪调度与训练循环
P30 · 第7集
代码实战 2
采样生成与效果调优
依据卢菁《AIGC 扩散学习》第 1–7 集(DDPM 技术体系)整理 · 由 Tabbit 制作
Generated with Tabbit.