扩散模型实战 · 无中生有生成手写数字 8
① 前向加噪(T=200 步,噪声越加越多)
8
8
8
8
8
t=0
t=50
t=100
t=150
t=200
α=0.99
α≈0.97
α≈0.95
α≈0.92
α=0.90
α 线性衰减:前期少加噪保结构,后期猛加噪——换一套加噪 schedule 就是一个论文创新点
② 制造训练样本(每张 8 扩增 100 份,数据集共 6.4 GB)
原始图像 x₀
仅数字 8 · 像素归一化 0~1
随机噪声 ε
标准正态分布采样
随机时刻 t
1~200 均匀采样
加权求和
x_t = √ᾱ·x₀ + √(1−ᾱ)·ε
训练样本对
输入 (x_t, t)
学习目标:噪声 ε
③ 两个关键认知
反直觉:预测目标是随机变量
噪声 ε 由人工采样,模型学的是「还原噪声」
本质:信息分离
x_t 自带噪声信息,如同分离两人合唱的声音