U-Net:CNN + 时间信号的噪声预测网络
时间信号 t
embedding → 28×28 时间图
加噪图 x_t
28×28
逐像素相加 ⊕
获得时间+图像双重信息
卷积+池化 ↓
14×14 · 32通道
继续压缩
时间图同步缩小再相加
反卷积 ↑ 逐层放大
与同层特征逐步相加
输出:预测噪声 ε̂
恢复 28×28
跳跃相加
② 训练与生成
训练:教模型认出噪声
输入 (x_t, t) → 输出预测噪声 ε̂
GPU 约 1 小时 · 纯 CPU 睡一觉也好
生成:把过程倒过来放
随机噪声 → 逐时刻预测噪声
按复原公式去噪,200 步后 8 浮现
核心代码仅几十行:造数据 → 搭模型 → 生成;论文数学符号绕人,实现本身不难