U-Net:CNN + 时间信号的噪声预测网络 时间信号 t embedding → 28×28 时间图 加噪图 x_t 28×28 逐像素相加 ⊕ 获得时间+图像双重信息 卷积+池化 ↓ 14×14 · 32通道 继续压缩 时间图同步缩小再相加 反卷积 ↑ 逐层放大 与同层特征逐步相加 输出:预测噪声 ε̂ 恢复 28×28 跳跃相加 ② 训练与生成 训练:教模型认出噪声 输入 (x_t, t) → 输出预测噪声 ε̂ GPU 约 1 小时 · 纯 CPU 睡一觉也好 生成:把过程倒过来放 随机噪声 → 逐时刻预测噪声 按复原公式去噪,200 步后 8 浮现 核心代码仅几十行:造数据 → 搭模型 → 生成;论文数学符号绕人,实现本身不难
Generated with Tabbit.