EP20核心基础:生成范式与 LDM 总览
前五模块讲「理解」(分类、对齐、检测、分割),本模块进入「生成」。Stable Diffusion 是潜空间扩散模型(Latent Diffusion Model, LDM)的工程化落地:不在像素空间直接扩散,而是先用 VAE 把图像压缩进低维潜空间,再在潜空间中做扩散与去噪,最后解码回像素。
① VAE(压缩 / 解压)
- Encoder:512×512×3 图像 → 64×64×4 潜表示(约 48 倍压缩)
- Decoder:潜表示 → 还原全尺寸图像
- 预训练后冻结,不参与扩散训练
② U-Net(去噪核心)
- 在潜空间逐步预测并去除噪声
- 输入:潜噪声 + 时间步 t + 文本条件
- 输出:该步的预测噪声 ε̂
③ CLIP 文本编码器(语义条件)
- 冻结的 CLIP ViT-L/14,把 prompt 编码为语义向量
- 经交叉注意力注入 U-Net 各层,引导去噪方向
一句话分工:VAE 负责压缩与还原,CLIP 负责理解文字,U-Net 负责逐步绘制。潜空间设计让训练与生成计算量下降约一个数量级,8GB 显存的消费级显卡即可运行——这是 SD 能引爆 AIGC 平民化的关键工程决策。
EP21扩散学习:从噪声到图像
扩散模型(DDPM,2015 年提出思想、2020 年完善)的核心逻辑:训练时学「从清晰图到噪声图」,生成时做「从噪声图回到清晰图」。
前向扩散(训练用,固定过程)
z₀清晰潜图像
→
z₁…z_{t-1}逐步加噪
→
z_T纯高斯噪声
每一步向潜表示注入少量高斯噪声,T 步后图像信息被完全淹没。前向过程无需学习,由固定的噪声日程表(noise schedule)控制。
反向去噪(生成用,模型学习)
训练 U-Net 预测每一步加入的噪声 ε,然后反方向逐步「减噪」,从纯噪声一路还原出符合文本条件的清晰图像。训练目标极简:
L = Ez₀, ε~N(0,I), t, c [ ‖ ε − ε_θ(z_t, t, c) ‖² ] // 预测噪声与真实噪声的均方误差,c 为文本条件
- 采样(推理):从随机噪声出发,迭代 T 步(实际用 DDIM 等加速采样器可压到 20–50 步)
- Classifier-Free Guidance:推理时把「有条件预测」与「无条件预测」做外推放大(guidance scale),让结果更贴合 prompt——SD 实战中的 CFG 参数即来源于此
EP22模型结构:U-Net 内部
输入
潜噪声 z_t + t + 文本 c
64×64×4 噪声 + 时间步嵌入 + 文本向量
→
下采样路径
Encoder Blocks
ResNet 块 + 注意力,逐级降分辨率、升语义
→
瓶颈 + 跳跃连接
Middle + Skip
深层语义与浅层细节经跳跃连接直通融合
→
上采样路径
Decoder Blocks
逐级还原分辨率,重建空间细节
→
输出
预测噪声 ε̂
与 z_t 同尺寸,供采样器减噪
文本条件如何注入:交叉注意力
- U-Net 原本为医学图像分割设计(U 形 + 跳跃连接),SD 在其每个分辨率层级的注意力块中加入交叉注意力层:Query 来自图像特征,Key/Value 来自 CLIP 文本向量
- 由此每个空间位置都能「查询」prompt 中与之相关的词——「猫」引导猫形区域、「赛博朋克」引导风格色彩
- 时间步 t 经正弦位置编码 + MLP 嵌入后加到各 ResNet 块,让模型知道「当前该去多少噪」
EP23文生图代码实战
第 23 集转入动手环节,用 Hugging Face diffusers 库跑通完整文生图管线:
prompt → CLIP 文本编码 → 随机潜噪声 → U-Net 迭代去噪(CFG 引导)→ VAE 解码 → 输出图像
关键实战参数
- prompt / negative prompt:描述要与不要的元素
- num_inference_steps:采样步数,质量与速度的权衡
- guidance_scale(CFG):文本引导强度,过高会过饱和
- seed:固定随机种子可复现结果
能力延展
- 同一管线支持 img2img(图生图)、inpainting(局部重绘)、outpainting(外扩绘制)
- 局部重绘需要先有掩码——呼应 GLIP + SAM 的定位/分割能力(Grounded-SAM 流水线)
- 训练数据:LAION-5B 子集(美学评分 ≥ 6 的 LAION-Aesthetics v2.6)
脉络在课程主线中的位置
ViT(1–4)视觉 Token 化
→
CLIP(5–8)图文对齐
→
统一架构(9–12)视觉进 LLM
→
SAM(13–15)分割基础模型
→
GLIP(16–19)开放词汇检测
→
Stable Diffusion(20–23)文生图生成
→
AIGC 扩散(24–30)生成模型纵深
SD 是前序模块的「集大成消费者」:文本编码器直接复用 CLIP(模块二);交叉注意力条件注入延续「统一架构」的跨模态思想(模块三);inpainting 等工作流依赖 GLIP + SAM 的先定位(模块四、五)。
⚠️ 来源说明:本页基于已实证素材(官方分集标题与时长,来自 B 站 pagelist 接口)与权威公开资料(LDM 论文 arXiv:2112.10752、DDPM arXiv:2006.11239、Stability AI / AWS 官方技术文档、Wikipedia)交叉核对合成;受平台限制,第 20–23 集字幕正文未能逐字提取,未能逐字核对处已降低结论强度。