Stable Diffusion 文生图全链路
文本编码 → 扩散去噪 → 潜空间解码,对应课程 P20–P23
文本条件线
文本 Prompt
一段描述文字
→
CLIP 文本编码器
图文匹配最强编码器
→
文本向量
语义特征 Embedding
↓ Cross-Attention 条件注入
图像生成线
随机噪声
每像素随机取值
→
UNet 迭代去噪 ×T
核心:预测并扣除噪声
→
压缩特征
Latent 潜空间
→
VAE Decoder
低维恢复高维
→
生成图像
最终成片
纯噪声:无信息
去噪步数 t(拖动看噪声→图像)0 / 50
CFG 引导强度7.5
常用区间:文本贴合与画面自然度较平衡
提示:实际推理在潜空间进行,这里用像素噪声做直观演示
第1集 · P20
核心基础
整体架构两大块
CLIP 文本向量化
Encoder/Decoder 压缩恢复
第2集 · P21
扩散学习原理
前向逐步加噪
反向逐步去噪
训练目标:预测噪声
第3集 · P22
UNet 模型结构
U 型下采样/上采样
Skip Connection
Time Embedding 与交叉注意力
第4集 · P23
文生图代码实战
Pipeline 调用
Prompt / 负向提示词
步数、CFG、Seed 调参
依据卢菁《Stable Diffusion 详解》第 1–4 集整理 · 由 Tabbit 制作
Generated with Tabbit.