生成模型学习数据的分布 P(x),从而能够生成新的样本。
| 类型 | 方法 | 代表 |
|---|
| 显式密度模型 | 直接建模 P(x) | VAE、Flow |
| 隐式密度模型 | 不显式建模分布 | GAN |
| 得分模型 | 学习得分函数 | Diffusion |
GAN 由生成器和判别器对抗训练:
minGmaxDV(D,G)=Ex∼pdata[logD(x)]+Ez∼pz[log(1−D(G(z)))]
graph LR
Z["随机噪声z"] --> G["生成器G"]
G --> Fake["假样本G(z)"]
X["真实样本x"] --> D["判别器D"]
Fake --> D
D --> Out["真/假"]
交替训练:
1. 固定G,训练D: 区分真假样本
D_loss = -E[log D(x)] - E[log(1 - D(G(z)))]
2. 固定D,训练G: 生成更逼真的样本
G_loss = -E[log D(G(z))] (非饱和损失)
最优判别器:
D∗(x)=pdata(x)+pg(x)pdata(x)
全局最优:当 pg=pdata 时,D∗(x)=0.5
| 变体 | 改进 | 说明 |
|---|
| DCGAN | 卷积架构 | 稳定训练 |
| WGAN | Wasserstein距离 | 解决模式崩溃 |
| CGAN | 条件生成 | 控制生成内容 |
| CycleGAN | 循环一致性 | 无配对图像转换 |
| StyleGAN | 风格控制 | 高质量人脸生成 |
| SAGAN | 自注意力 | 全局一致性 |
WGAN:用Wasserstein距离替代JS散度:
W(pdata,pg)=sup∥f∥L≤1Ex∼pdata[f(x)]−Ex∼pg[f(x)]
| 问题 | 原因 | 解决方案 |
|---|
| 模式崩溃 | G只生成少数样本 | WGAN、Minibatch判别 |
| 训练不稳定 | D和G能力不匹配 | 谱归一化、梯度惩罚 |
| 评估困难 | 无显式似然 | FID、IS指标 |
VAE 通过编码器-解码器结构学习数据的潜在表示:
编码器:qϕ(z∣x)≈p(z∣x)
解码器:pθ(x∣z)
L(θ,ϕ)=Eqϕ(z∣x)[logpθ(x∣z)]−DKL(qϕ(z∣x)∥p(z))
| 项 | 含义 | 作用 |
| :------- | :------------------------------------ | :--------------------- | -------- |
| 重建项 | E[logp_θ(x∣z)] | 重建质量 |
| KL散度项 | DKL(qϕ∥p) | 正则化,使后验接近先验 |
直接从 qϕ(z∣x) 采样不可微,使用重参数化:
z=μ+σ⊙ϵ,ϵ∼N(0,I)
| 维度 | VAE | GAN |
|---|
| 训练稳定性 | 稳定 | 不稳定 |
| 生成质量 | 较模糊 | 较清晰 |
| 似然估计 | 有 | 无 |
| 潜在空间 | 有结构 | 无结构 |
| 模式覆盖 | 好 | 差(模式崩溃) |
扩散模型包含前向扩散和反向去噪两个过程:
前向过程(加噪):
q(xt∣xt−1)=N(xt;1−βtxt−1,βtI)
任意时刻的分布:
q(xt∣x0)=N(xt;αˉtx0,(1−αˉt)I)
其中 αˉt=∏s=1t(1−βs)。
反向过程(去噪):
pθ(xt−1∣xt)=N(xt−1;μθ(xt,t),σt2I)
简化后的损失函数:
Lsimple=Et,x0,ϵ[∥ϵ−ϵθ(xt,t)∥2]
模型学习预测添加的噪声 ϵ。
| 方法 | 步数 | 质量 |
|---|
| DDPM | 1000步 | 高 |
| DDIM | 20~50步 | 高 |
| DPM-Solver | 10~20步 | 高 |
| LCM | 1~4步 | 中 |
Classifier-Free Guidance:
ϵ^θ=(1+w)ϵθ(xt,t,c)−wϵθ(xt,t,∅)
- w 为引导强度
- w 越大,生成结果越符合条件但多样性降低
| 模型 | 领域 | 特点 |
|---|
| DDPM | 图像 | 开创性工作 |
| Stable Diffusion | 图像 | 潜在空间扩散 |
| DALL-E 2/3 | 图像 | 文本到图像 |
| Sora | 视频 | 视频生成 |
| AudioLDM | 音频 | 音频生成 |
| 维度 | GAN | VAE | Diffusion |
|---|
| 生成质量 | 高 | 中 | 最高 |
| 多样性 | 低 | 高 | 高 |
| 训练稳定性 | 差 | 好 | 好 |
| 采样速度 | 快 | 快 | 慢 |
| 似然估计 | 无 | 有(下界) | 有 |
| 可控性 | 中 | 中 | 高 |