生成模型

00:00
9 min Advanced 2026/6/15

GAN、VAE、Diffusion Model生成模型原理与对比。

1. 生成模型概述

生成模型学习数据的分布 ,从而能够生成新的样本。

1.1 分类

类型方法代表
显式密度模型直接建模 VAE、Flow
隐式密度模型不显式建模分布GAN
得分模型学习得分函数Diffusion

2. GAN(生成对抗网络)

2.1 基本原理

GAN 由生成器判别器对抗训练:

2.2 训练过程

交替训练:
1. 固定G,训练D: 区分真假样本
   D_loss = -E[log D(x)] - E[log(1 - D(G(z)))]

2. 固定D,训练G: 生成更逼真的样本
   G_loss = -E[log D(G(z))]  (非饱和损失)

2.3 理论保证

最优判别器

全局最优:当 时,

2.4 GAN变体

变体改进说明
DCGAN卷积架构稳定训练
WGANWasserstein距离解决模式崩溃
CGAN条件生成控制生成内容
CycleGAN循环一致性无配对图像转换
StyleGAN风格控制高质量人脸生成
SAGAN自注意力全局一致性

WGAN:用Wasserstein距离替代JS散度:

2.5 GAN训练问题

问题原因解决方案
模式崩溃G只生成少数样本WGAN、Minibatch判别
训练不稳定D和G能力不匹配谱归一化、梯度惩罚
评估困难无显式似然FID、IS指标

3. VAE(变分自编码器)

3.1 基本原理

VAE 通过编码器-解码器结构学习数据的潜在表示

3.2 损失函数(ELBO)

含义作用
重建项重建质量
KL散正则化,使后验接近先验

3.3 重参数化技巧

直接 采样不可微,使用重参数化

3.4 VAE vs GAN

维度VAEGAN
训练稳定性稳定不稳定
生成质量较模糊较清晰
似然估计
潜在空间结构结构
模式覆盖差(模式崩溃)

4. Diffusion Model(扩散模型)

4.1 基本原理

扩散模型前向扩散反向去噪两个过程

前向过程(加噪):

任意时刻的分布:

其中

反向过程(去噪):

4.2 训练目标

简化后的损失函数

模型学习预测添加的噪声

4.3 采样方法

方法步数质量
DDPM1000步
DDIM20~50步
DPM-Solver10~20步
LCM1~4步

4.4 条件生成

Classifier-Free Guidance

  • 为引导强
  • 越大,生成结果越符合条件样性降低

4.5 代表模型

模型领域
DDPM图像开创性工作
Stable Diffusion图像潜在空间扩散
DALL-E 2/3图像文本图像
Sora视频视频生成
AudioLDM音频音频生成

5. 生成模型对比

维度GANVAEDiffusion
生成质量
样性
训练稳定性
采样速
似然估计有(下界)
可控性

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式