diffusion 和 gan 的优缺点对比

木水_

已于 2024-01-25 11:38:54 修改

阅读量6.2k

点赞数 10

分类专栏：深度学习文章标签： gan diffusion

于 2024-01-24 20:43:11 首次发布

本文链接：https://blog.youkuaiyun.com/m0_37324740/article/details/135829671

版权

46 篇文章

订阅专栏

本文比较了trainGAN与Diffusion在生成模型中的优缺点，强调了Diffusion训练的稳定性、连续性和对复杂分布的模拟能力，以及GAN如StyleGAN在可控性和特定任务上的优势。CV大模型如SD倾向于利用Diffusion的这些特性来增强性能。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

模拟分布连续性
Diffusion相较于GAN可以模拟更加复杂，更加非线性的分布。但是Diffusion模拟的分布没有GAN连续性好，特别是在video风格迁移的时候，可能帧之间的关系会有很大差别。Diffusion就可以建模更加general，复杂的图像，大模型正需要像Diffusion这样的能力。所以SD等cv大模型才会依靠Diffusion越来越强大。
GAN可以在某种单个类别的生成上做到很好的效果，比如人脸。GAN很难在多种不同类别的图像组成的数据集上学到这样复杂的分布。

模型可控性
以StyleGAN为代表的GAN，生成器的输入latent space包括noise和latent code(w)。w的存在使得GAN的可控性更加直接，通过控制低维数据就可以控制高维数据的生成（但这种控制更加抽象），比如连续性插值操作和DragGAN等。
以SD为代表的Diffusion输入有noise latent space和text embedding space。text embedding的可控性没有w来的直接。