ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

什么是扩散模型(Diffusion Model)?

什么是扩散模型(Diffusion Model)? 扩散模型Diffusion Model是一类通过「逐步加噪声再逐步去噪」来学习数据分布的生成模型核心思想在 2015 年由 Sohl-Dickstein 等人提出并在 2020 年 DDPM 论文后真正引爆。它如今是 Stable Diffusion、DALL·E 2、Midjourney 等图像生成工具的底层架构也是继 GAN 之后生成式 AI 最重要的一次范式更替。概述先用一句话说清它的定位扩散模型是一台会逆向播放的碎纸机。正向过程把一张清晰的图片一步步加噪直到变成纯随机噪点逆向过程则训练一个神经网络学会从噪点里一步步还原出图片。学会还原之后给它一团随机噪声它就能还原出一张全新的、训练集中不存在的图像。它的出现改变了什么在它之前图像生成几乎被 GAN 垄断在它之后生成质量和多样性同时提升且训练不再那么玄学。如今你用的 AI 绘画工具十有八九是扩散模型。传统方案 vs 扩散模型在扩散模型流行之前生成图像主要依赖 GANGenerative Adversarial Network生成对抗网络和 VAE变分自编码器。这些方案都存在明显的瓶颈GAN 用生成器 vs 判别器左右互搏来训练容易训练不稳定、模式崩塌只会生成少数几类图。VAE 生成结果偏模糊细节不够锐利。两者都很难在质量和多样性之间同时做好。对比来看对比维度GAN扩散模型训练目标生成器骗过判别器对抗预测并去掉噪声回归训练稳定性差容易崩塌、难调参好目标函数简单稳定生成质量高但常牺牲多样性质量与多样性兼顾生成速度快一次前向慢需多次去噪迭代模式覆盖易模式崩塌覆盖更完整数学基础博弈论 / 对抗概率扩散 / 变分推断一句话概括GAN 是两个网络在打架扩散模型是一个网络在擦除噪声——后者显然更好训练。扩散模型的核心组件把扩散模型拆开看其实只有三个关键概念1. 前向扩散Forward Diffusion——加噪给定一张真实图片 x₀在 T 个时间步里逐步加入高斯噪声时间步Timestep, t从 0 到 T越大噪声越多。噪声强度α_t控制每一步加入多少噪声。高斯噪声Gaussian Noise, ε每次加入的随机扰动。这一步不需要训练是固定的数学过程。当 T 足够大时x_T 几乎就是纯噪声。一句话概括前向过程就是往图上慢慢撒雪花直到什么都看不清。2. 逆向去噪Reverse Denoising——核心中的核心真正要训练的是一个神经网络 ε_θ让它学会给定一张带噪图片和当前时间步 t预测出里面混进去的噪声。输入带噪图像 x_t 和时间步 t。输出预测的噪声 ε̂。损失函数让预测噪声 ε̂ 和真实噪声 ε 尽可能接近均方误差。这个公式看着唬人但它要表达的意思只有一句——猜猜这张糊图里被加了多少噪声猜得越准越好。会猜噪声就等于会反向去噪。一句话概括逆向过程就是训练模型当橡皮擦一步步把雪花擦掉。3. 采样生成Sampling——从噪声造图训练完成后从纯噪声 x_T 出发反复调用 ε_θ 预测噪声并减去它经过 T 步后得到 x₀——一张全新的图像。随机起点每次从不同的随机噪声出发就能得到不同的图。迭代次数步数越多越精细但速度越慢这正是扩散模型的软肋。一句话概括采样就是从一团静电噪声里一步步擦出一张画。整体架构 / 工作原理把三步串起来数据流是这样的补充两个工程细节U-Net 注意力预测噪声的网络通常用 U-Net并嵌入注意力层这就是 Transformer 思想渗进扩散模型的入口。文本条件Conditioning把文字描述编码成向量注入网络就能实现文字生成图像这是 Stable Diffusion 的关键。有哪些变体 / 怎么选类型特点代表模型DDPM原始扩散质量高但采样慢DDPM加速采样用更少的步数完成去噪DDIM、DPM-Solver潜空间扩散Latent在压缩后的潜空间去噪快且省显存Stable Diffusion文本条件扩散用文字引导生成DALL·E 2、Imagen流匹配Flow Matching用更直的路径替代扩散更快SD3、Flux扩散模型的意义与影响训练更稳回归式的目标函数让训练不再是玄学调参。质量与多样性兼得解决了 GAN 模式崩塌的老问题。可控生成配合文本、ControlNet 等条件实现精细控制。统一范式同一套思想扩展到视频、音频、3D、蛋白质结构等多个领域。总结扩散模型的核心思想就是「把破坏当成学习把还原当作生成」——先教模型如何一步步破坏数据再让它学会一步步还原。它用多次去噪换来了稳定训练 高质量生成这笔交易正是它取代 GAN、成为生成式 AI 主流的原因。
返回列表