引言:生成式AI的范式转移时刻
2021年夏天,一篇题为《Diffusion Models Beat GANs on Image Synthesis》的论文在NeurIPS会议上以Spotlight形式发表。论文标题本身就构成了一个宣言:扩散模型在图像合成质量上超越了统治生成式AI领域近七年的生成对抗网络(GANs)。这不是一次微小的改进,而是一次范式的宣告。
在这篇论文中,作者Prafulla Dhariwal和Alexander Nichol展示了扩散模型在ImageNet 128×128上达到FID 2.97的成绩,在256×256上达到4.59,在512×512上达到7.72。这些数字意味着,扩散模型不仅超越了当时的BigGAN-deep,甚至在仅使用25次前向传播的情况下就能匹敌对方的最优表现。
然而,技术指标的超越只是故事的表层。更深层的转变发生在产业与学术共同体的注意力转移上:OpenAI的GLIDE和DALL-E 2、Google的Imagen、以及后来引爆全球的Stable Diffusion,无一例外地选择了扩散模型作为核心架构。GANs时代那些令人惊艳却难以驾驭的生成能力,似乎在一夜之间找到了更稳定、更可控的载体。
那么,扩散模型究竟凭借什么完成了对GANs的超越?它的崛起是技术必然还是偶然?在“下一个顶流”的光环之下,扩散模型自身又面临着怎样的局限与挑战?本文将沿着扩散模型的技术脉络、与GANs的对比分析、以及实际应用中的表现与瓶颈,试图给出一个系统性的回答。
一、从对抗到扩散:生成范式的根本差异
1.1 GANs的核心机制及其困境
要理解扩散模型的崛起,首先需要理解它所取代的对象。GANs由Ian Goodfellow于2014年提出,其核心思想简洁而优雅:让两个神经网络相互对抗。生成器(Generator)试图从随机噪声中合成逼真数据,判别器(Discriminator)则试图区分真实数据与生成数据。在理想情况下,两者的博弈会达到纳什均衡,生成器学会完美复现真实数据分布。
这一机制在图像生成领域取得了巨大成功。StyleGAN系列尤其令人印象深刻,其生成的1024×1024人脸图像在很长一段时间内代表了生成质量的最高水平。GANs的另一个显著优势是推理效率:一旦训练完成,生成一张图像只需要一次前向传播,这使得实时应用成为可能。在遥感图像分类等需要快速推断的场景中,基于GAN的方法可以实现低于100毫秒的推理时间。
然而,GANs的成功始终伴随着结构性的脆弱。最核心的问题在于其训练动态的不稳定性。生成器与判别器的博弈是一个寻找鞍点的问题,而非简单的损失最小化。这种博弈常常导致模式崩溃(mode collapse):生成器学会只产生少数几种能够“骗过”判别器的样本,而放弃了数据分布中其他模式的多样性。在 hyperspectral 遥感任务中,模式崩溃问题尤为突出,生成的特征分布会坍缩至少数主导类别。
此外,GANs生成的图像常常缺乏物理一致性。在遥感场景中,这意味着生成的频谱可能违反光谱合理性,出现异常的反射率范围或相邻波段之间的不一致。判别器的目标在于“区分真假”,而非“理解物理”。这种对抗性目标导致内部表示往往具有语义模糊性。
GANs的另一个深层困境在于其可解释性的匮乏。尽管判别器的中间层可以被用于特征提取,但整个系统的运作方式缺乏可追溯的渐进式结构。当生成失败时,研究者很难定位问题出在生成器的哪一层、判别器的哪一层,抑或是训练动态的哪个阶段。
1.2 扩散模型的核心理念:从噪声中逐步恢复
扩散模型的理论根基可以追溯到非平衡热力学。其核心思想是定义一个前向过程,逐步向数据中添加高斯噪声,直至数据完全变为纯噪声;然后学习一个逆向过程,从纯噪声中逐步去噪,恢复出原始数据。
这一过程可以形式化地描述。给定数据 x0,前向扩散过程在 T 个时间步中逐步添加噪声:
q(xt∣xt−1)=N(xt;1−βtxt−1,βtI)
其中 βt 是预设的噪声调度参数。当 T 足够大时,xT 近似于标准正态分布。逆向过程则学习一个神经网络 ϵθ 来预测每一步添加的噪声:
pθ(xt−1∣xt)=N(xt−1;μθ(xt,t),Σθ(xt,t))
训练目标简化为一个去噪得分匹配问题:预测添加的噪声与真实噪声之间的均方误差。
这种“加噪-去噪”的范式与GANs的“对抗-欺骗”范式形成了鲜明对比。扩散模型不依赖于判别器来提供训练信号,而是通过最大化数据似然的下界来进行训练。这意味着训练过程是一个稳定的优化问题,而非不稳定的博弈。
扩散模型的渐进式结构也带来了天然的可解释性。在去噪过程的每个阶段,研究者可以可视化中间状态,观察图像如何从纯噪声逐渐浮现出结构。这种透明性是GANs所不具备的。正如一篇综述所指出的,扩散模型的迭代去噪过程产生了渐进的中间状态,使得内部运作更易于可视化和理解。
从特征表示的角度看,两种范式的差异同样显著。GANs依赖对抗性学习来增强判别性特征,而扩散模型通过迭代优化实现稳定且逐步精炼的特征表示。这种差异在跨域适应性上表现得尤为明显:扩散模型的多步去噪过程能够自然地过滤传感器特定的噪声,实现平滑的特征迁移。
二、扩散模型的技术演进:从DDPM到Stable Diffusion
2.1 关键突破:DDPM、DDIM与潜在扩散
扩散模型并非2021年才被发明。其理论基础可以追溯到Sohl-Dickstein等人2015年的工作,但直到2020年Ho等人提出DDPM(Denoising Diffusion Probabilistic Models),扩散模型才首次展示出与GANs竞争的生成质量。
DDPM的核心贡献在于证明了扩散模型能够生成高质量、多样性的样本,并且训练过程稳定可靠。然而,DDPM的一个致命缺陷是采样速度极慢:生成一张图像需要1000步的去噪迭代,这与GANs的单次前向传播形成了鲜明对比。
DDIM(Denoising Diffusion Implicit Models)的出现是第一个关键转折。Song等人发现,可以通过非马尔可夫的前向过程来重新参数化扩散模型,使得采样过程可以大幅加速。DDIM的核心洞见在于:扩散模型的采样轨迹不必是随机的。通过设置 σt=0σt=0,可以实现确定性的采样,将纯噪声与图像之间建立一对一的映射。
这意味着采样步骤可以从1000步减少到50步甚至更少,而生成质量几乎不受影响。在CIFAR-10数据集上,DDIM在50步采样下的FID为4.67,而DDPM在1000步下的FID为4.73。DDIM还带来了一个额外的好处:确定性采样使得图像反演(inversion)成为可能,即给定真实图像,可以计算出对应的噪声向量,这为图像编辑打开了大门。
第二个关键突破是潜在扩散模型(Latent Diffusion Models, LDMs)。像素空间中的扩散计算成本极高,因为高分辨率图像的维度非常庞大。LDM的核心思想是将扩散过程从像素空间转移到压缩的潜在空间:首先使用变分自编码器(VAE)将图像编码为低维潜在表示,然后在潜在空间中执行扩散过程,最后解码回像素空间。
这一策略使得训练和推理都变得显著更高效。Stable Diffusion正是基于LDM架构,才能够在消费级GPU上运行,从而引爆了全球范围内的AI绘画热潮。2022年Stable Diffusion的开源发布是一个转折点,它不仅让扩散模型进入了公众视野,更催生了大量微调和衍生模型,极大地扩展了图像生成的产业应用。
2.2 条件生成的突破:Classifier Guidance与Classifier-Free Guidance
无条件生成只是扩散模型能力的一半。真正让扩散模型成为“顶流”的,是其强大的条件生成能力——根据文本提示、类别标签或其他条件来控制生成内容。
2021年的《Diffusion Models Beat GANs》论文中,Dhariwal和Nichol提出了classifier guidance方法:利用一个在噪声图像上训练的分类器的梯度来引导扩散采样过程,在保真度与多样性之间进行权衡。这种方法在ImageNet上取得了突破性的FID成绩,但需要额外训练一个分类器。
更具影响力的突破是classifier-free guidance(CFG)。这种方法不需要独立的分类器,而是同时训练条件扩散模型和无条件扩散模型,在采样时将两者的得分函数进行线性组合。CFG的核心优势在于简洁性和有效性:它直接嵌入到标准扩散训练流程中,只需在训练时以一定概率丢弃条件信息即可。
CFG成为了文本到图像生成的实际标准。Stable Diffusion、DALL-E 2、Imagen等系统都依赖于CFG来实现高质量的文本对齐。然而,CFG也并非完美无缺。2025年CVPR的一项研究指出,广泛使用的“系数之和为一”的CFG配置实际上会导致生成分布的期望偏移,理论上并非严格的扩散过程。这项研究提出了ReCFG(Rectified Diffusion Guidance),通过放松系数约束来修正这一问题。
另一项CVPR 2025的工作TCFG则从几何角度重新审视了CFG。研究者发现,无条件得分函数负责估计相邻时间步流形之间的过渡,这可能无意中干扰了朝向特定条件的轨迹。通过奇异值分解过滤条件得分和无条件得分的向量,TCFG能够使采样轨迹更贴近条件流形。
2.3 架构演进:从U-Net到Transformer
扩散模型的骨干网络架构也在快速演进。早期扩散模型普遍采用U-Net架构,其编码器-解码器结构配合跳跃连接,天然适合去噪任务。U-Net中的残差块和注意力机制使模型能够在不同尺度上捕获特征,自注意力捕捉长程依赖,交叉注意力整合条件信息。
然而,U-Net在捕获长程空间依赖方面存在局限。随着Transformer在视觉领域的成功,扩散模型也开始拥抱Transformer架构。DiT(Diffusion Transformer)将U-Net替换为纯Transformer架构,在文本到图像生成中展现了更好的可扩展性。
2024年以来,rectified flow transformers也成为了高分辨率文本到图像生成的有力选择。竞争焦点从单纯的生成质量转向了高速采样和大规模学习的可预测性。这一趋势表明,扩散模型的技术演进远未结束。
三、超越生成:扩散模型的泛化能力与应用边界
3.1 图像编辑与反演
扩散模型的确定性采样特性(DDIM的 σt=0σt=0 设定)为图像编辑开辟了独特路径。在GANs时代,图像编辑依赖于GAN反演:将真实图像映射回潜在空间,在潜在空间中修改属性,再生成新图像。然而,GAN反演面临着保真度与可编辑性之间的根本性权衡。基于优化的方法重建质量高但速度极慢,基于编码器的方法速度快但细节损失严重。
扩散模型的反演则更为直接:通过DDIM的确定性轨迹,可以在噪声空间与图像空间之间建立双射映射。给定真实图像,可以计算出唯一对应的噪声向量;修改噪声向量或去噪轨迹中的条件信号,就能实现精确的图像编辑。
这一能力使得扩散模型在可控生成方面具有天然优势。ControlNet等工作的出现进一步强化了空间条件控制:边缘图、深度图、分割图、人体姿态等都可以作为条件来引导生成过程。这种灵活的条件机制使得扩散模型不仅是一个生成工具,更成为了一个通用的图像操作引擎。
3.2 离散数据的扩散:基因组、分子与更多
扩散模型的影响力远不止于图像。2025年ICLR的一项研究展示了离散扩散模型在基因组序列、小分子设计和离散化图像生成中的可控生成能力。研究者推导了离散扩散的classifier-free和classifier-based guidance机制,并引入了一类利用均匀噪声的扩散模型,这类模型因为可以连续编辑输出而更具可引导性。
这一扩展表明,扩散模型的“加噪-去噪”范式具有超出连续图像数据的普适性。在分子设计、蛋白质序列生成、代码生成等离散领域,扩散模型正在开辟新的可能性。
3.3 扩散模型与GANs的互补而非替代
尽管“Diffusion Models Beat GANs”的标题具有宣示性,但实际的技术图景远比简单的替代关系复杂。在遥感图像分类的综述研究中,研究者发现两种范式各有优势场景。
GANs在推理效率上仍然具有压倒性优势。在需要实时处理的场景中,如无人机机载应用和快速灾害响应系统,GANs的单次前向传播特性使其难以被替代。在少样本学习场景中,GANs也展现了独特的适应能力。
扩散模型则在高保真表示和复杂场景中占据优势。其多步去噪过程能够捕获细微的光谱变化和精细的地物特征,在跨传感器任务中表现出更强的鲁棒性。在大规模无监督自监督学习中,扩散模型的掩码-重建训练策略能够更有效地挖掘潜在结构特征。
综述的结论颇具启发性:GANs和扩散模型展现出互补的特征,两者都面临着持续挑战。GANs受困于训练不稳定和模式崩溃,扩散模型则受限于高计算成本、慢推理速度和有限的空间关系建模能力。未来的方向可能不是一方取代另一方,而是混合架构:利用扩散模型的生成质量与GANs的推理效率相结合。
四、扩散模型的困境与挑战
4.1 计算成本的硬约束
扩散模型最显著的劣势在于推理速度。典型的扩散模型需要数十到数百步的去噪迭代,而GANs只需要一次前向传播。一篇综述指出,扩散模型的推理速度通常比GANs慢一个数量级。
这一成本在高分辨率生成中尤为突出。虽然潜在扩散模型通过将计算转移到低维潜在空间来缓解这一问题,但VAE的编码和解码本身也需要计算开销。在需要实时生成的应用场景中,扩散模型的这一劣势可能成为决定性的障碍。
研究者提出了多种加速策略。DDIM通过非马尔可夫采样将步骤从1000减少到50。渐进式蒸馏(progressive distillation)试图训练一个学生模型来模拟教师模型的多步去噪过程。一致性模型(consistency models)则直接学习从噪声到数据的映射,实现单步生成。然而,这些方法往往在速度与质量之间引入新的权衡。
4.2 空间关系建模的局限
U-Net架构虽然擅长捕获局部和中等范围的特征,但在建模远距离空间依赖方面存在不足。这在需要全局一致性的生成任务中可能成为瓶颈。例如,生成一幅包含多个相互关联物体的复杂场景时,U-Net可能难以确保所有物体之间的空间关系完全合理。
DiT等Transformer架构的引入部分缓解了这一问题,因为自注意力机制天然适合捕获长程依赖。然而,Transformer的计算复杂度随序列长度二次增长,在高分辨率生成中面临可扩展性挑战。
4.3 理论基础的隐忧
CFG虽然在实践中效果显著,但其理论基础并不完全稳固。2025年CVPR的研究严格证实,广泛使用的系数配置会导致生成分布的期望偏移,这意味着CFG下的去噪过程不能严格表示为扩散过程。虽然ReCFG等方法试图修正这一问题,但它揭示了一个更深层的张力:实践中有效的技巧与理论上的优雅性之间可能存在鸿沟。
类似地,TCFG的研究表明,无条件得分函数可能“无意中干扰”条件轨迹。这些发现提示我们,扩散模型的条件生成机制虽然强大,但远未达到理论上的最优状态。
4.4 标准化数据集的局限
在应用层面,扩散模型和GANs一样面临着数据瓶颈。一篇综述指出,当前研究严重依赖有限数量的标准化数据集,这些数据集缺乏多样性和质量,阻碍了模型的泛化能力和实际适用性。在科学图像、医学影像、遥感等专业领域,高质量标注数据的稀缺是共同挑战。
五、范式之争的深层逻辑:为什么是扩散模型?
回顾生成式AI的发展轨迹,一个自然的问题是:为什么扩散模型能够在2021-2022年间迅速取代GANs成为主流?
最表层的解释是生成质量。Dhariwal和Nichol的论文提供了无可辩驳的FID证据。但技术史告诉我们,质量优势本身并不足以解释范式转移。GANs在2014-2020年间持续改进,为何没有遇到类似的“天花板”?
更深层的原因在于可扩展性。GANs的训练动态对大模型和大数据并不友好。判别器与生成器的博弈在规模扩大时变得更加不稳定,模式崩溃的风险也随之增加。扩散模型的训练目标——简单的去噪回归——天然适合大规模扩展。这解释了为什么Stable Diffusion能够利用数十亿图像-文本对进行训练,而同等规模的GANs训练在稳定性上几乎不可行。
第二个原因是可控性。扩散模型的条件生成机制(无论是classifier guidance还是CFG)提供了一种简洁而强大的方式,将外部信号注入生成过程。这种机制与Transformer的交叉注意力架构天然契合,使得文本条件、空间条件、类别条件都可以统一处理。GANs的条件生成则更为笨拙,通常需要针对特定条件类型设计专门的架构。
第三个原因,也许是最容易被忽视的,是开源生态的力量。Stable Diffusion的开源发布是一个分水岭事件。它不仅降低了技术门槛,更重要的是创建了一个围绕扩散模型的工具、插件、微调模型的生态系统。GANs时代虽然有StyleGAN等开源实现,但从未形成如此规模的社区驱动力。扩散模型的技术特性——稳定的训练、模块化的条件机制、可解释的采样过程——使得社区成员能够更容易地在其基础上进行创新。
结语:下一个顶流,还是新的基础设施?
回到标题的问题:扩散模型是GANs之后的下一个“顶流”吗?
答案取决于我们如何定义“顶流”。如果“顶流”意味着短暂的注意力焦点和快速的技术更替,那么扩散模型可能已经超越了这一阶段。它正在从“热门技术”转变为“基础设施”——一种被广泛采纳、持续演进、渗透到各个应用领域的底层能力。
但这并不意味着扩散模型是终点。rectified flow、一致性模型、以及混合GAN-扩散架构都在探索新的可能性。扩散模型的采样效率问题远未完全解决,其空间建模能力仍有提升空间,理论基础也需要进一步夯实。
更值得关注的是,扩散模型所代表的范式转变——从对抗博弈到渐进优化,从单步映射到迭代精炼——可能具有超越特定模型架构的意义。这种范式强调稳定性、可解释性和可控性,而这些品质正是生成式AI从实验室走向大规模产业应用所必需的。
GANs教会了我们对抗可以创造,扩散模型则告诉我们耐心可以塑造。下一个顶流会是什么?或许是某种我们尚未命名的东西,但它大概率会继承扩散模型留下的遗产:一个稳定、可控、可扩展的生成框架,以及一个由开源社区驱动的创新生态。