首页 > 教程攻略 > ai资讯 >Stable Diffusion 3架构解析

Stable Diffusion 3架构解析

来源:互联网 时间:2026-08-06 15:32:22

一、扩散模型的正向和反向过程

假设我们有一幅完整的图像,可以把它想象成一幅清晰的风景画。在扩散模型的正向过程(也就是添加噪声的阶段)中,我们就像在画布上一点点地喷洒墨水。每一次喷洒的量都很少,但随着步骤的累积,这幅画逐渐被墨点覆盖,画面变得模糊不清,到最后,只剩下混沌一片的墨斑。

那反向过程呢?它就好比我们拥有一个能逆转喷洒墨水的魔法工具。通过它,我们可以一步步地移除画布上的墨点,把原作一点一点地“捞”回来。模型的训练,本质上就是教会这个工具如何在混沌中还原出清晰的画面。

理解了这一点就好办了。当模型学会了这套“去噪”本领后,我们只需要给它一整片随机的噪声斑点,它就能凭借训练中积累的经验,逐步把这些噪声修复成一张完整的图像。

Stable Diffusion 3架构解析

二、Stable Diffusion 与 DiT

先说Stable Diffusion 2吧。它的基础是潜在扩散模型,这是在潜在空间里完成扩散过程的。它用的是U-Net架构来做编码和解码,把图像压进潜在空间后再处理。

U-Net最早是Olaf Ronneberger在2015年提出的,初衷是解决生物医学图像分割的问题。它的名字很形象,因为架构看起来就像一个字母“U”。主要由两部分组成:

  1. 编码器(下采样路径)

    :逐步降低输入图像的空间分辨率,同时提取特征。通常由多个卷积层和池化层构成,一步步减小特征图尺寸、增加特征数量。

  2. 解码器(上采样路径)

    :反着来,逐步恢复分辨率。用反卷积层把特征图放大,同时把编码器那边的特征拼接过来,提升生成质量。

U-Net有个关键设计:编码器和解码器之间的跳跃连接。相当于给解码器修了一条“高速通道”,直接把编码器里的空间信息传过去,生成结果自然更精细。这个架构后来在扩散模型里也火了,成了生成高质量图像的好帮手。

到了Stable Diffusion 3,架构换成了Diffusion Transformer(DiT),不用U-Net了。这是一个新的思路,用一个处理图像小片段的系统取代了传统的图像构建模块。同时,它还融合了流匹配技术。DiT本质上就是把扩散模型和Transformer架构捏在了一起。

Stability AI最新发布的这个Stable Diffusion 3,在多主题提示处理、图像质量和拼写能力上都表现得很抢眼。目前还处于早期预览阶段,如果感兴趣想参与改进,已经开放了等待名单。

三、Stable Diffusion 3的亮点

Stable Diffusion 3把Diffusion Transformer结构和Flow Matching结合起来了。来看看这意味着什么。

  • 性能与质量的双重提升


    它的模型范围从8亿参数一直覆盖到80亿参数,这个跨度能适配不同场景的需求。核心是采用了DiT架构加上Flow Matching技术,使得模型能根据文本提示生成高质量的图像。Flow Matching是一种训练生成模型的新方法,它的特别之处在于设计了一种更快速、更高效的训练方式,生成的数据质量也很能打。

  • 安全与责任被摆在了前面


    开发团队在培训、评估、部署每个环节都嵌入了安全措施,目的就是预防潜在的滥用风险。研究员、专家和社区正在一起推动负责任的AI创新,把安全性和道德性放在重要位置。另一个让人兴奋的点是它的8亿参数版本,这会让图像合成AI变得更易用,方向上和谷歌的Gemma 2b、微软的Phi-2语言模型是一致的。

四、Diffusion Transformer结构技术概览

DiT的结构,其实是把扩散模型的能力和Transformer的可扩展性、灵活性捏在了一起。扩散模型靠迭代去噪,在生成任务上已经证明了自己的实力;Transformer呢,擅长捕捉数据里的长程依赖关系,在NLP和CV领域都拿过好成绩。两者结合,自然能生成更强大、更高效的模型,去捕捉那些复杂的数据分布。

DiT的架构基础是一串标准Transformer层,和Vision Transformer或者NLP里的Transformer层类似。但它在每一层里都融入了扩散过程——说白了,就是把扩散机制塞进了自注意力机制里。通常还会加上一个条件机制,用来做类别条件图像生成。这个条件机制实现方式多样,比如在输入序列里加上类别标记,或者让注意力机制依赖类别信息。

处理图像时,DiT也用分块的办法,跟ViT一样——每个图像块被展平成序列,然后由Transformer层处理。它经常用自适应层归一化(adaLN)来提升训练稳定性和表现,adaLN会根据输入数据调整归一化参数,让模型能适应不同的输入分布特点。

举个例子,DiT-XL/2-G模型在FID-50K指标上表现很好,同时计算量相对较低,这意味着它在生成高质量图像的同时,效率也很高。

训练过程

DiTs通常用标准的生成模型训练方法,比如最大似然估计或变分推断。输入训练数据,迭代更新模型参数,最小化合适的损失函数。训练过程中可能还会用到一些额外技术,比如模型权重的指数移动平均、数据增强、正则化,都是为了提升性能和稳定性。

DiT的一个关键优势在于它的可伸缩性。借助Transformer架构的扩展能力,它能轻松处理大规模的生成任务,包括高分辨率图像生成。在基准数据集上,DiT交出的成绩单很亮眼——FID、Inception得分、精确度/召回率这些指标,经常能刷出领先结果。

下面这张图展示了DiT模型的整体架构,以及两种不同的DiT块设计:一种是带自适应层归一化的,另一种是带交叉注意力的。

左侧:DiT模型架构

  • 输入的潜在变量被切成多个patch,然后送进DiT块处理。
  • 模型能处理带噪声的潜在变量,经过线性变换和形状调整后做层归一化,再进入多个DiT块。
  • 输入里还包含时间步长和标签,用来表示扩散过程的当前状态和条件信息。

中间:带有自适应层归一化的DiT块

  • 这个块主要由两个子块构成,每个都包括多头自注意力、点对点前馈网络和自适应层归一化。
  • 自适应层归一化通过缩放和偏移参数来调整数据分布,参数由MLP从条件信息中算出。
  • 多头自注意力和前馈网络分别处理输入特征,经过归一化和缩放调整后再结合。

右侧:带有交叉注意力的DiT块

  • 这个块在自注意力之外,又引入了交叉注意力机制,用来处理输入数据和条件信息之间的交互。
  • 先对输入特征做多头自注意力,再对条件信息做交叉注意力。
  • 通过在序列维度上拼接输入特征和条件信息,模型能更好地利用条件信息去生成。

DiT模型利用Transformer架构的优势,在扩散模型里生成高质量图像。这两种DiT块的设计,分别通过自适应层归一化和交叉注意力来高效利用条件信息,让模型在扩散过程中生成更符合要求的图像。

下面这张图展示了不同Transformer模型规模和patch大小对生成图像质量的影响。以生成的狗的图像为例,可以很直观地看到差异。

  • 横轴(Increasing transformer size)

    :从左到右,模型规模逐渐增大,意味着参数量增加,模型能力更强。
  • 纵轴(Decreasing patch size)

    :从上到下,patch逐渐减小。更小的patch意味着图像被切得更细,模型能捕捉到更细节的特征。

结论

:随着Transformer规模增大,图像更清晰、细节更丰富;随着patch减小,图像细节也更丰富。最右下角(最大规模、最小patch)的效果最好,最左上角则最差。这说明,增大模型规模和减小patch大小,能显著提升生成质量。

Patch size是什么?

就是把输入图像分割成小块时,每个块的尺寸。在计算机视觉的Transformer模型(比如ViT和DiT)里,图像不会整体输入,而是被分成多个小块,每个块作为一个独立输入单元。这下就清楚了。

  1. 输入维度的调整

    :把图像分割成patches,相当于把二维图像转成一维序列,适配Transformer的输入需求。
  2. 细节和特征表示

    :更小的patch能捕捉更细微的特征;更大的patch会导致细节丢失,但输入块数量减少。
  3. 计算效率和性能

    :小patch能捕捉更多细节,但计算负担也重,需要在复杂度和性能之间找平衡。

在图像生成任务里,选择合适的patch size能让模型更好地捕捉特征,提升生成效果。

五、Flow Matching

Flow Matching是一种训练连续归一化流(CNF)的新框架,目标就是克服传统训练方法的一些局限。它引入了一种无需模拟的方法论,利用条件结构高效地扩展到高维数据集,同时还能提升采样和生成能力。

传统的CNF训练方法,计算成本高,尤其是处理高维数据时。Flow Matching提供了一条替代路径——无需模拟,简化训练过程,同时保持高质量的采样和生成性能。

  • 条件结构

    :FM依赖条件概率路径和向量场,来建模数据在潜在空间中的流动。通过基于相关变量的条件操作,能更有效地捕捉复杂数据分布。
  • 概率路径

    :FM不依赖扩散过程或随机模拟,而是直接指定概率路径,对数据生成过程有更精确的控制。
  • 向量场

    :FM利用向量场定义流动的动力学,指导数据从输入空间向潜在空间转换。这些向量场可以优化,以匹配期望的概率路径。

FM训练方法论

  • 无需模拟的方法

    :直接规定概率路径并优化向量场,省掉了高成本的模拟,训练过程更快速高效。
  • 基于梯度的优化

    :采用梯度优化技术迭代更新CNF模型参数,确保向期望的概率分布收敛。
  • 条件流匹配目标

    :定义了一个新目标函数——条件流匹配(CFM)目标,支持无偏梯度估计和高效训练。

FM已经在不同分辨率的数据集(如CIFAR-10、ImageNet)上证明了有效性。它在负对数似然(NLL)、样本质量(FID)和训练效率(NFE)方面都达到了领先水平。和现有方法对比,FM在更快的收敛速度、更高的采样效率上,优势明显。

下面进一步拆解一下:

  1. 背景

    :生成模型让电脑学习生成新数据。比如看大量真实图片后,生成一张从未见过的新图。过去出现了很多新模型,比如扩散模型,通过加噪再反跑去噪。但这种方法通常训练时间长、计算资源大,生成图片也慢。
  2. CNF是什么

    :连续正则流是一种生成模型技术,通过学习一个时间相关的向量场,把一种概率分布转换成另一种。简单理解,就是一组数学操作,能把随机噪点变成高清图像,并且能根据任务自我调整。
  3. 什么是流匹配

    :一种训练CNF的新方法。让模型学习一个特殊的“流”,把随机噪点变成高质量图片。通过提供目标和优化损失,帮模型学会这个流的公式。和之前的方法比,不需要复杂的数值模拟,训练过程简化了。
  4. 条件流匹配

    :直接找那个复杂的向量场太难了,研究人员就提出了条件流匹配。通过引入条件概率路径和条件向量场,把大问题拆成小问题。每次模型只学一个小问题,再组合起来达到目标。
  5. 特例

    :论文提出了两种特例:
    • 扩散路径

      :从噪声到清晰图像的路径,常用于扩散模型,逐步减少噪声。
    • 最优传输路径

      :通过最优传输理论,设计一种直接从一种概率分布到另一种的路径,不需要中间很多步骤,用线性插值直接平滑连接。
  6. 实验结果

    • 样本质量

      :FM生成的图片质量优于主流扩散模型,在FID和NLL指标上表现更好。
    • 训练效率

      :训练过程中,FM比扩散模型更快,在不同分辨率的ImageNet数据集上测试,结果都显示耗时更短。
    • 生成效率

      :生成图片时,FM也比扩散模型快。相同迭代次数下,能更快产出高质量图片。
  7. 结论

    :这项研究为生成模型提供了一种新的训练方式,能让电脑用更直接、更快的方法学会生成图片。不仅能提高生成速度,还能产生更高质量的图片。未来还可以探索如何将这项技术应用于更多任务,比如文本和音频生成。

六、DiT和FM融合

Diffusion Transformer架构和Flow Matching的结合,是文本到图像生成领域里一条很有趣的技术路径。

DiT把Transformer强大的序列建模能力和扩散模型的高质量图像生成能力结合在一起。这种结合让模型能更有效地捕捉文本提示和对应图像之间的复杂关系,输出更连贯、更符合上下文的结果。语言和图像之间的关系太重要了——当模型能真正理解人类语言的含义,并把它融进生成过程时,我们就离更可控的图像生成系统又近了一步。

Flow Matching让模型能学习图像数据的底层分布,生成与之紧密匹配的样本。通过把生成的图像和目标分布对齐,Flow Matching确保了输出在视觉上既吸引人,又呈现真实特征。据Stability的研究人员透露,DiT与FM的整合显著提升了图像质量——更精细的细节、更锐利的纹理、更准确的文本提示表现。这种保真度的提升,不仅改善了用户体验,也拓宽了数字艺术、设计、娱乐等应用范围。

文本到图像生成还有个挑战:处理含有多个主题的提示。这也是为什么我们平时看到的AI生成图像,大多只呈现单个人物。DiT和FM的结合,让模型能更准确、更连贯地处理复杂的多主题提示。这意味着用户可以根据细致的文本描述,生成多样和复杂的图像,为创造性表达和故事讲述打开了新的可能性。

总的来说,DiT和FM的结合,代表了文本到图像生成方法学的一次重要进步。通过发挥两者的优势,这个创新框架提供了更强大的建模能力、更优质的图像生成效果,并且在优先考虑安全和伦理的前提下,能够高效地处理多主题提示。