首页 > 教程攻略 > ai资讯 >聊聊SORA背后技术之一(三):VAE

聊聊SORA背后技术之一(三):VAE

来源:互联网 时间:2026-08-01 13:44:24

技术总结专栏

聊聊SORA背后技术之一(三):VAE


SORA视频生成背后的一项关键技术——VAE(变分自编码器),今天就来彻底聊透它的原理。你肯定经常听到“潜层语义特征”这个词,没错,这就是靠着VAE才真正实现出来的。

变分自编码器是一种融合了自编码器与概率图模型思想的生成式模型。它通过学习数据的潜在分布,从而能够生成全新的数据样本。很多时候,模型之所以能理解“猫”和“狗”在语义上的区别,正是因为它把高维像素压缩到了低维的潜空间里,而这个压缩过程,VAE是核心。


核心思想

这部分更偏向数学推导,不感兴趣的小伙伴可以直接跳过~

分布变换

VAE的核心目标是构建一个从隐变量Z生成目标数据X的模型。更准确地说,它假设Z服从某个常见分布(比如正态分布或均匀分布),然后训练一个映射X=g(Z),把Z的分布变换为训练集的分布。换句话说,整个过程就是在做分布之间的学习和转换,只不过方式更巧妙。

VAE机制

在VAE中,假设后验分布p(Z|X)——也就是给定样本X时潜在变量Z的分布——是正态分布。具体来说,对于每个真实样本X_k,模型假设有一个专属的分布p(Z|X_k),并且这个分布是独立多元正态的。接着,通过编码器输出均值μ和方差σ²,就能确定这个样本专属的潜变量分布。


整体结构

上图为VAE的完整架构,主要分为编码器(Encoder)和解码器(Decoder)两大部分。

VAE Encoder

编码器包括DownBlock、MidBlock、GSC三个模块,核心作用是把输入图像压缩到低维潜空间,并在该空间中进行高斯分布采样。例如,输入一张3×512×512的图像,经过编码后会生成4×64×64的特征图。

VAE Decoder

解码器同样包含UpBlock、MidBlock、GSC三个模块,负责根据压缩后的潜层语义特征重构恢复出原始图像。它能将4×64×64的潜特征图还原回3×512×512的原始尺寸。

整体上

VAE之所以能先将图像压缩到极小的潜空间,再对其进行像素级重建,是因为尽管压缩与重建过程是有损的,但图像全图级的特征关联并非随机——它们有很强的规律性。比如人脸上的眼睛、鼻子、脸颊和嘴巴之间存在固定的空间关系,又比如猫有四条腿,这是确定的生物结构特征。当重建的图像尺寸达到512×512以上时,特征损失带来的影响已经非常微小。


总结

VAE的优势和短板都很明显,下面逐一来看。

优点:

  • 生成样本:

    VAE能生成与训练数据相似的新样本,这在图像生成、语音合成等生成式任务中非常实用。

  • 潜在空间表示:

    它学习到了数据的潜在分布,能把数据映射到低维连续的潜空间中,对数据表示和可视化大有帮助。

  • 自编码器结构:

    编码器负责压缩表示,解码器负责从潜空间重构数据,两者协同工作,结构清晰。

  • 概率建模:

    作为一个概率模型,VAE使用变分推断来估计潜变量的后验分布,使其能灵活处理不确定性和噪声。

缺点:

  • 模糊生成:

    由于优化的是数据下界(ELBO),VAE在高维空间生成样本时容易产生模糊的结果。

  • 后验推断:

    变分推断得到的近似后验与真实后验之间存在差距,这会直接影响生成样本的质量。

  • 训练难度:

    需要同时优化编码器、解码器以及估计潜变量后验,训练过程相对复杂,对调参和技巧要求较高。

  • 模型参数选择:

    潜空间维度、先验分布等超参数需要精心调节,增加了设计和调试的难度。