【文档智能】LACE:帮你自动生成文档布局的方法浅尝
前言
看懂这篇文章的核心,是理解它要解决的问题是什么。
往期文章里,我们聊了不少关于【文档智能】中布局识别——也就是“版式分析”的技术路径。简单来说,版式分析是教机器看懂一张文档图上,哪儿是标题、哪儿是正文、哪儿是图片。但这次的文章视角很有意思,它反过来思考:既然我们已经知道元素类型是什么,能不能通过已知类型,主动去生成一份文件的布局?

在正式介绍之前,还是先说几个关键概念。这对理解后面的内容很有帮助。
- :说白了,就是在图形设计(比如排版文档、网页)里,让一堆元素在视觉上排列得合情合理,同时又能满足设计者的各种约束条件。这个“约束”,就是设计师脑中的“想法”。
可控布局生成
- :这是评估生成模型质量的一个硬指标。它的核心逻辑是看生成出来的数据分布,跟真实的数据分布有多像。它不仅比较均值,还比较协方差矩阵,所以比简单算算相似度要精准得多。简单来说,FID分越低,就说明模型生成的布局越“像真的”。
FID评价指标
- :普通的Transformer模型不擅长处理时间序列,但扩散过程偏偏是时间依赖的——每一步都在“破坏”数据,然后再“修复”。所以,模型得通过时间嵌入,把时间信息当作一个输入特征打包进去。
布局生成扩散模型架构
背景
现有的扩散模型在处理布局属性时,要么把它们当离散的数值看(比如坐标就是固定的几个格子),要么当连续的变量看(比如坐标就是0到1之间的任意数)。这两种方式,对应的数据破坏机制也不同——一种是加类别噪声或高斯噪声,另一种是纯粹的连续扰动。
这就导致了两种完全不同的生成路径:
离散扩散像是从一张白纸开始,一个元素一个元素地往上加;而连续扩散更像是先随机撒一把元素,然后一股脑儿地把它们揉搓、拖动、排列成一个整齐的布局
然而,事情没那么简单。别看连续扩散模型在 FID 分数上把对手按在地上摩擦,但要论“对齐”和“最大交并比(MaxIoU)”这两个指标,尤其是在无条件生成的时候,它们反而经常不如老派的基于 Transformer 的模型。这就好比百米冲刺厉害,但铅球不一定行。
这两个指标为什么重要?因为可以在连续扩散模型里用作约束优化,说白了就是
让布局看起来更顺眼、更专业
连续扩散模型在“任务统一”这事上也有硬伤
为了把这些麻烦一锅端,学术界提出了一个统一的模型——
LACE
全局对齐损失
成对重叠损失
一、方法
1.1 连续扩散模型
连续扩散模型的核心,就是用一个正向过程和逆向过程的马尔可夫链来描述数据的生成。不过这里有个区别:传统的扩散模型通常处理图像这样的连续张量,而布局生成更像是处理一个集合,每个元素都有自己的位置和类别。所以,LACE 的模型设计需要把时间嵌入、类别嵌入和边界框嵌入一起喂给Transformer,然后输出预测的噪声和类别。
1.2 连续布局生成
这里的关键词是“连续”。传统方法会把布局元素的位置和尺寸锁定在有限的几个选项里,但 LACE 用连续的变量表示——比如中心坐标 (cx, cy) 和宽高比例 (w, h),每个值都限制在 0 到 1 之间。这意味着模型可以在一个更精细、更广阔的搜索空间里寻找最优的美学组合。
具体来说,一个布局由多个元素构成,每个元素包含两个核心信息:它的类别标签,以及它的边界框。连续变量表示法,就是为了让边界框的每一个细微调整都能被模型感知和优化。
至于条件生成任务,LACE 的做法也很聪明——用条件掩码作为数据增强手段。你可以掩码掉固定部分元素的标签或大小,或者干脆固定住所有属性,模型就只能根据剩下的信息去脑补。
1.3 重建和美学约束
为了让模型在每个时间步上都“猜对”原始数据的样子,作者引入了重建损失。总的损失由简化损失和重建损失组成。但这还不够,因为光重建得准不行,还得重建得好看。所以,他们在重建损失里加入了两种美学约束:
全局对齐约束
重叠约束
- :这是用来评估元素与元素之间是否“对得齐”的。一共定义了六种对齐方式:左对齐、水平中心对齐、右对齐、顶部对齐、垂直中心对齐、底部对齐。别小看这个,专业排版最讲究这个。
对齐约束
- :这更好理解,就是防止生成出来的元素互相叠在一起。实现方式是用均值成对交并比损失函数来量化重叠程度。
重叠约束
- :这里有一个微妙的问题。约束函数会在参数空间里引入大量局部最小值——想象一下,一个本身就乱糟糟的布局,如果你硬要求它“对齐”和“不重叠”,反而会阻碍模型正常学习。为了缓解这个问题,作者只会在时间步数较小的阶段才施加约束。也就是说,当布局已经接近成形、噪声很低的时候,再用对齐和重叠损失去做最后的微调。具体操作上,他们设定了一个常数 β 计划,当时间步足够小、损坏过程还没引入太多重叠时,权重才正式激活。
时间依赖的约束权重
二、实验
2.1 定量结果
从实验数据来看,LACE 在多个公开数据集上的表现确实亮眼。无论在无条件生成还是条件生成任务中,它在 FID 指标上都实现了显著的提升。但更关键的是,在之前连续扩散模型一直不太擅长的对齐和 MaxIoU 指标上,LACE 也补上了这块短板,追平甚至超越了部分早期的 Transformer 模型。可以说,美学约束的加入带来的提升是实打实的。
2.2 LACE 和 LayoutDM 在条件生成任务中的定性比较
定量数据之外,直观效果也更有说服力。相比 LayoutDM,LACE 生成的布局在元素排布上显得更加紧凑、规整,而且很少出现元素交错或“无主”的凌乱感。尤其是在给定部分框约束的情况下,LACE 模型更容易“猜”出设计师的意图,生成出视觉上更舒适的版面。
局限性及展望
不过话说回来,LACE 也并非完美无瑕。首先,它把布局元素
限制为矩形框
只能处理有限数量的元素
这些缺陷在复杂、多变的设计场景里,可能会成为应用的硬伤
未来的方向也很明确:能不能用任意形状来替代矩形框?这显然更贴近现实世界的图形设计场景,因为大多数时候,我们面对的可不是清一色的方块。
参考文献
- paper:TOWARDS ALIGNED LAYOUT GENERATION VIA DIFFUSION MODEL WITH AESTHETIC CONSTRAINTS,https://arxiv.org/pdf/2402.04754
- code:https://github.com/puar-playground/LACE
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名