腾讯SEED-Story:生成丰富、叙事连贯及风格一致图文故事的大模型
多模态故事生成这事儿,过去总有个绕不开的坎:故事能讲多长,图片能不能跟得上文字的变化?SEED-Story这个方案,算是给出了一套完整的解法。它由MLLM驱动,从用户提供的起始图片和文本出发,就能自动生成一个图文交织的长篇故事——而且整个模型、代码和数据都已经开源。生成出来的故事,不仅有丰富且连贯的叙事文本,图片在角色和风格上也保持高度一致,最长可以跨越25个多模态序列(训练时只用了最多10个序列,这泛化能力相当亮眼)。

三阶段训练,步步为营
SEED-Story的训练分三步走:
- 第一阶段,预训练一个基于SD-XL的去标记化器(detokenizer),让它学会接收预训练ViT的特征作为输入,重建出图片。
- 第二阶段,采样一个随机长度的交错图像-文本序列,通过两个目标——对下一个词的预测和图像特征回归——来训练MLLM。这里的图像特征来自目标图像的ViT特征和可学习查询的隐藏状态。
- 第三阶段,把MLLM回归得到的图像特征喂给去标记化器,微调SD-XL,专门增强生成图片中角色和风格的一致性。

上图左侧展示了多模态故事生成中预测下一个词时的注意力图可视化。有意思的是,重要的注意力集中在了整个序列的第一个词("0"词)、标点符号词、与BoI(图像开头)相邻的词以及与EoI(图像结尾)相邻的词上。右侧则对比了几种注意力机制:(a) 密集型注意力图,保留KV缓存中的所有词;(b) 窗口型注意力,通过滑动窗口逐出前面的词;(c) 注意力汇聚,基于窗口型注意力保留开头的词;(d) 多模态注意力汇聚——在窗口型基础上,同时保留文本词的开头、图像词以及图像词的结尾。正是这个设计,让模型能够有效泛化到生成比训练序列更长的序列。

StoryStream数据集:更贴近真实故事书
为了支撑训练,研究团队构建了
StoryStream

实验结果表明,SEED-Story在多模态故事生成方面确实走在了前面,尤其是在生成长篇故事和维持生成内容一致性、质量方面,优势明显。

上图是定量评估对比:MM-interlea ved与SEED-Story。其中(a)是FID得分直方图;(b, c, d)使用GPT-4V分别选择两个模型生成的首选结果,饼图显示了胜率,“平局”表示GPT-4V给出同等分数。

实际生成案例:叙事分支的灵活控制
一个生动的例子展示了SEED-Story的能力:从同一张初始图像出发,生成了两个不同的叙事分支。顶部分支引用“戴黄帽子的男人”开始文本,后续生成的图像里自然包含了该角色;底部分支开篇没有提及这个男人,结果整个故事走向完全排除他,和第一个分支分道扬镳。这种对文本线索的准确响应,正是多模态故事生成中最关键的能力。

SEED-Story多模态长篇故事生成结果示例(上图)。

另一个长篇故事生成结果展示。

在使用不同注意力机制生成长故事的可视化对比中可以看到,采用其他机制的模型在生成长序列时会逐渐崩溃,而SEED-Story采用的多模态注意力汇聚机制,始终如一地生成高质量的图像,这才是长故事生成能落地的关键。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名