多模态大语言模型综述
过去一年多,GPT-4V 这类多模态大语言模型(Multimodal Large Language Model,简称 MLLM)的发展速度确实令人瞩目。正因如此,我们特意对这篇综述做了全面升级,目的在于帮助大家更清晰地把握这一领域的当前进展与未来可能。
MLLM 是从近年来大语言模型(Large Language Model, LLM)框架下生长出来的。它一方面继承了 LLM 强大的泛化与推理能力,另一方面又着力将多模态信息的处理能力吸纳进来。与此前的多模态方法相比——不管是 CLIP 那种判别式路线,还是 OFA 这类生成式模型——新登场的 MLLM 展现出了两个极其鲜明的特征。一是
模型规模大
全新的训练范式

- 论文链接:https://arxiv.org/pdf/2306.13549.pdf
- 项目链接(每日更新最新论文):https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models
整篇综述从 MLLM 的基础形式出发,逐步展开到它的拓展延伸以及与之相关的研究课题。具体说来,大致涵盖三个方面:首先是 MLLM 的基础构成与相关概念,包括架构、训练策略、数据和评测;然后是 MLLM 的拓展延伸,比如对输入输出粒度、模态、语言和场景的支持;最后则是 MLLM 的几个相关研究课题,例如多模态幻觉、多模态上下文学习(M-ICL)、多模态思维链(M-CoT)以及 LLM 辅助的视觉推理(LA VR)。
架构
对于最常见的多模态输入-文本输出型 MLLM,它的架构通常包含三部分:
编码器
连接器
LLM
生成器
模态编码器先把原始信息(如图像)转成特征,然后连接器再把这些特征处理成 LLM 容易理解的形式,也就是视觉 Token。LLM 则扮演“大脑”的角色,综合这些信息进行理解和推理,最终生成回答。有趣的是,这三部分的参数量并不平均。拿 Qwen-VL[1] 来说,作为“大脑”的 LLM 参数量为 7.7B,大约占总量 80.2%;视觉编码器次之,1.9B,约占 19.7%;而连接器的参数量仅有 0.08B,几乎都可以忽略不计。
对视觉编码器而言,提高输入分辨率是最直接的性能增益方式。一种做法是直接拉升分辨率,这时候必须放开视觉编码器让它训练去适应更高的分辨率,典型如 Qwen-VL[1]。另一种做法则巧妙得多:把大分辨率图片切成若干子图,每一块再以低分辨率送进视觉编码器,实则间接实现了高分辨率输入的效果,Monkey[2] 就是这种思路的代表。
在预训练 LLM 的选择上,常见的有 LLaMA[3] 系列、Qwen[4] 系列和 InternLM[5] 系列。前者主要面向英文,后两者在中英双语上的表现更为均衡。性能方面,扩大 LLM 的参数量带来的增益相当显著。LLaVA-NeXT[6] 在 7B、13B、34B 规模的 LLM 上做过实验,发现随着 LLM 的规模增大,各个 benchmark 上的指标都在明显提升;更厉害的是,在 34B 模型上甚至涌现出了 zero-shot 的中文能力。当然,除了直接增大参数规模,最近大火的 MoE 架构提供了一条更高效的路径——通过稀疏计算,在不增加实际计算参数量的前提下提升总参数量。
相比编码器和 LLM,连接器的重要性似乎约等于不那么“重头”。MM1[7] 的实验就表明,连接器的类型还不如视觉 Token 的数量(决定 LLM 能用到多少视觉信息)以及图片分辨率(决定视觉编码器能输入多少信息)重要。
数据与训练
MLLM 的训练过程大致分为三个阶段:
预训练
指令微调
对齐微调
早期工作在第一阶段大多依赖粗粒度的图文对数据,比如 LAION-5B。这类数据从互联网上扒下来,规模确实够大(动辄数十亿),但噪声多、文本短,容易影响对齐效果。后续的工作开始探索使用更干净、文本内容更丰富的数据来做对齐。例如 ShareGPT4V[8],直接拿 GPT-4V 生成的详细描述进行细粒度对齐,效果明显更好。但问题在于,GPT-4V 是收费的,因此这种高质量数据的规模通常不大(只有数百万量级)。数据规模一受限,里面包含的世界知识自然也就有限——比如它不一定能识别出画面中的建筑是广州塔。而这类世界知识,往往还要靠那些规模庞大但略粗糙的粗粒度图文对来提供。
第二阶段的微调数据来源不少:既可以是 VQA、OCR 等任务数据,也可以是 GPT-4V 生成的数据(比如问答对)。后者虽然能生成更复杂、更多样化的指令,但成本也随之大幅上升。值得一提的是,这一阶段通常还会混入一部分纯文本对话数据,它们充当了正则化措施的角色,帮助模型保留 LLM 原有的能力和内嵌知识。
第三阶段的数据主要是针对回答的偏好数据。这类数据通常依赖人工标注,成本不菲。不过近期也已经出现了一些自动化的方法,比如 Silkie[9],通过调用 GPT-4V 来收集偏好排序数据。
其他技术方向
除了提升模型的基础能力(比如支持什么形式的输入/输出、性能指标有没有提高),其实还有很多有趣的问题和尚未开拓的方向值得关注。这篇综述重点介绍了多模态幻觉、多模态上下文学习(M-ICL)、多模态思维链(M-CoT)以及 LLM 辅助的视觉推理(LA VR)。
多模态幻觉
多模态上下文学习
多模态思维链
LLM 辅助的视觉推理
挑战和未来方向
基于当前研究现状,我们将挑战与可能的未来方向总结如下:
- 现有 MLLM 在处理多模态长上下文时,能力还远远不够。这一点在长视频理解、图文交错内容理解(比如长文档里既有图像又有文本)等任务上表现得尤为突出。以 Gemini 1.5 Pro 为代表的 MLLM 已经在长视频理解领域掀起了热潮,但多模态图文交错阅读理解目前仍然相对空白,很可能成为下一波研究热点。
- MLLM 在服从复杂指令上的能力还有明显短板。GPT-4V 能够理解复杂的指令并生成包含推理信息的问答对,但其他模型在同领域的表现则逊色不少,提升空间依然很大。
- 多模态上下文学习和思维链的研究仍然停留在初步阶段,相关能力也普遍较弱。底层机制和具体能力提升方面的研究都亟待突破。
- 开发基于 MLLM 的智能体是一个非常热门的方向。但要实现这类应用,模型的感知、推理和规划能力必须全面上一个台阶。
- 安全问题同样需要高度警惕。MLLM 容易受到恶意攻击,进而生成有偏甚至不良的回答。这方面的研究仍有大片空白。
- 目前训练 MLLM 时,LLM 通常都会被解冻参与训练。虽然训练过程中也会加入部分单模态文本数据,但多模态和单模态数据放在一起大规模训练,到底对彼此是增益还是损害,目前仍然缺乏系统深入的研究。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名