大视觉语言模型
综述:大模型时代的哪个图表问答工具最强?(结尾附工具列表)
发布时间:2024年03月18日

LLM应用 数据可视化
图表,作为数据可视化的核心载体,一直是洞察发现和决策制定的关键。这几年,大模型的爆发式发展,让自动图表理解这件事儿有了质的飞跃。像LLMs这样的基础模型,不仅在NLP领域大杀四方,也开始在图表理解这块地上深耕细作。这篇综述,就是要把大模型框架下,图表理解领域的最新进展、面临的挑战以及未来的路该怎么走,掰开揉碎了讲清楚。
先说说几个核心判断。我们首先得明确,到底什么是图表理解,它的核心问题是什么,以及要深入这个领域,需要哪些基础构件。搞清楚了这些,再看具体的任务和数据集——包括事实问答、开放域问答、标题生成、图表到表格转换、事实核查等等,顺带说说评估标准和用的资源。之后,我们会深入建模策略,聊聊分类方法和生成方法两大流派,以及如何用工具给模型“开外设”。当然,各任务现在的顶尖水平(SOTA)和优化空间,也是重点。最后,专门聊聊挑战和未来,比如特定领域图表的理解困难、评估的不足、以及智能体场景下的局限。总而言之,希望这篇东西能给后续顺着大模型这条路推进图表理解的研究,提供一些有价值的指引。
图表类问答基础模块定义
在深入细节之前,先来建立一个共同的基础。一个自动图表问答系统,通常由这几个核心模块构成:视觉编码器、图表表格转换模块、OCR模块、文本编码器、文本解码器。它们各司其职,又彼此协作。
视觉编码器
图表表格转换模块
OCR模块
文本编码器
文本解码器
数据集测试任务类型
为了让大家对后续的内容有个清晰的认识,先统一一下几个关键任务的概念:
- :事实问题回答
FQA (Factoid Question Answering)
- :开放域问题回答
OQA (Open-domain Question Answering)
- :图表标题生成
CAP (Captioning)
- :图表到表格
C2T (Chart-to-Table)
- :事实检查
FC (Fact-checking)
- :事实错误修正
FEC (Factual Error Correction)
- :事实不一致检测
FID (Factual Inconsistency Detection)
图表问题回答
图表标题生成
图表到表格转换
图表事实检查
图表字幕事实错误修正
实现方案
具体怎么干?主要分两大类:分类方法和模型方法。
基于分类的方法
说到
基于模型的方案
工具增强
工具增强,说白了就是给模型请外援,用来补足它自身能力上的短板,比如视觉表示能力不够。在图表理解这个领域,外援主要干一件事:从图表里把关键信息提取出来,交给更牛的模型去处理。早期的外援是OCR系统,专门用来从图像里抽文字。最近的趋势是转向端到端的预训练视觉-语言模型,比如Donut和Pix2Struct,它们已经可以不依赖OCR了。
性能
从上面的表格能看出来,各任务和数据集上的顶尖水平基本都集中在预训练模型和LVLMs手上。这说明,用更大规模的视觉和语言模型,再配合预训练或者指令微调技术,确实能大幅提升图表理解模型的能力。
另外,那些需要生成长段文本的任务(比如图表字幕生成),显然比那些有标准答案的任务(比如图表问答)要难得多。这也是自然的,毕竟开放生成的难度远高于在既定范围内做选择。
使用生成式模型方法的模型
既然生成式方法是主流,那我们来看看具体有哪些代表性的工作。
非预训练模型
SciCap: Generating Captions for Scientific Figures.
Figure Captioning with Relation Maps for Reasoning.
Chart-to-Text: Generating Natural Language Descriptions for Charts by Adapting the Transformer Model.
预训练模型
Enhanced Chart Understanding via Visual Language Pre-training on Plot Table Pairs.
MatCha: Enhancing Visual Language Pretraining with Math Reasoning and Chart Derendering.
UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning.
Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding.
工具增强
DePlot: One-shot visual language reasoning by plot-to-table translation.
Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning.
Do LLMs Work on Charts? Designing Few-Shot Prompts for Chart Question Answering and Summarization.
DOMINO: A Dual-System for Multi-step Visual Language Reasoning.
StructChart: Perception, Structuring, Reasoning for Visual Chart Understanding.
大视觉语言模型
专为图表理解设计
ChartLlama: A Multimodal LLM for Chart Understanding and Generation.
MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning.
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning.
ChartInstruct: Instruction Tuning for Chart Comprehension and Reasoning.
ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning.
FigurA11y: AI Assistance for Writing Scientific Alt Text.
Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs.
通用模型
Visual Instruction Tuning.
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality.
mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration.
SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models.
Gemini: A Family of Highly Capable Multimodal Models.
GPT-4V.
Introducing the next generation of Claude (Claude 3).
文中引用的相关研究及其不断涌现的新成果,将持续更新于:https://github.com/khuangaf/Awesome-Chart-Understanding。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名