首页 > 教程攻略 > ai资讯 >告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

来源:互联网 时间:2026-07-23 14:05:43

传统文档解析的效率瓶颈,说白了就是“串行等待”——明明正文、公式、表格之间互不依赖,却非得按顺序一个字一个字地生成。这种流水线式的模式,显然不是最优解。更高效的方式,其实就像团队协作:先整体规划布局,再让不同成员并行处理各自的任务,最后汇总结果。

基于这个思路,PaddleOCR 团队提出了

HPD-Parsing(层级并行文档解析)

技术。它的核心机制是:主线布局分支负责统一理解页面结构,动态将不同区域分发到多个内容分支进行并行解析,同时结合渐进式多 token 预测,进一步减少各分支解码步骤,实现多层级高度并行。

告别逐字等待:PaddleOCR推出高吞吐层级并行文档解析技术 HPD-Parsing

结果很直观:HPD-Parsing 将1B参数的基线模型 Token 吞吐量拉升到3倍以上。在单卡 NVIDIA A800 GPU 上,OmniDocBench v1.6 评测集的 TPS(每秒 Token 生成量)达到 4,752.1,页吞吐(PPS)为 2.68,解析精度依然保持行业第一梯队,而效率则遥遥领先。

代码和权重已经开源在 GitHub 和 HuggingFace,可以直接下载使用。

GitHub:https://github.com/PaddlePaddle/PaddleOCR
HuggingFace:https://huggingface.co/PaddlePaddle/HPD-Parsing
ArXiv 论文地址:https://arxiv.org/abs/2607.18839

效果速览

1、层级并行解析机制


HPD-Parsing 将传统单一解码序列重构为层级并行生成过程,主布局分支先识别区域类别、位置和阅读顺序,再动态创建内容分支并行生成具体内容。

2、大幅拉升基线吞吐,解析效率新 SOTA


OmniDocBench v1.6 评测集 512 并发测试:传统自回归基线 Token 吞吐 1,554.8,页吞吐 1.02;引入 HPD 后,分别提升至 4,752.1 和 2.68,领跑一众模型。

3、解析效率优势随文档长度显著提升


按输出序列长度等间隔划分测试集,结果显示:随着文档变长,HPD-Parsing 相对自回归模型的优势持续扩大——解码步数最高压缩 18.04 倍,批量请求吞吐最高提升 3.67 倍,单并发推理时延最高下降 5.8 倍。

这并非固定比例提升,而是从解码机制上缓解了“文档越长、等待越久”的结构性瓶颈。页面越复杂,可并行解析的区域越多,效率优势越明显。

4、解析精度保持行业第一梯队


扫描场景下,OmniDocBench v1.6 指标达 94.91%,文本识别、公式、表格和阅读顺序等关键能力均保持有竞争力表现。

是什么在拖垮解析效率:真正的瓶颈不在“看”,而在“写”

对一个经典 1B 参数规模的统一式自回归模型,统计视觉编码器和语言解码器的耗时发现:视觉编码时间相对稳定,而解码耗时随输出长度快速增长。尤其在长文档场景中,解码时间可接近视觉编码时间的 500 倍。

这意味着,模型主要不是慢在“看完整张图片”,而是慢在“逐 token 写出结果”。更直观地说:文档模型已经可以快速看完整页,但仍然被迫一个字一个字地“抄写”。

仔细想想:页面结构确实需要全局理解——比如标题层级、多栏布局、区域位置和阅读顺序。但某个文本段落、公式或表格的具体内容解析,往往只依赖对应区域图像和必要的上下文,并不需要等待其他区域全部生成完毕。

因此,文档需要整体理解,却不需要整体串行生成。

HPD-Parsing:让文档解析像团队抄书一样高效协作

第一层并行:全局布局协调,局部并行解析

HPD-Parsing 将传统单一解码序列重构为层级并行的生成过程。主布局分支负责识别页面中的区域类别、位置与阅读顺序;当一个区域的边界和类型确定后,模型便动态创建相应的内容分支,并行生成该区域的正文、公式或表格内容。

不同于传统 Pipeline 通过多个独立模块分阶段完成版面分析与内容解析,HPD-Parsing 将区域级并行直接融入统一模型的解码过程。各内容分支共享整页视觉上下文,主布局分支持续维护区域关系与阅读顺序,并依据全局布局结构组织最终输出。模型无需割裂页面上下文,即可将不同区域的内容生成转化为并发执行。

换句话说,HPD-Parsing 并非先将页面拆分为彼此独立的局部任务,而是在全局统一协调下并行生成不同区域的内容。

并且,分工不等于重复工作!

HPD-Parsing 采用了共享前缀 KV Cache 复用机制:新分支可直接复用已计算的视觉信息和布局前缀,无需重新编码整页图像,也无需重复执行完整的 Prefill 过程。

第二层并行:每个分支一次预测多个 token

基于布局理解的动态分支解码,使不同文档区域可以并行生成,但每个分支内部仍保留逐 token 解码带来的串行路径。为进一步减少主布局分支和各个内容分支的解码步数,HPD-Parsing 进一步集成了 PaddleOCR 团队在 ECCV 2026 中提出的

P-MTP(渐进式多 Token 预测)

技术。

P-MTP 能够在一次解码迭代中预测并验证多个后续 token,并将验证通过的 token 直接纳入输出。HPD-Parsing 平均每个解码步骤可接收

6.6 个 token

,使布局分支与内容分支能够以更少的解码步数完成生成,不再只能逐步向前推进。

P-MTP 的模型结构、渐进式训练方式与推理验证机制,可参见此前的专题介绍。

两级并行,同时缩短区域间等待与区域内解码

由此,HPD-Parsing 形成了两个相互补充的并行维度:

  • 分支间并行:

    不同文档区域同时解码;
  • 分支内并行:

    每条分支一次推进多个 token。

前者减少区域之间的相互等待,后者减少单个区域内部的解码步数。二者协同作用,使整页内容不再沿着一条冗长的序列逐步生成,而是能够在不同区域之间并行展开,并在每个区域内部更快向前推进,从区域间和区域内两个层面共同缩短整体解析过程。

让模型分阶段快速适配 HPD 机制:少量数据实现解码范式迁移

HPD-Parsing 构建了一套标准化的数据生产引擎。该引擎首先对原始文档进行特征提取、聚类与代表性采样,以扩大数据覆盖范围并减少重复样本;随后结合 PaddleOCR-VL-1.5、MinerU-2.5 Pro 等模型生成伪标签,并依据中间阶段模型与伪标签之间的解析差异,将样本划分为简单、中等和困难三个等级。对于困难样本,引入更强的视觉语言模型进行多轮检查、生成与纠正;最后从难度等级、文档类型以及文本、表格、公式和复杂版式等属性维度进行分布平衡,形成兼具多样性、可靠性和针对性的训练数据。

基于这一数据引擎,进一步构建了三阶段训练数据,用于支撑分阶段的 HPD 机制适配,使模型从传统全页生成逐步过渡到层级并行解码:

第一阶段:

模型首先基于 280 万条全页样本进行训练,

建立通用文档解析能力

,并同步初始化 P-MTP 的多 token 预测能力。

第二阶段:

在已有解析能力的基础上,

使用十万级别难度分布均衡的分支训练样本,完成解码范式迁移

第三阶段:

进一步选取百级别代表性难例,通过强化训练进行

针对性优化

HPD-Parsing 通过三阶段训练逐步完成能力初始化、解码范式迁移与难例强化,并配合自动化难度感知数据构建,持续发现和补强模型的薄弱环节。布局与内容监督的分解,使不同解析能力可以得到更有针对性的优化,而统一模型框架仍保留了对整页上下文和页面结构的整体建模能力。

结语

HPD-Parsing 将文档解析机制从“一条序列从头写到尾”,转变为“全局协调、局部并行”的模式,在有限的适配数据下,做到了精度可靠的同时摆脱了完整页面串行生成的约束。值得说明的是,这种解析机制的革新,与视觉 Token 压缩、注意力交互长度压缩等加速手段并不冲突,而是可以相互协同,实现更强的推理效率。

当然,它的意义不只在于一个更高的 TPS 数字,更在于提供了一种新的解码方式:页面结构需要全局协调,区域内容则可以局部并行。未来,这种结构化并行的思路有望进一步扩展到其他具有明确层级结构的生成任务中。

FAQ

Q: HPD-Parsing 和 PaddleOCR-VL 系列有什么关系?

A: HPD-Parsing 是 PaddleOCR 团队面向文档解析推理加速提出的最新技术研究成果,建议应用场景聚焦在扫描文档场景且对于推理效率存在强需求的用户可以部署体验。对于解析效果存在强需求的用户,我们仍然建议使用 PaddleOCR-VL 系列作为第一选择。