首页 > 教程攻略 > ai资讯 >登顶GitHub Trending,开源工具MinerU助力复杂PDF高效解析提取

登顶GitHub Trending,开源工具MinerU助力复杂PDF高效解析提取

来源:互联网 时间:2026-08-22 14:07:13

先说个关键信息:在7月4日的WAIC 2024科学前沿主论坛上,书生·浦语2.5正式发布,随之一起升级的还有面向大模型研发与应用的全链条工具体系。其中,上海人工智能实验室(上海AI实验室)大模型数据基座OpenDataLab团队开源了一款全新的智能数据提取工具——

MinerU

登顶GitHub Trending,开源工具MinerU助力复杂PDF高效解析提取

这款工具厉害在哪儿?简单说,它能把那些混合了图片、公式、表格、脚注等复杂元素的PDF文档,精准地转成清晰易读的Markdown格式。不止于此,它还能从充满广告干扰或格式复杂的网页、电子书中,快速抽取核心内容。这样一来,AI语料的准备效率能大幅提升,尤其适合那些需要利用大模型、RAG技术,结合学术文献、财务报告、法律文件、电子书籍等专业文档,来打造垂直领域知识引擎的团队。

MinerU代码公开后,凭借精准快速的SOTA效果,性能甚至媲美甚至超越了一些商业软件,不仅收获国内外多个技术大V点赞,GitHub Star更是飙升至3000+,一度登顶GitHub Python Trending(2024年7月28日-29日)。可以说,它已经成为AI数据清洗领域一个相当亮眼的开源工具。

一、MinerU功能介绍

MinerU的核心能力是把PDF转化为Markdown格式,既支持本地文档,也支持存储在S3协议对象存储上的文件。来看看它具体能做些什么:

  • 支持多种前端模型输入
  • 自动删除页眉、页脚、脚注、页码等冗余元素
  • 输出符合人类阅读顺序的排版格式
  • 保留原文档的结构和格式,包括标题、段落、列表等
  • 提取图像和表格,并在Markdown中展示
  • 将公式转换为LaTex格式
  • 智能识别并转换乱码PDF
  • 支持CPU和GPU环境,覆盖Windows/Linux/Mac平台

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3567579943246397447"></iframe>

(MinerU功能完整介绍视频)

二、PDF提取流程及技术架构

相比网页、电子书这些结构相对标准化的文件,PDF文档包含的元素更复杂,处理起来挑战更大,也更具代表性。下面就以PDF为例,重点讲讲MinerU是如何实现高质量文档数据提取的。

(流程图)

MinerU的PDF文档提取流程,主要由四大环节构成:

● PDF文档分类预处理

MinerU支持不同类型的PDF文档提取,包括文本型、图层型、扫描版。一开始,系统会对输入的PDF进行文档分类,提取元数据,检测是否有乱码,是否是扫描版——这一步,相当于先给PDF文档做个“体检”,确定它的类型和状态。(注:文本型PDF文字可直接复制;图层型PDF文字不可直接复制,解析可能出现乱码。)

● 模型解析,PDF内容提取

接下来,借助高质量的PDF模型解析工具链,系统会进行Layout区块布局检测,准确定位标题、正文、图片、表格、脚注、边注等重要元素的位置。同时,公式检测模型会锁定公式区域。最后,结合高质量的公式识别和OCR技术,提取出准确的文本和公式内容,统一存入JSON文件中。

● 管线处理,支持多种格式输出

模型处理完的数据会进入管线进行后处理,关键动作包括:确定块级别顺序、删减无用元素、按照版面进行内容排序和拼装,确保正文流畅。处理方式涵盖坐标修复、高iou处理、图片与表格描述合并、公式替换、图标转储、Layout排序、无用元素移除、复杂布局过滤等。经过这步,文档信息会被转化为一个统一的中间态——middle-json,它包含了PDF解析出来的所有信息。基于这个中间态,开发者可以根据需要自定义输出Layout、Span、Markdown、Content list等不同格式。(注:Content list是作者团队开发的一种列表结构格式,比Markdown保留的信息更丰富,适合用于多模态、NLP等大模型训练。)

● PDF提取结果质检

团队利用由论文、教材、试卷、研报等多种文档组成的人工标注PDF自测评测集,对整个流程进行检测。这样一来,每次开发调优或算法改进后都能确保提取效果持续提升。同时,他们还配合可视化质检工具,对提取结果进行人工质检与标注,再反馈给模型训练,形成正向循环。

详细项目全景图如下:

三、高质量PDF模型解析工具链

MinerU的PDF模型解析工具链 PDF-Extract-Kit,由四个关键模块组成:

● 布局检测

:使用 LayoutLMv3 微调出的检测模型,进行图像、表格、标题、文本等区域的定位。

● 公式检测

:使用基于 YOLOv8 自研的公式检测模型,能同时检测行内公式和行间公式。

● 公式识别

:使用自研的 UniMERNet 公式识别模型进行识别。

● 光学字符识别

:使用 PaddleOCR 模型进行文本识别。

在论文、教材、研报、财报等多样化的PDF文档上,MinerU的pipeline都能给出准确的提取结果,即使面对扫描模糊、水印等情况,也表现出较高的鲁棒性。

(不同类型PDF提取效果示意)

四、评测指标

以下从几个核心维度来看MinerU的表现。

● 布局检测

作者团队将MinerU与现有的开源Layout检测模型进行了对比,包括 DocXchainSurya360LayoutAnalysis 的两个模型。其中的 LayoutLMv3-SFT 是在 LayoutLMv3-base-chinese 预训练权重基础上进一步做了SFT训练的模型。论文验证集由402张论文页面构成,教材验证集由587张不同来源的教材页面构成。

● 公式检测

作者团队将MinerU与开源的 Pix2Text-MFD 模型做了对比。其中的 YOLOv8-Trained 是在 YOLOv8l 模型基础上训练后的权重。论文验证集由255张论文页面构成,多源验证集由789张不同来源的页面构成,包括教材、书籍等。

● 公式识别

这一块作者团队直接使用了 UniMERNet 的权重,没有进一步做SFT训练,其精度验证结果可在其GitHub页面获取。

● 光学字符识别

使用了PaddleOCR官方提供的权重,没有做进一步的训练和验证。

评测结果显示,MinerU在布局检测、公式检测、公式识别多个维度上,性能都远超其他开源模型,识别准确率相当出色。

五、MinerU部署及使用

MinerU的能力已经集成在新一代大语言模型书生·浦语2.5(InternLM2.5)中,

可以与AI进行文档格式转化及内容问答交互。