OvisOCR2 - 阿里ATH-MaaS团队推出的端到端文档解析模型
来源:互联网
时间:2026-07-15 22:19:47
OvisOCR2是什么
先说说这个东西是什么。OvisOCR2 是阿里 ATH-MaaS 团队搞出来的一个端到端文档解析模型,背后是基于 Qwen3.5-0.8B 这个模型基座训练的,而且完全开源。它在 OmniDocBench v1.6 这个评测榜单上拿了 96.58 分,直接登顶第一。简单来说,就是它能高精度地识别各种复杂版式的文档,然后提取出结构化的信息。不管是多栏排版、表格还是公式,都能处理。学术研究、档案数字化、企业知识库建设这些场景,都适用。
OvisOCR2的主要功能
- :直接把文档图像塞进去,它就给你输出结构化的文本,不需要搞什么多阶段流水线拼凑。
端到端文档解析
- :多栏排版、图文混排、表格嵌套这些复杂布局,都能精准解析,没问题。
复杂版式识别
- :OmniDocBench v1.6 上 96.58 分,字符和段落的识别准确率,行业里是领先的。
高精度 OCR 提取
- :基于 Qwen3.5-0.8B 训练,模型权重和代码都已经开源到 HuggingFace 上了,拿来就能用。
开源可部署
OvisOCR2的技术原理
- :以 Qwen3.5-0.8B 为底座,融合了视觉编码器和文本解码器,实现图像到结构化文本的端到端映射。
视觉语言模型架构
- :在海量扫描文档、PDF 渲染图上预训练,让模型学会文档版式和语义之间的关联。
大规模文档预训练
- :抛弃了传统的检测→识别→后处理这种多阶段流程,用单一模型联合优化,误差累积就少了。
端到端优化
- :只有 0.8B 参数,却实现了 SOTA 性能,推理速度和部署成本都控制得很好。
轻量高效
如何使用OvisOCR2
- :克隆 HuggingFace 仓库,装上 Transformers、PyTorch 这些依赖库就行。
环境准备
- :用
加载模型
AutoModelForCausalLM加载 OvisOCR2 的权重和对应的分词器。 - :把扫描件或者截图转成张量格式,传给模型做前向推理。
输入文档
- :模型直接输出 Markdown 或者纯文本格式的结构化解析结果。
获取结果
- :如果手头有自己领域的文档,还能继续微调,适配特定版式需求。
微调部署
OvisOCR2的核心优势
- :OmniDocBench v1.6 上 96.58 分,文档解析精度行业领先。
评测榜首
- :基于 Qwen3.5-0.8B 训练,0.8B 参数就能实现 SOTA 性能,单卡就能流畅推理。
极致轻量
- :模型权重和代码都公开在 HuggingFace 上,没有商业授权限制,可以自由二次开发。
完全开源
- :摒弃了传统多阶段流水线,输入文档图像直接输出结构化文本,工程维护成本低了不少。
端到端架构
- :原生支持多栏排版、图文混排、表格嵌套这些复杂场景,不需要额外规则后处理。
复杂版式适配
OvisOCR2的项目地址
- :https://huggingface.co/ATH-MaaS/OvisOCR2
HuggingFace模型库
OvisOCR2的同类竞品对比
| 维度 | OvisOCR2 | GOT-OCR2.0 |
|---|---|---|
参数规模 | 0.8B(Qwen3.5) | 约 0.5B |
评测成绩 | OmniDocBench v1.6 第一(96.58) | 多榜单领先 |
开源协议 | 完全开源 | 开源可商用 |
架构特点 | 端到端视觉语言模型 | 端到端通用 OCR |
部署成本 | 极低,消费级 GPU 可跑 | 极低 |
擅长场景 | 复杂版式文档结构化解析 | 通用 OCR 与公式识别 |
OvisOCR2的应用场景
- :批量解析扫描版 PDF 论文,自动提取正文、图表标题和参考文献结构,科研资料整理效率能提高不少。
学术文献数字化
- :把历史纸质档案扫描件转成可检索的结构化数据库,人工录入成本能降下来。
企业档案管理
- :精准识别发片、合同里的关键字段和嵌套表格,支撑自动化财务审核流程。
金融票据处理
- :解析教材、试卷的复杂多栏排版,生成结构化电子资源,在线检索和编辑都更方便。
教育资料整理
- :为文档问答系统提供高质量结构化文本输入,提升检索增强生成的回答准确性。
RAG 知识库构建