首页 > 教程攻略 > ai资讯 >OvisOCR2 - 阿里ATH-MaaS团队推出的端到端文档解析模型

OvisOCR2 - 阿里ATH-MaaS团队推出的端到端文档解析模型

来源:互联网 时间:2026-07-15 22:19:47

OvisOCR2是什么

先说说这个东西是什么。OvisOCR2 是阿里 ATH-MaaS 团队搞出来的一个端到端文档解析模型,背后是基于 Qwen3.5-0.8B 这个模型基座训练的,而且完全开源。它在 OmniDocBench v1.6 这个评测榜单上拿了 96.58 分,直接登顶第一。简单来说,就是它能高精度地识别各种复杂版式的文档,然后提取出结构化的信息。不管是多栏排版、表格还是公式,都能处理。学术研究、档案数字化、企业知识库建设这些场景,都适用。

OvisOCR2的主要功能

  • 端到端文档解析

    :直接把文档图像塞进去,它就给你输出结构化的文本,不需要搞什么多阶段流水线拼凑。
  • 复杂版式识别

    :多栏排版、图文混排、表格嵌套这些复杂布局,都能精准解析,没问题。
  • 高精度 OCR 提取

    :OmniDocBench v1.6 上 96.58 分,字符和段落的识别准确率,行业里是领先的。
  • 开源可部署

    :基于 Qwen3.5-0.8B 训练,模型权重和代码都已经开源到 HuggingFace 上了,拿来就能用。

OvisOCR2的技术原理

  • 视觉语言模型架构

    :以 Qwen3.5-0.8B 为底座,融合了视觉编码器和文本解码器,实现图像到结构化文本的端到端映射。
  • 大规模文档预训练

    :在海量扫描文档、PDF 渲染图上预训练,让模型学会文档版式和语义之间的关联。
  • 端到端优化

    :抛弃了传统的检测→识别→后处理这种多阶段流程,用单一模型联合优化,误差累积就少了。
  • 轻量高效

    :只有 0.8B 参数,却实现了 SOTA 性能,推理速度和部署成本都控制得很好。

如何使用OvisOCR2

  • 环境准备

    :克隆 HuggingFace 仓库,装上 Transformers、PyTorch 这些依赖库就行。
  • 加载模型

    :用 AutoModelForCausalLM 加载 OvisOCR2 的权重和对应的分词器。
  • 输入文档

    :把扫描件或者截图转成张量格式,传给模型做前向推理。
  • 获取结果

    :模型直接输出 Markdown 或者纯文本格式的结构化解析结果。
  • 微调部署

    :如果手头有自己领域的文档,还能继续微调,适配特定版式需求。

OvisOCR2的核心优势

  • 评测榜首

    :OmniDocBench v1.6 上 96.58 分,文档解析精度行业领先。
  • 极致轻量

    :基于 Qwen3.5-0.8B 训练,0.8B 参数就能实现 SOTA 性能,单卡就能流畅推理。
  • 完全开源

    :模型权重和代码都公开在 HuggingFace 上,没有商业授权限制,可以自由二次开发。
  • 端到端架构

    :摒弃了传统多阶段流水线,输入文档图像直接输出结构化文本,工程维护成本低了不少。
  • 复杂版式适配

    :原生支持多栏排版、图文混排、表格嵌套这些复杂场景,不需要额外规则后处理。

OvisOCR2的项目地址

  • HuggingFace模型库

    :https://huggingface.co/ATH-MaaS/OvisOCR2

OvisOCR2的同类竞品对比

维度OvisOCR2GOT-OCR2.0

参数规模

0.8B(Qwen3.5)约 0.5B

评测成绩

OmniDocBench v1.6 第一(96.58)多榜单领先

开源协议

完全开源开源可商用

架构特点

端到端视觉语言模型端到端通用 OCR

部署成本

极低,消费级 GPU 可跑极低

擅长场景

复杂版式文档结构化解析通用 OCR 与公式识别

OvisOCR2的应用场景

  • 学术文献数字化

    :批量解析扫描版 PDF 论文,自动提取正文、图表标题和参考文献结构,科研资料整理效率能提高不少。
  • 企业档案管理

    :把历史纸质档案扫描件转成可检索的结构化数据库,人工录入成本能降下来。
  • 金融票据处理

    :精准识别发片、合同里的关键字段和嵌套表格,支撑自动化财务审核流程。
  • 教育资料整理

    :解析教材、试卷的复杂多栏排版,生成结构化电子资源,在线检索和编辑都更方便。
  • RAG 知识库构建

    :为文档问答系统提供高质量结构化文本输入,提升检索增强生成的回答准确性。