首页 > 教程攻略 > ai资讯 >阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench

阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench

来源:互联网 时间:2026-07-25 14:55:30

7月24日,阿里巴巴正式开源了一款文档解析模型——OvisOCR2,参数规模仅0.8B,但表现相当炸裂。在权威的文档解析基准OmniDocBench v1.6评估中,它拿下了96.58的综合得分,直接登顶,成为首个全面超越传统流水线方法的端到端文档解析模型。这标志着文档智能技术领域迎来了一次真正的范式转折。

QQ20260724-140219.jpg

在RAG检索、智能问答和企业知识库这些核心场景里,文档解析一直是基础设施级别的存在。过去,业界普遍采用“版面分析+内容识别”的流水线串联模式,但这套方案维护成本高、误差还会逐级累积,部署起来也相当复杂。OvisOCR2基于Qwen3.5-0.8B进行后训练,彻底打破了这些限制——仅凭单模型一次生成,就能按自然阅读顺序输出包含文本、公式、表格和视觉区域的Markdown表示,省心多了。

技术实现上,模型采用了真实数据与合成数据互补的训练路径,再结合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)和模型融合这四大手段,把紧凑模型的潜力彻底释放了出来。

目前,OvisOCR2已经基于Apache2.0协议在Hugging Face和魔搭社区全面开源,兼容vLLM等主流推理框架,能无缝接入千问生态。小参数、高效率,这一波操作直接大幅降低了高精度文档解析的显存和算力门槛,推动文档智能从复杂的系统工程向更简洁、更高效的模型驱动演进。可以说,文档解析的玩法正在被重新定义。