首页 > 教程攻略 > ai资讯 >百度最强视觉识别模型来了!仅0.9B,文档解析能力超越Gemini、GPT

百度最强视觉识别模型来了!仅0.9B,文档解析能力超越Gemini、GPT

来源:互联网 时间:2026-06-03 08:36:18

6月2日,百度放出了一个新东西:文心衍生的视觉识别模型PaddleOCR-VL-1.6。这事儿在圈子里引起了不少讨论,毕竟OCR这个赛道,各家都在暗暗较劲。

先说几个硬核结论。在权威的文档解析能力评测集OmniDocBench v1.6上,PaddleOCR-VL-1.6的总指标直接干到了96.33%。你猜怎么着?它直接超过了Gemini-3-Pro、GPT-5.2、MinerU-2.5-Pro、GLM-OCR这些大家耳熟能详的选手,综合性能拿了个第一。

这还不算完。在另一个面向真实复杂场景的Real5-OmniDocBench评测里,它的总指标也达到了93.19%,比Gemini-3-Pro提升了将近4个百分点。关键是,这个评测覆盖了扫描件、弯折文档、屏幕拍照、光照变化以及倾斜文档等五大真实场景,全都是日常工作中最让人头疼的情况,而它在这一堆"硬骨头"面前反而表现得相当稳健。

从实测数据来看,和市面上主流的开源、闭源识别模型放在一起对比,PaddleOCR-VL-1.6在常规文字、数学公式、表格这三个最基础的识别维度上,综合表现确实更胜一筹。

还有一个细节值得关注。在表格解析、繁体古籍、冷僻用字这些高难度场景下,这次的效果相比上一代有了肉眼可见的进步。印章甄别、文字定位、图表信息提取这类细分任务的性能也同步改善了,基本可以满足文档数字化落地时遇到的各种实际需求。

目前,PaddleOCR-VL-1.6已经在PaddleOCR官网上线,支持网页端直接调用,也开放了API。模型代码和权重也同步开源了,开发者可以直接去GitHub和Hugging Face上拉下来用。

从文心团队那边了解到,PaddleOCR是基于文心大模型训练出来的,算是文心大模型多模态能力的重要组成部分。它支持超过100种语言的识别,用户已经覆盖了170多个国家和地区。

这次发布的PaddleOCR-VL-1.6,是在上一代PaddleOCR-VL-1.5的基础上做的升级迭代。通过模型驱动的数据构建机制和渐进式训练优化,在保持0.9B轻量化架构的前提下,模型的准确率和在复杂场景下的适应能力又提了一档。更贴心的是,因为两代模型的架构保持一致,开发者和企业用户完全不需要额外适配,直接平滑迁移就行了,省去了不少麻烦。

话说回来,百度在OCR这条路上的积累确实够深。从PaddleOCR-VL一路到PaddleOCR-VL-1.6,模型的GitHub星数已经突破了79.2K,直接把谷歌的开源OCR项目Tesseract OCR甩在了身后。这个数字背后,是实打实的社区认可度。