HyOCR-1.5 - 腾讯混元开源的轻量级端到端 OCR 专家大模型
HyOCR-1.0是什么
先说说一个有意思的新东西——HyOCR-1.0。这是腾讯混元开源的一款轻量级端到端OCR专家大模型,虽然只有1B参数,但能干的事可不少:文档解析、文本识别、信息抽取、拍照翻译、图表解析,甚至古文字识别、视频字幕提取和多页文档问答,一应俱全。更厉害的是,它基于DFlash投机解码,长结构化输出推理最高能提速6.37倍。在OmniDocBench v1.6上,它以94.74分位居端到端第一,这个成绩相当抢眼。
HyOCR-1.0的主要功能
- :能一键把密集文档、多栏版面、表格还有公式,直接转成Markdown、HTML或LaTeX这样的结构化文本。
文档解析
- :输出图片中全部文字及对应坐标,不管是文档、街景、手写、广告、游戏还是视频,都能搞定。
文本检测识别
- :从票据、证件、收据里提取指定字段,按JSON格式返回,干净利落。
信息抽取
- :提取图中文字并翻译成多种语言,还能保留原来的版式和公式格式。
拍照翻译
- :流程图、统计图表,都能解析成Mermaid或Markdown格式。
图表解析
- :支持汉字七体——甲骨、金文、篆、隶、楷、行、草,一个都不少。
古文字识别
- :从视频帧里精准提取字幕文本。
视频字幕提取
- :基于多页PDF进行跨页检索、比对和证据聚合问答。
多页文档问答
HyOCR-1.0的技术原理
轻量端到端架构
延续了HyOCR-1.0验证过的紧凑设计,由原生分辨率视觉编码器Hunyuan-ViT、自适应MLP连接器和轻量语言模型Hunyuan-0.5B组成。直接把多模态输入映射成Markdown、HTML、LaTeX等结构化输出,不需要任何任务级后处理模块。这才是真正的端到端——不需要任何后处理模块。
4K原生分辨率视觉编码
视觉编码器基于Hunyuan-ViT,最大输入分辨率从2K扩展到了4K,保持原始宽高比和空间布局。这样一来,高密度文档、超大表格和复杂版面的细粒度结构细节,都能被模型精准捕捉。
DFlash投机解码
引入了一个约90.7M参数的block-diffusion草稿模型,一次并行前向就能预测整块候选token,再由目标模型单次验证并接受最长正确前缀。在严格保持目标模型输出分布的同时,大幅降低了长结构化OCR生成的解码延迟。
Agentic Data Flow
智能体驱动数据生产闭环,把模型短板转化为可执行数据需求,自主完成素材搜索、工具辅助清洗、难例挖掘和数据管线开发,再和算法工程师持续迭代。这个机制让模型能持续进化。
三阶段训练配方
预训练阶段重规划了Stage 3,注入新能力数据并扩展到4K分辨率和128K上下文;SFT阶段彻底清洗数据、统一prompt接口;RL阶段采用IcePop(GRPO风格)优化,通过事实性、一致性评判和退化抑制三类互补奖励,提升输出质量。
如何使用HyOCR-1.0
- :安装Python 3.12+、CUDA 12.9、PyTorch 2.7.1和vLLM(≥0.12.0)。
环境准备
- :执行
模型启动
vllm serve tencent/HunyuanOCR启动服务,或者加载Hugging Face权重。 - :用PIL读取图片,构建含image和text的messages对话结构。
图片输入
- :按场景选择Prompt,比如文档解析、文字检测、信息抽取、翻译等。
任务指令
- :通过vLLM或Transformers生成结果,设置temperature=0和max_tokens=16384。
调用推理
- :用内置去重函数清理可能的重复子串,得到最终结构化输出。
结果清洗
- :通过llama.cpp在CPU或消费级GPU上运行,不需要服务器。
本地部署
HyOCR-1.0的核心优势
- :DFlash投机解码让长文档生成在Transformers下提速6.37倍、vLLM下提速2.14倍,端到端每页只要1.4秒。
极速推理
- :1B参数,通过llama.cpp就能在CPU、消费级显卡甚至笔记本上本地运行。
轻量可部署
- :OmniDocBench v1.6端到端第一(94.74),表格TEDS 93.67,复杂表格和阅读顺序表现尤其突出。
SOTA精度
- :训练配方、推理框架、模型权重全部公开,可复现、可微调、可扩展。
全栈开源
- :Agentic Data Flow补齐了331种低资源语种、古文字、多图问答等稀缺能力。
长尾能力
- :支持4K图像分辨率和128K上下文,适配高密度长文档。
高分辨率长上下文
- :CHAOS-Bench页均召回率14.15,优于现有模型,输出更忠于所见。
幻觉抑制
HyOCR-1.0的项目地址
- :https://github.com/Tencent-Hunyuan/HunyuanOCR
GitHub仓库
- :https://huggingface.co/tencent/HunyuanOCR
HuggingFace模型库
- :https://arxiv.org/pdf/2607.04884
arXiv技术论文
HyOCR-1.0的同类竞品对比
| 维度 | HyOCR-1.0 | DeepSeek-OCR-2 |
|---|---|---|
参数规模 |
1B(轻量) | 3B(大3倍) |
OmniDocBench |
94.74 | 87.01 |
端到端延迟 |
1.408s / 页 | 5.460s / 页(慢3.9倍) |
表格解析TEDS |
93.67 | 约84.97 |
推理加速 |
DFlash投机解码,Transformers 6.37×提速 | 无专用加速,纯自回归解码 |
部署成本 |
可跑在CPU / 笔记本 | 需服务器级GPU |
HyOCR-1.0的应用场景
- :一键将合同、论文、报告等高密度多栏版面转为Markdown、HTML或LaTeX结构化文本,保留阅读顺序和版式。
密集文档数字化
- :精准还原财务报表、学术论文中的超大表格和数学公式,支持HTML表格和LaTeX公式输出。
复杂表格与公式解析
- :覆盖331种语言,自动识别并解析混合语种文档,适用于外贸、法务、出版等全球化业务场景。
多语种跨国文档处理
- :识别甲骨、金文、篆书、隶书等汉字七体,辅助博物馆、考古机构对历史文献进行数字化存档和研究。
古文字研究与保护