一款优秀的开源项目,PDF扫描件识别也超容易
图片和扫描件,几乎是所有文本处理场景里绕不开的一道坎。无论是业界还是学术界,这都算得上是个老难题,同时也是当前优化的大热门。今天要聊的这个开源项目,恰好就是冲着这个痛点来的——它在 GitHub 上已经拿到了 24.9k 的 star,而且涨势相当猛。简单说,它把多种 OCR 能力打包在了一起,用起来很高效。
项目特点
- :代码全部开源,没有任何隐藏费用。
免费
- :解压即用,离线运行,不依赖网络。
方便
- :自带高速离线 OCR 引擎,内置多语言识别库。
高效
- :支持命令行、HTTP 接口等外部调用方式。
灵活
- :截图 OCR、批量 OCR、PDF 识别、二维码识别、公式识别,一次搞定。
功能全面
安装使用
软件发布包是 .7z 压缩包或 .7z.exe 自解压包。自解压包的好处是,即使电脑没装解压软件也能直接解压。整个软件无需安装,解压后双击 Umi-OCR.exe 就能启动。
模块举例
文档识别
支持格式:
pdf, xps, epub, mobi, fb2, cbz。对扫描件进行 OCR,或提取原有文本,可输出为双层可搜索 PDF。
支持设定忽略区域,比如排除页眉页脚的文字干扰。
可以设置任务完成后自动关机或休眠,省心省力。
公式识别
Umi-OCR 的公式识别能力基于 Pix2Text 实现。Pix2Text 本身也是一个开源 OCR 项目,专门处理文字和数学公式混排的图片。
截图OCR
打开这个功能后,用快捷键就能快速唤起截图,识别图中的文字。操作很直观:左侧的图片预览栏可以直接用鼠标划选复制,右侧的识别记录栏支持编辑文字,还可以划选多条记录批量复制。另外,从别处复制图片后,直接粘贴到 Umi-OCR 里也能识别。
文本后处理

关于 OCR 文本后处理中的排版解析方案,它能把识别结果的排版和顺序整理得更符合阅读习惯。预设方案包括:
多栏-按自然段换行:适合大多数场景,自动识别多栏布局,按自然段规则换行。多栏-总是换行:每段语句都强制换行。多栏-无换行:把所有语句合并到同一行。单栏-按自然段换行/总是换行/无换行:与多栏类似,但不区分多栏布局。单栏-保留缩进:适合解析代码截图,能保留行首缩进和行中空格。不做处理:直接输出 OCR 引擎的原始结果,默认每段都换行。
以上方案均能自动处理横排和竖排(从右到左)的排版,兼容性很不错。
项目仍在持续迭代和优化中,后续还会有更多实用功能加入。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名