首页 > 教程攻略 > ai资讯 >Dify工作流的使用(三)表格OCR

Dify工作流的使用(三)表格OCR

来源:互联网 时间:2026-07-20 13:28:07

这段时间,陆续分享了不少关于知识库搭建和大模型使用的基础流程。今天咱们玩点更具体的——用Dify工作流做一个表格OCR的demo。如果你已经跟过前面的教程,那这个其实也不难理解,本质上就是把之前学到的视觉模型能力套用到表格识别上。

先聊个题外话(纯个人视角)

如果你之前写过一些简单的图像分类demo,比如猫狗识别那种,可能会有一个困惑:这种专门的小模型和大模型到底区别在哪?或者换句话,大模型里的“大”到底怎么和那些专业模型共存?昨天碰巧看到个关于大模型架构的视频,听完后豁然开朗。其实大模型内部往往嵌套着一些专门的小模型,中间通过Transformer这类机制做调度。提示词之所以有效,很大程度上就是在引导中间层去调用合适的子能力。这个理解可能不严谨,但至少帮我把大模型和传统专业模型的关系理顺了——它们不是替代关系,是协作关系。

本期实操:用工作流做一个表格OCR

过去处理表格识别,通常有几种路子:

  1. 最原始的是用OpenCV定制化检测表格框线,但无法直接提取文字。
  2. 专用模型如PaddleOCR、阿里读光的有线/无线表格识别算法,效果不错但部署麻烦。
  3. 自己写Python/C++调用这些模型,编译和集成成本不低。

今天试一个更轻量的方案:用大模型视觉能力直接识别表格内容。你可以自行对比效果,同时关注一下模型调用的费用——专业模型官网都有价格表,大模型同样有API计费。两者差异在于:专业模型返回的结果通常带坐标信息(比如每个单元格的位置),而大模型可能只输出纯文本(除非提示词写得够细)。这取决于你的实际需求,多一种选择总没错。

整体流程概览

简单的工作流

测试图片

效果展示

几点注意事项

  • 模型必须选择视觉模型,否则其他类型模型会一直提示“没有文件上传”。
  • 提示词要写到位,比如这样:
#角色:你是一位精通OCR表格提取专家
#任务:你的任务是对用户上传图片中表格的内容进行提取,提取内容为字符串形式
  • 其他配置和之前介绍的工作流demo基本一致,参考之前的文章即可。