打工人好用的大模型问答,还需要一款可靠的文档解析工具
如果说三四年前,AI对我们来说还只是科幻片里的概念,那现在,通往智能时代的路径已经清晰可见。各行各业的朋友们,几乎都感受到了大模型带来的生产方式变革气息。
大语言模型的出现,宣告AI时代正式拉开帷幕。
2022年11月30日,ChatGPT横空出世,展示了技术碘伏性的潜力。生成式人工智能一夜爆火,月活用户两个月内就突破1亿。到了2023年,国内外科技巨头和初创公司纷纷入场,硬生生把这一年打造成了“AI之年”。
大模型的落地应用,正在迅速重塑各领域的工作方式。于是,一个根本问题摆在我们面前:AI会取代我们,还是让我们变得更高效?
埃森哲2023年的研究报告给出一个关键数据:所有行业中,40%的工作时间将得到大语言模型的协助。原因很简单,语言任务占到了企业人员工作总时长的62%。让AI当副手协同作战,正在重塑打工人的工作方式,通过自动化技术大幅提升生产力。
愿景有了,路还得一步步走。现在,在咨询建议、内容创建等常用领域,已经有不少小伙伴开始尝试给自己配备一位“AI助手”。不过,相比于常规性的知识问答,各个细分领域的专业性问答对打工人来说更实用。比如在阅读长篇幅论文、报告时,经常需要大模型来完成综述、概括、辅助分析这类工作。这就引出一个关键问题:
如果我提供一系列资料,目前的大模型能给我反馈正确、精准的专业信息吗?
01
知识问答,大模型的表现怎么样?
在文档交互中,我们希望大模型实现的功能包括:根据文件完成知识问答,给出关联信息建议,以及提供专业性分析参考。
多数企业的工作环境里,都存在大量电子档、扫描档文件。全人工阅读分析,往往会造成不必要的时间成本消耗。尤其面对扫描或图片文档时,常规办公软件无法完成关键词检索,信息收集会变得异常麻烦。
对话AI能解决这个问题吗?
最近,我们以国内某自然语言大模型为例,进行了一次简单的测试。该模型处于国内第一梯队水平,平时工作中也常被用到。
1.1 企业年报
首先,上传了一份长度100页的扫描版企业年报(部分),并提了一个问题:根据文本内容,该公司在什么时间,在哪里上市,营业期限到什么时候?
大模型给出了正确回答。
继续追问:根据报告,企业与客户间的销售商品合同包含什么内容?
大模型同样给出了答案。和原文档对比后发现,回答相当详细且全面。
这说明,在年报这类长文档的信息提取方面,大模型确实能提供有效的分析辅助。
1.2 经济报告
接下来尝试一份包含数据与图表的经济报告。上传后,提出一个问题:
依据报告,美国CPI食品的1月官方值是多少?
大模型回复:根据您提供的文件内容,报告中并没有直接提供美国CPI食品的1月官方值。
但如果我们进行人工检索,报告中其实有一张表格,明确标明了CPI食品的1月官方值。
为什么大模型会读取失败?
1.3 期刊论文
上传扫描版论文后,再提出一个具体问题:
根据所给文件,精氨酸在40度的水中,溶解度是多少?
大模型表示:文档中并没有直接提供精氨酸在40℃时的具体溶解度数值。同时,它还补充道:如果文档中确实包含了40℃的溶解度数据,但由于文档不完整或扫描不清晰导致无法读取,请提供更详细的信息或完整文档,以便进行准确回答。
然而,在人工阅读的情况下,我们可以看到清晰的有线表格,里面恰好就提供了上述信息。
又一次,大模型无法找到关键信息并给出准确答案。
在实际工作场景中,需要识别的文件多种多样、情况复杂。其中既有清晰且便于机器读取的纯文字电子文件,也可能包含大量图表,或来源时期不一的纸质扫描档、模糊或扭曲页面。当我们用大模型作为工作助手,准确且稳定的输出是必不可少的要素。现有的内容生成能力,显然还需要进一步提升。
02
大模型回答不理想,原因何在?
在简短的测试里,我们考察了大模型对企业年报、经济报告以及期刊论文三份文件的问答效果,其中两项回答并不理想,无法提供准确内容。
发现这个问题后,我们咨询了产品研发团队,试图推测可能的成因。
产品同学一语道破天机:用我们的文档解析工具把PDF转成Markdown格式,再发给大模型试试。
将转化后的经济报告发送给大模型,再次提出相同的问题。
这一次,大模型清晰地给出了正确答案。
在期刊论文案例中,有线表格里的细节信息也得到了正确提取。
产品同学解释说,这说明就是文档解析环节出的问题。之前大模型没能从你给的文件里识别到需要的信息。
解析工具把图片格式和各类表格都精准识别,转化成机器可读格式后,大模型就能给出正确答复了。
从行业实践来看,目前问答类产品的落地面临几大挑战:
第一,文档识别失败率高。面对复杂版面,无法正确解析,获取标题、分块文本、图表等。这种情况下,大模型在提供细节信息时,常常表现为答案失败或回答错误。
第二,逻辑结构解析不完整。段落语义划分错误,导致回答不全面或总结性偏差。
第三,召回效果差。可能由于训练数据不平衡,影响模型检索召回能力。
而面对前两种问题,稳定准确的文档解析工具,将大大提升大模型的应答能力,优化用户体验。
03
专业文档解析工具,有效增强大模型的问题解决能力
专业的文档解析到底是怎样实现的?它为什么对大模型如此重要?
要理解这些问题,需要先理解PDF解析与大模型的“阅读方式”。
目前,主流专业产品采用的路线,结合了PDF提取技术与OCR识别技术。PDF提取技术主要用于处理PDF格式文档,通过直接解析PDF文件结构来提取文本和其他内容。它的优点是处理速度快,适合结构简单的PDF文档;但在处理复杂布局或包含大量图表、图片的文档时,准确率可能较低。OCR(光学字符识别)技术则通过扫描文档图像,识别其中的文字信息,适用于各种格式的文档,特别是扫描的纸质文档或图像格式的电子文档。OCR技术可以处理复杂布局的文档,但处理速度相对较慢,且对图像质量有一定要求。
合合信息的文档解析工具在此基础上对文件进行阅读顺序还原,支持多种格式的输出,在信息识别环节为大模型提供最“舒适”的序列文字。
文档解析是文档问答类大模型产品不可或缺的底层工具,并且对产品质量有着重要影响。在上文的测试中,大模型读取失败的信息,分别来自文档中以图片格式存在的数据,以及扫描档中的有线表格——这些也正是文档解析环节中的难点。
由此可知,在大模型应用场景下,一款好用的PDF解析工具,至少需要具备三个特性:速度快、精度高、兼容性好。在文档解析这一专精领域,合合信息凭借先发优势,积累了丰富的版式识别能力,能够实现元素检测准确、阅读顺序还原准确以及高效的快速识别。
美国管理学家劳伦斯·彼得提出的木桶理论,在AI时代依然适用。一款用户体验良好的大模型问答产品,需要全面的技术底座,才能成为改革工作模式、推广落地场景的利器。如何打造真正适用、实用,让打工人觉得好用的产品,是AI从业者们不断思考探索的问题。理想产品的打造,要从每一个技术难关的攻克开始,而专业的文档解析工具,正是其中一个重要的突破点。
04
如何试用文档解析工具
合合信息文档解析产品已经上架到TextIn平台,任何开发者都可以注册账号并开通使用。
点击【免费体验】,即可在线试用,如下图所示:
如果想试试用代码调用,也可以访问对应的接口文档内容。
平台提供了一个Playground,帮助开发者们预先调试接口。
点击页面中【API调试】按钮,即可进入调试页面。
在这里可以简单配置一些接口参数,发起调用后,右侧就会出现调用结果。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名