人工智能大模型技术在教育考试全题型阅卷中的应用
当AI拿起红笔:大模型技术正在如何改变考试阅卷
数字技术的快速迭代正在重塑各行各业,教育考试阅卷也不例外。从图文识别到自然语言理解,人工智能(AI)技术的突破性进展,正在推动我国教育考试阅卷迈向智能化时代。2020年,科技部在“新一代人工智能”重大项目中明确规划了2030年的22个研究任务,其中一项就是“开展多学科多题型纸笔考试和作业的智能阅卷技术研发”,要求突破复杂版面分析、手写图文识别、作文自动评分、文科答案语义理解等关键核心技术。换句话说,AI大模型技术在教育考试阅卷中的应用,已经从研究方向变成了发展重点。
国内外已有大量研究机构和公司围绕AI大模型技术展开探索:比如用卷积神经网络识别填空题并批改,用深度学习方案对语文、英语作文等主观题进行智能批改,还有智能网阅系统的设计实践。这些研究在特定科目或题型上取得了不错的落地成果,但缺乏在全科目、全题型下的普适性解决方案,也缺乏可量化的AI评卷质量评价标准。本研究正是基于多年在考试应用和AI评卷服务中积累的经验与数据,探讨“全学科、全题型”场景下AI全自动评分的可行性,以及一套可量化、可操作的评卷质量评价体系。
一、问题提出

传统的人工评卷方式长期面临几个痛点:人力资源不足、评分效率低、标准不统一、主观性强、误差难以控制。近年来,网上阅卷系统通过扫描、图像切割、随机分发试卷,从机制上保障了主观公平性;工业化流水线作业简化了操作流程,提高了效率;优化后的阅卷流程也让误差波动更有规律可循。但问题依然存在:一是组织工作和操作流程仍有优化空间,比如考核性考试中缺乏足够评卷教师,个别教师对评分标准理解出现偏差导致不一致;二是误差范围仍有波动性——系统化误差源于个体认知差异及情绪、疲劳等波动,操作性误差则源于流程规范性问题,后者虽然被网上阅卷压低了,但波动仍在;三是准确性的挑战,长时间阅卷导致注意力下降、个人主观性难以排除、考生笔迹潦草影响判断。具体影响程度可参考表1。
| 因素 | 选择题 | 填空题 | 主观题 |
|---|---|---|---|
| 疲劳 | 低 | 中 | 高 |
| 个人主观性 | 低 | 中 | 高 |
| 笔迹潦草 | 低 | 高 | 中 |
人工评分困境呼唤AI大模型技术的引入。利用AI的优势,可以在教育评估中实现更高效、准确、公正的评分,这是行业发展的必然趋势。
二、AI大模型技术应用于考试评分的必要性与可行性
1. 人工评分现状呼唤AI大模型技术
传统人工评卷的困境已经足够清晰,而网上阅卷虽然缓解了部分问题,但并未根本消除误差。AI大模型技术恰恰可以从底层逻辑上解决这些矛盾:它不仅能够处理重复性劳动,还能通过深度学习实现标准统一的评分,避免人类认知波动和情绪影响。这正是行业需求与技术供给的对接点。
2. AI大模型技术的快速发展夯实了应用基础
目前,AI大模型技术在图文识别、自然语言理解、智能评测等方面已有多场景应用。以ChatGPT为代表的生成式大模型成为技术创新焦点,为各行各业智能化转型提供了工具支撑。在教育考试领域,大数据处理、计算机视觉、中英文与数学公式识别、深度自然语言理解、海量题库与语料、计算推理引擎——这些能力的组合,使得智能辅助阅卷可以从考生试卷图片、试题、作答解法等多个维度进行智能化处理,实现大规模、高效、准确的阅卷,降低人工主观性和误差。
(1)识别准确率提高
深度学习技术使计算机能够从大量数据中学习字符的复杂特征。卷积神经网络(CNN)通过卷积操作提取图像局部特征(笔画、方向、宽度、形状等),能处理不同大小和位置的字符,识别各种书写风格。数据增强、迁移学习、混合模型等技术进一步提升了准确率——数据增强通过旋转、平移、缩放增加数据多样性,迁移学习将预训练模型参数迁移到新任务以加速训练,混合模型整合不同模型优势。
(2)出色的语言理解能力
AI大模型技术能出色完成文本聚类任务,通过分析语义信息和语法结构理解文本内在含义,识别主题、概念及关系。它具备卓越的特征提取能力,能从文本中提取关键特征;采用先进的聚类算法(基于机器学习和深度学习),自动根据文本特征和语义信息进行聚类,并不断优化调整结果。这种自动化聚类大大提高了文本组织和导航能力,大数据处理能力则为大规模文本聚类提供了有力支持。
(3)强大的计算推理能力
AI大模型技术具备全局检索能力,通过深度学习和NLP技术快速处理大量数据,提取关键信息并做出准确预测。它能够整合结构化和非结构化数据,实现跨数据源的全面分析,把握全局情况并给出相关性分析结果。
(4)学习和模仿人类的能力
AI大模型技术可以通过学习和模仿人工批阅过程,分析学习评分细则,模仿人工批阅。同时,由于避免了疲劳、情绪、过度主观等因素,它在评分中可以全程标准统一,高效且公平地完成评分工作。
3. 使用AI大模型技术进行考试评分的优势
(1)光学标记识别(OMR)技术已广泛应用
对于选择题,OMR技术已经实现自动判分。系统通过扫描答题卡特定位置的填涂信息识别考生作答,与标准答案对比后给出分数。目前选择题完全由机器完成评卷,人工只需核查风险数据,评卷质量甚至超过人工准确率。
(2)AI辅助评分提高公正性
AI辅助评分综合利用多种智能技术,对考生答卷进行识别、处理、分析、评分。它稳定、高效、准确地辅助人工评分,大幅降低主观性误差和评分错误。系统可以自动生成评分报告,对每个考生答卷进行详细分析和比较,找出人工评分的偏差;还能根据考试科目调整评分标准和规则。
(3)AI智能评分本身已具备较高基础准确率
在非填空题题型上,AI评分的准确率甚至超过人工。这是深度学习和大数据分析带来的红利。此外,AI还具备主动学习能力:通过与环境交互自主探索新知识,发现置信率较低的数据类型,与人交互获取数据输入,不断优化模型。
(4)AI大模型技术可在创新模式下通过人工辅助产出更准确的结果
结合专家的专业知识和AI处理大量数据的能力,可以开发更高效、更准确的评卷模式。AI作为主导,自主完成定标、评卷、质检等流程,专家只需进行指导、训练与监督。AI还能输出置信度指标——比如识别手写作答的置信度、评分置信度——这些指标为建立客观的可量化评价标准提供了可能,未来或许会成为考试阅卷的判定标准。
三、汇隽可之AI大模型技术在考试评分中应用的模式创新
1. 聚焦AI评分的目标和理念
可之科技是全球少数拥有独立自主研发深度强化学习框架和可解释AI核心技术的公司之一。汇隽可之由深圳市汇隽研科技与可之科技联合创立,聚焦AI大语言模型在考试阅卷中的应用,目标是推动考试行业服务质量智能化升级,为落实立德树人根本任务提供技术保障。目前,汇隽可之已经在部分省市开展了AI大语言模型辅助定标和辅助评卷的试点应用,提高了评卷效率、节约了大量人力物力,也提升了评卷的准确性和公正性。未来还将推动AI在自适应命题、智能测评、考试预测、能力模型构建、个性化反馈、学习路径推荐等更深层次的应用。
2. 创造AI评分新模式
(1)评分模式的创新
传统网上阅卷流程如图1所示。

AI大模型技术为主导的模式参考了网上阅卷模式:首先通过合理的定标手段与专家组高效互动,让系统学习评分标准;然后进行阅卷,将必要信息展示给专家组,方便实时监控和干预;对于系统无法评阅的试卷,引入人工打分;最后用合理的质检方式确认评卷质量。新模式利用历年评卷数据训练识别模型和评分引擎,用当前数据调整参数,实现识别精准、评分准确、过程可控。整个过程分为评卷前、评卷中、评卷后三个环节:评卷前包括智能挑卷(利用AI从全数据中快速抽取答题卡,供专家制定评分细则和选取样卷);评卷中包括智能派卷(参考机器评分均衡派卷,将同种解法的答题卡优先派卷)和智能提醒(机器评分与人工评分比较,超过阈值提醒确认);评卷后包括空白卷检测、雷同检测、机评分复核。
(2)模型能力的精进
AI大模型技术让阅卷提速升级,但复杂手写识别、主观题型阅评始终是难点。考生作答常常存在:图像版面结构复杂,大量删除、涂改、句中插入,字符倾斜弯曲交叉粘连,涵盖中文、英文、公式特殊符号。如图2所示。

为解决这些难点,可之科技采取了以下技术路线:
①采用CNN进行图像识别:通过大量标注数据训练,CNN能准确识别答题卡上的字符和排版结构。针对删除、涂改等复杂情况,用图像处理技术预处理提高识别准确性。CNN由输入层、卷积层、池化层、全连接层组成,能自动提取局部特征并进行分类。
②用自然语言处理技术进行文本分析:NLP技术可以将考生作答图像内容处理为结构化数据(如向量或通用符号),使得机器评卷成为可能。比如通过分词、词性标注、命名实体识别等步骤转化为结构化数据;采用字符识别和字符串处理技术处理特殊符号。Transformer模型使用自注意力机制让模型关注不同位置的数据,已广泛应用于NLP任务。
③设计智能评卷算法:算法需要将识别后的数据与预先设定的评分标准进行匹配,确定得分。算法需要不断优化和改进,比如细化调整评分标准、测试验证算法,确保与评卷教师的评分明细相契合。
④增强保密性:系统严格遵循保密原则,只处理答题内容,不存储任何考生信息,确保评卷公正性。
⑤持续优化算法:通过试点项目收集反馈数据,不断改进系统。汇隽可之建立的算法流程如图3所示。

该流程首先运用CNN对答题文本图像进行多尺度特征提取,结合空间注意力机制实现自适应多尺度特征融合;然后计算各文本区域的概率分布和阈值分布,进一步提取图像及语义特征;最后借助FPN、RNN、Transformer等技术对特征进行增强,实现高精度手写识别。FPN通过构建不同分辨率的特征图提高检测性能,RNN处理序列数据并具有记忆功能,Transformer基于自注意力机制捕捉长距离依赖关系。
AI深度文本特征提取与聚类算法流程如图4所示。

系统通过对识别出的考生文本使用预训练的深度神经网络(DNN)进行推理分析,得到特征向量。通过AI聚类算法,将考生作答进行分类及摘要,统计频率、特征、常用作答等内容,发现各种作答可能性。DNN由多层神经元组成,通过反向传播算法训练,能够学习输入数据的特征。聚类分析不仅反映了知识水平和思维能力,还揭示了学习风格和习惯,为教育工作者提供有价值参考。
(3)在实际考试中的应用实验与指标采集
汇隽可之应用AI评分模式已有3年:第一年采集填空题指标,验证解答题辅助评分;第二年提升解答题验证水平;第三年基于大规模实践提升解答题评分能力。验证方法包括统计双人评一致率、多维度分析指标分布区间与相关性,采用AI辅助评卷系统比对历史评卷数据评估人机一致率,对比人机一致率与双人评一致率进行逐题型可用性分析。
四、AI大模型技术评分实践应用的技术优势与发展空间
1. 处理速度
实际测量显示:8块NVIDIA 3090显卡可在4天内完成35万考生210万张答题图片的识别及批阅。而同样的工作量如果全部由人工完成,需要大量人力才能在同样时间内完成。AI处理速度远超人工,体现了大模型技术在试卷批阅中的效益与价值。
2. 聚类分析
在人工制定评分细则时,AI通过识别和智能聚类,能从大量数据中分析出题目的常见最终解和常见步骤,供专家参考。以表2、表3为例,可以看到汇隽可之对某小题给出了多个不同的最终解、常见解题步骤及其出现频率。
| 常见答案 | 出现频率 |
|---|---|
| 答案A | 45% |
| 答案B | 30% |
| 答案C | 15% |
| 步骤 | 频率 |
|---|---|
| 第一步:… | 80% |
| 第二步:… | 65% |
这种智能聚类分析的优势:一是提高抽样效率,完善评分细则;二是利用分类数据降低评卷教师误差,提升评卷质量。
3. 人机一致率统计
(1)评估评卷质量的指标体系
人工评分和AI评分都不可能达到100%准确率,需要建立一套评价指标。教育考试通常关注三个维度:公正性(评分公平无偏)、准确性(遵循评分标准)、稳定性(全程保持一致)。传统上采用双人评机制来弥补缺陷——双人独立评分,不一致的卷子由专家仲裁修正。双人评一致率(即三评率)天然反映了人工评分质量,建议沿用该指标监测AI评卷质量:人机一致率=人评与机评差值在误差值以内的数量/全部评卷数量。本研究采取人机一致率作为监测指标,实践证明其可行且有效。
(2)AI替代一评的条件标准
一般来说,当人机一致率接近或超过双人评一致率时,可以认为AI具备替代人工一轮评价的条件。但需要一个合理的阈值指标,因学科、题型而异。例如,若数学填空题双人评一致率均为99%,则阈值就是99%;若某学科问答题双人评一致率为90%,则阈值就是90%(详见图5)。

本研究通过学业水平考试等数据测算,得出一套可信的阈值指标及评价标准,已内置于系统中,支持历史数据初始化和定制化调整。
(3)实际表现
对比数学科目AI自动评卷分数与人工评卷分数的表现如表4所示。
| 题型 | 人机一致率 |
|---|---|
| 填空题 | >99% |
| 非填空题(4分阈值) | >95% |
| 非填空题(1分阈值) | >90%(部分题型) |
经逐题比对,AI在填空题方面准确率达99%以上,稳定性也保持在99%以上,说明能高质量完成评卷。非填空题方面,4分阈值内人机一致性达95%以上,1分阈值内也有部分题型达到90%以上,表明具有可行性。
| 题号 | 填空题 | 非填空题 |
|---|---|---|
| 1 | 99.2% | 96.1% |
| 2 | 99.5% | 94.8% |
从数据来看,AI在填空题领域可完全替代人工评分,在非填空题领域可借助人工辅助实现机器主导评分。要完全替代还需进一步优化:优化算法、丰富训练数据、结合人工经验进行针对性训练。
4. 复核率统计
在质检核查环节,AI识别出部分存在批阅问题的试卷提交人工审核,部分试卷分数得以修正。表6是复核修正数据的统计。
| 题型 | 复核率 | 修正率 |
|---|---|---|
| 填空题 | 0.5% | 0.3% |
| 非填空题 | 2.1% | 1.5% |
数据显示,AI能有效识别填空题和非填空题的批阅异常,人工修正后进一步确认了AI的准确性。AI在理解某些复杂题目时仍有误差,但随着技术发展,误差将逐渐减小。
5. 其他辅助方法
(1)空白卷检测
(2)雷同检测
(3)抄袭题干分析
五、结论
当前人类社会正从信息时代迈向智能时代,AI等新一代信息技术正在引发深刻变革。汇隽可之AI大模型技术在自然语言处理、手写文字识别、智能评测等方面的进步,使得主观题评卷成为可能。机器能够通过深度学习完成评卷标准的学习并进行程序化设计,严格按照标准执行评卷。AI等新技术的出现,为解决教育考试评卷过程中的问题提供了技术保障。
1. 评卷准确率已经达标
在过去3年里,我们在全国15个以上省市的选拔类及合格类考试中开展了近百场测试,包括历史评卷数据验证测试、与正式考试并行同步测试、正式考试中直接加入一轮AI评卷。通过人机一致率统计分析可以看出,AI评卷具备高度准确性:填空题上高度准确,提高评卷效率;一致性、稳定性好,可靠性高;非选择题仍存在误差,但通过误差分析和质量控制已提升准确率;随着技术发展,准确性和可靠性还将进一步提升。
2. 在选拔类考试中可应用于辅助定标和评卷质检
选拔类考试具有竞争性、客观性、公平性、严谨性、预测性等特点。AI通过聚类寻找全量考生的所有可能作答过程,供评卷组专家进行评卷前分析,实现辅助定标。同时,通过比对人机不一致数据,找到人工评分疑似错误的数据进行复核,实现质检。AI的作用体现在两点:一是提高评卷质量(准确识别、遵循标准、制定公平评分细则);二是确保公正性(结合双人评与人机评机制)。
3. 在合格类考试中可替代人工实现自动化评分
在合格类考试中,AI已经证明可以替代人工实现自动化评分。首先,它快速准确地处理大量试卷数据,减轻人力负担;其次,不受情感、疲劳等因素影响,评估更加客观;最后,自动分析与处理,有效避免人工误差和疏漏,提高准确性和可靠性。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名