首页 > 教程攻略 > ai资讯 >AI+心理健康:基于多模态融合的抑郁症检测系统挑战杯获奖

AI+心理健康:基于多模态融合的抑郁症检测系统挑战杯获奖

来源:互联网 时间:2026-08-07 14:38:58

抑郁症检测这件事,说起来有点沉重,但确实是一个越来越绕不开的现实话题。先看几个关键数字:我国抑郁症患者总数已超过9500万,成年人患病率3.6%,更令人揪心的是,18岁以下青少年儿童的比例竟然高达17.5%——换句话说,每六个孩子里就有一个可能面临抑郁困扰。与此同时,全国精神科医生才6.4万人,还不到医生总数的1.5%。传统诊断方式严重依赖专业医生和患者对精神健康问题的认知,很多人根本迈不过那道门槛。供需之间的矛盾,用一句话概括就是:需求在爆发,资源却跟不上。

目前主流的诊断方式是面对面交流——医生通过量表和一些引导性的提问来判断。说实话,这种方式耗时、费钱、跨度也长,患者要投入大量时间和精力。更关键的是,不是所有人都愿意或者有条件去找医生,这也是为什么AI抑郁症检测逐渐成为研究热点。不过,现有的AI方案普遍存在一个短板:要么模态单一(比如只看语音或只看文本),要么无法适配中文语境,离实际应用还有距离。

清华大学语音与音频技术实验室的几位本科生——张雪桢、李沐晟、李治宇、甘冀韬——组队做了一个很有意思的项目,叫“基于多模态融合的抑郁症检测系统”。这个项目在清华大学第42届挑战杯上拿到了信息赛道校二等奖,也顺利入围了终审答辩。简单来说,他们做了一个网站,综合了语音、文本、视频三种模态的输入,把量表、多模态检测模型和大语言模型整合在一起,既能模拟面诊,又能支持日常交流对话,最后直接给出诊断结果。

整个系统的流程设计得非常贴近真实诊断场景。用户先填一份自测量表,系统会根据作答情况,有针对性地追问一些问题,最后结合用户的全部回应,输出详细的结论和建议。整个过程模拟了医生面诊的逻辑,但完全自助、免费,用户可以随时随地在线上完成。

核心模型这部分值得多说几句。整个系统分为数据输入、数据处理和结果输出三个环节。在数据输入上,团队引入了语音转文本模型,同时做了音频提取等处理,让视频模块能接收三个模态的信息,音频模块能处理两个模态的信息,真正实现了多模态输入的灵活性。在数据处理环节,三个独立的基座模型都针对抑郁症检测任务和中文环境做了微调:语音模块基于多语种预训练模型XLSR-53,在中文数据集上进行了针对性的训练;文本模块用的是PaddleNLP基于ERNIE 3.0预训练模型训练的中文通用信息抽取模型UIE;视频模块则基于视觉情感识别框架EMO-AffectNet,提取了其中的部分情感成分做融合判断。每个模块各司其职,最后在分类器里融合,归一化成0到100的分数,再做一个二分类判断。值得一提的是,系统还针对涉及自杀或轻生倾向的关键词汇,触发了特殊机制——比如提高分数权重,或者直接弹窗提供援助信息。说实话,这个细节挺见功力的。

测试成绩也相当亮眼。在中文抑郁症数据集MODMA上,基于音频单元的准确率和F1分数分别达到0.806和0.747;如果按个体来检测,准确率和F1更是飙升到0.909和0.952。对比下来,传统的SDS检测准确率大约在0.75左右,而现有的语音加文本模态的抑郁症检测模型准确率也只有0.80上下。可以说,这套多模态方案确实把精度抬上了一个台阶。

更重要的是,它不是停留在实验室里的demo。截至2024年4月11日,系统已经上线并积累了2000多个实际用户,收到了超过100条反馈。团队还申请到了计算机软件著作权(登记号2024SR0531161),接下来打算把核心技术写成论文或申请专利。整个项目得到了国家自然科学基金和SRT项目的支持。

回头看,这支队伍在短短一个多月的时间里,从零搭建起一套完整的抑郁症检测系统,背后是三位来自致理书院和电子系的本科生,大部分还是大二大三的学生。他们不仅把三个独立的预训练模型针对中文和抑郁症任务做了微调,还解决了多模态缺失场景的适应问题,最终把成果落地成可以实际使用的产品。在这个领域,能做到这一点,确实值得点个赞。