革新医疗AI:Med-Gemini模型在医学基准测试中的突破表现
先说几个核心判断:AI在医疗领域的应用,这几年一直是热点话题。尤其在诊断辅助、医学考试、电子病历分析这些场景里,模型的准确性和可靠性直接关系到实际落地价值。而Med-Gemini的出现,某种意义上等于给这个赛道立了一个新标杆——它基于Gemini系列模型做了针对性优化,同时整合了网络搜索和自我学习能力,在14项标准医疗测试中,有10项达到或超过了现有最佳水平。
举个例子,在MedQA(美国执业医师资格模拟考试)的测试中,Med-Gemini通过一种叫做“不确定性引导搜索”的策略,把准确率推到了91.1%。相比之前业界公认的标杆Med-PaLM 2,这一下子高了4.6个百分点。什么概念?在这种高难度医学考试上,每提高一个百分点都是巨大的跨越。

Med-Gemini的核心技术及模拟验证
多模态模型
医疗场景有个天然特点:信息不是单一的。医生看片子的时候,同时要看病历、化验单、影像、甚至手术视频。普通AI模型只能处理单一数据源,这显然不够用。Med-Gemini恰恰解决了这个问题——它能把文本、图像、视频糅合在一起理解。
比如在放射科场景下,Med-Gemini可以跟初级保健医生对话,一边读胸部X光片,一边分析患者背痛的病史,识别出退行性椎间盘疾病,还能解释清楚因果关系和相关性之间的差别。它甚至可以用大白话向患者解释病情——在临床环境中,这种“患者理解能力”其实非常关键。
当然,需要强调的是,这些测试目前还属于实验室环境下的“定性展示”,虽然展现了潜力,但真要进了医院那间诊室,还需要大量真实世界的验证。
长文本处理能力
慢性病患者的电子健康记录(EHR)动辄几千页,里面掺杂了多年来的检查报告、用药记录、手术史、随访记录。普通模型面对这种“海量长文档”通常会迷失方向。但Med-Gemini在处理这类任务时,显示出了一种“大浪淘沙”的能力——它可以从冗长的记录里精准抓取出某个罕见病症或特殊手术史,这就像是在一本厚厚的小说里找到某一行字。
有意思的是,它在这类任务上的表现,跟专业基准方法相当。而那些基准方法往往需要大量人工调整才能跑通。相比之下,Med-Gemini展示了更强的泛化能力:不需要高度定制,就能适应新的场景。
同样的,在医学视频理解方面,Med-Gemini也表现抢眼。无论是在仅提供视频的任务中,还是在同时提供视频和字幕的任务中,它都拿到了最高分,甚至超过了以前需要大量人工干预才能跑通的最佳方法。不过也要看到,在腹腔镜胆囊切除术视频的关键手术视图识别任务上,它虽然优于GPT-4V,但输给了经过专门监督训练的ResNet3D架构——说明在某些极端精细的任务上,仍有优化空间。
图 6: 皮肤科场景下与Med-Gemini-M 1.5进行假设性多模态诊断对话的示例
再来看看皮肤科的场景。在模拟的多轮诊断对话中,Med-Gemini展现了几个非常有意思的能力:它能主动要求用户上传图片(这是一种多模态信息获取的行为),能在没有外部提示的情况下完成开放式诊断,还能把视觉特征和患者自述的症状结合起来解释推理过程——也就是所谓的“可解释性”。与此同时,它还能回答治疗方案相关的问题,同时谨慎地把最终决定权留给了医生。这一点很重要,毕竟AI的角色是辅助,而不是取代。
与GPT-4模型家族的比较
数据不会撒谎。在多个对比测试中,Med-Gemini相较于GPT-4家族展现出明显优势。比如在MedQA(USMLE)测试中,Med-Gemini-L 1.0拿下的91.1%准确率不仅刷新了行业纪录,也比GPT-4增强版MedPrompt高出0.9个百分点。这背后的关键差异在于搜索策略:MedPrompt依赖复杂提示输入,而Med-Gemini采用的是基于不确定性引导的搜索框架——后者更具可扩展性。
更惊人的成绩出现在《新英格兰医学杂志》(NEJM)发布的临床病理研讨会(CPC)复杂诊断挑战中。Med-Gemini-L 1.0比此前的行业标准AMIE模型高出了13.2个百分点。要知道,AMIE本身已经是优胜于GPT-4的模型了。也就是说,Med-Gemini等于在强者的基础上,又跃升了一个台阶。
这种搜索策略同样适用于基因组学知识任务。在GeneTuring的七个测试模块中,Med-Gemini-L 1.0的成绩全面超越了此前所有前沿模型。
另外,研究人员还专门评测了自我训练和不确定性引导搜索对模型性能的影响。结果非常明确:自我训练让模型准确率提高3.2%,而且每一次搜索轮次都带来了实实在在的效果增益——从最初的87.2%,逐步攀升至最终的91.1%。同样的规律也出现在NEJM CPC测试上:加入搜索后,前十名准确率上升了4.0个百分点。
图 3: 利用网络搜索扩展Med-Gemini-L 1.0到两个额外文本基准的泛化能力
(a): Med-Gemini-L 1.0在NEJM CPC基准测试上的top-k准确率,与之前最先进大型语言模型和临床医生比较(包含使用和不使用网络搜索的情况)。
(b): Med-Gemini-L 1.0与GeneTuring数据集模块上最先进模型的比较。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名