从数据到应用,BiomedGPT带你领略医学AI的多模态力量
人工智能的浪潮正在席卷生物医学领域,这一点已经毋庸置疑。不过,眼下绝大多数生物医学AI模型都还停留在“专才”阶段——为特定任务量身定制,精度虽高,但一旦面对不同类型的数据或多样化的临床需求,便显得有些力不从心。正是在这种背景下,一个能够统揽全局的“通才”模型成了研究者们争先探索的方向。最近发表在《Nature Medicine》上的一篇文章,就带来了这样一个名为BiomedGPT的通用多模态AI模型,展示出它在生物医学领域的广阔应用前景。

BiomedGPT的厉害之处在于,它能够融合CT、X光、MRI、心电图以及电子病例等多种数据类型,不仅在放射学视觉问答、报告生成和总结等任务上表现抢眼,更关键的是,它借助公开的多样化数据集大大增强了自身适应性和泛化能力。
BiomedGPT的设计与创新
在架构层面,BiomedGPT基于Transformer的编码器-解码器结构,天生就具备处理多种数据类型的能力。它的构建分为三大核心步骤:
- :预训练阶段,BiomedGPT使用了14个公开数据集,覆盖CT、X光、MRI等13种数据类型。通过Sequence-to-Sequence的学习方式,模型能够从这些五花八门的数据中学会处理多模态信息。
多样化预训练任务
- :微调阶段则选取了多个具有临床应用前景的下游任务,例如视觉问答、图像描述、医学图像分类、文本摘要和文本理解。每个任务都让模型更贴近真实应用场景。
任务微调
- :为了进一步提升对问题的理解能力,BiomedGPT借鉴了LLaVA-Med的方法,对VQA-RAD、SLAKE和PubMed文章进行了针对性优化。
指令调优
数据集梳理与应用
BiomedGPT的成长离不开高质量的数据支撑。以下是模型开发过程中使用到的主要数据集:
- :VQA-RAD、SLAKE、PathVQA。
视觉问答
- :IU X-ray、MIMIC-CXR、Peir Gross。
图像描述
- :MedMNIST-Raw(涵盖九种组织类型和七种模态)、MC-CXR、SZ-CXR、CBIS-DDSM。
医学图像分类
- :MedQSum、HealthCareMagic、MIMIC-CXR、MIMIC-III。
文本摘要
- :MedNLI、MIMIC-III、SEER、TREC2022。
文本理解
这些数据的多样性与丰富性,为BiomedGPT提供了坚实的训练基础,使其在各类医学任务中都能游刃有余。
临床应用与评估
为了验证BiomedGPT在临床场景中的真实表现,研究团队针对放射学视觉问答、报告生成和报告摘要三个任务进行了人工评估:
- :从MIMIC-Diff-VQA官方测试集中随机抽取了52个问题-答案样本。
放射学视觉问答
- :从MIMIC-CXR数据集中随机选取30对图像-报告样本。
放射学报告生成
- :在MIMIC-CXR中随机选取100份报告进行摘要生成,并与人工撰写的摘要做对比。
放射学报告摘要
评估结果相当亮眼——BiomedGPT在多个任务上表现出色,尤其在处理放射学影像和生成医学报告方面,展现出了极高的应用潜力和临床价值。
总的来说,BiomedGPT的出现不仅证明了通用AI模型在生物医学领域的可行性,也为未来的医学AI研究提供了宝贵的实践经验。研究团队还系统整理了模型所使用的33个数据来源,希望能为同行的科研工作提供参考。可以预见,随着更多高质量数据的开放,类似BiomedGPT这样的多模态通用模型,将在医学研究与临床应用中发挥越来越重要的作用。
数据收集与整理始终是科研工作的关键一环,尤其对于结合AI算法的研究而言,高质量数据的重要性怎么强调都不过分。
参阅通道:https://www.nature.com/articles/s41591-024-03185-2
这项研究由来自多个知名机构的多学科团队共同完成。主要作者包括:
- :研究方向为AI在生物医学中的应用,专注于深度学习模型在医疗影像分析中的效率与准确性。
Kai Zhang
- :深耕生物医学AI,致力于将AI技术落地于临床实践,尤其在医学影像智能分析领域。
Rong Zhou
- :专注于机器学习与数据挖掘,在多模态数据集成与分析方面有深入探索。
Eashan Adhikarla
- (通讯作者):关注AI在健康医疗领域的创新应用,特别注重模型的可解释性与临床实用性。
Lichao Sun
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名