AI for Science,憧憬一个人人都可参与科学发现的未来
先说几个核心判断。AI for Science常被称作科学发现的“第五范式”,虽然它刚起步,定义和研究方向还在讨论中,但它已经在实践中带来了些让人眼前一亮的成果。这篇来自微软研究院科学智能中心杰出首席科学家刘铁岩博士的分享,会聊聊AI在科学领域的关键研究方向,以及对这个领域的未来展望。
AI for Science代表的是一种全新的科学发现范式。目标是构建统一的科学基座模型,打破不同科学领域之间的壁垒,用一个模型解决众多科学难题。更重要的是,它有望推动更普及的科学探索——人们通过与基座模型交互,就能参与到科学发现中来。实现这些愿景,科学基座模型必须超越人类语言的限制,去学习、理解大自然的语言。
——刘铁岩,微软研究院科学智能中心杰出首席科学家
今天的人工智能,在认知、感知等层面的表现已经可以和人类媲美。但长远愿景不该局限在复刻人类已有的知识和技能——真正的期待是,AI能帮助人类探索未知领域,加速我们认识世界和改造世界的进程。
科学进步是推动现代人类社会发展的核心动力。所以,赋予人工智能以科学发现的能力,是发展的必然方向之一。图灵奖获得者Jim Gray在《科学发现的四个范式》中,把科学发现分为四个阶段:千年前的经验科学、百年前的理论科学、几十年前的计算科学,以及十几年前的数据科学。AI for Science的出现,将是前四种范式的有机结合和升华,这才叫科学发现的“第五范式”。
2022年,微软研究院成立了科学智能中心,刘铁岩博士作为创始成员之一,与全球顶尖专家共同探索这个跨领域课题。两年下来,团队在AI for Science的研究上取得了一系列令人振奋的成果。更重要的是,这个过程也在不断刷新对AI for Science的理解。
这里需要特别强调一点:科学发现的艰巨性必须正视。不能简单认为高举AI大锤,就能轻易攻克科学发现的难题。AI for Science健康发展,需要格外严谨和审慎,始终对科学发现保持敬畏。在深入理解科学规律的基础上,对现有AI工具进行改造,甚至发明全新的AI理论和算法。只有这样,才能让AI真正加速科学发现进程,改变格局。

AI for Science的三个要素
AI for Science作为新兴领域,还没有公认的定义。但可以明确的是,它不等于“在科学研究中随便用点AI技术”。真正追求的AI for Science,是更系统、更深入的概念——AI要深度融入科学研究的各个环节:从数据处理到仿真模拟,到实验研究,再到发现新的科学规律。AI要成为科学研究的核心技术,为科学发现雪中送炭,而不是锦上添花。
AI for Science应该包含三个要素:利用合成数据、构建科学基座模型、实现科学研究的闭环。
利用合成数据:
构建科学基座模型:
实现科学研究的闭环:

AI for Science的基座模型要读懂大自然的语言
微软研究院科学智能中心自成立起,就把科学基座模型作为主要研究项目,并明确了发展方向:科学基座模型必须突破人类语言的局限,要能学习和理解科学概念、科学实体、科学规律,掌握支配万事万物的大自然语言。
目前市面上的科学大模型分两类:一类针对特定垂直子领域,比如蛋白质、DNA、单细胞等,设计和训练相应的大模型;另一类是把GPT等大语言模型改造或适配到科学领域。前者只见树木不见森林,聚焦小垂直领域,无法学到普遍科学规律,离掌握大自然语言还很远;后者过度依赖人类语言,作为一种基于统计的、线性、符号化的表达,人类语言很难完整描述自然界的多样性和复杂性。
大自然语言是高维度、多模态、科学严谨的表达。首先,自然界中物质世界是高维度、多尺度的,不同维度和尺度之间受深层科学规律相互制约,这些规律无法简单用人类语言字符序列表达。其次,自然界里存在各种模态,比如复杂的声光电现象、波粒二象性、时空转化等,蕴含着用人类语言无法充分描述的深刻奥秘。另外,人类语言会受到个体认知和社会文化等因素影响,存在偏倚和误差。而科学探索追求严谨普适,大自然语言是客观存在、不受人为因素影响的。只有构建能处理高维、多模态数据的科学基座模型,并将科学规律巧妙融入模型构建和训练过程,才能外推到模型未曾见过的客观世界,真正学习和掌握大自然的语言。

聚焦微观世界的深入探索与应用
面向微观世界和宏观世界的研究,是AI for Science的两个重要方向。微观世界的科学规律已被人类充分掌握,理论完备,也有直接或间接的实验手段,所以AI for Science在微观领域大展身手有充分的理论和实践基础。针对宏观世界,虽然人类还没完全掌握背后的物理规律,但已积累大量数据,AI for Science能利用这些数据进行规律挖掘和预测,比如天气预报和气候变化研究。
目前,微软研究院科学智能中心的AI for Science研究更专注于微观世界,并把相关项目分成三个层次:基础层是科学基座模型;中间层是科学仿真工具(如电子结构预测、分子动力学模拟等);应用层是解决各领域的重大科学问题(如材料设计和药物开发等)。
基础层:设计和训练科学基座模型。
Distributional Graphormer 示意图
中间层:电子结构预测、分子动力学模拟等。
ViSNet 示意图
中间层的AI模型和科学基座模型有很强依赖关系。它们会在科学基座模型通用建模能力基础上,融入领域数据和洞察,通过模型微调或知识蒸馏,获得特定领域更高精度或效率。
应用层:制药和材料的重大科学问题。
TamGen 示意图

憧憬人人都可参与科学发现的未来
AI for Science的深入研究与发展,将为科学发现打开无限可能,为人类探索自然提供更丰富的方法和工具。利用AI for Science,计算机模拟的精度将无限接近现实世界实验的精度,助力科学研究质量和效率提升至全新高度,引领科学探索进入崭新阶段。
更重要的是,科学基座模型的引入有望让科学发现变得更普及。科学探索将不再只是专业科学家的“特权”,任何对科学发现有热情的人,都能通过语言与大模型交互,验证他们的奇思妙想。这将激励更多人参与解决医疗健康、新材料发现、可持续发展等社会性问题,前所未有地汇聚全人类的智慧来造福世界。
当然,也得清醒认识到,AI for Science的发展并非一蹴而就,需要长期投入和研究,攻克一些前所未有的挑战。作为一个高度跨学科的研究领域,
对交叉领域人才的需求非常迫切。
算力和数据同样带来极大挑战。
另外,构建完整的AI for Science研究闭环并非易事。研究闭环不仅关系到验证假说的有效性,也是衡量人工智能在科学发现中效率和质量的关键。
传统的实验室方法论难以支持AI for Science的发展,需要全新的实践方法论
尽管AI for Science作为新兴范式还面临许多未知挑战,但目前每一点进展都预示着它将为人类带来无尽可能性。研究中不乏令人望而却步的难题,但也正是这些难题,激发了人们探索和创新的热情。整个团队会继续怀揣极大热忱投身这一领域,并与秉持严谨态度和长远愿景的各领域专家合作,共同推动AI for Science成为人类认识世界和改造世界的变革性力量。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名