黄仁勋说的PhysicalAI,被这家中国跨界选手带进了生命科学实验室
当AI公司还在读论文,Bio公司已经让AI做完了实验。
没错,又一热门AI赛道,被国产玩家率先跑通了——
AI for Bio,生命科学领域

时至今日,这个赛道几乎挤满了最不缺算力的一批硅谷玩家:
OpenAI发GPT-Rosalind,专攻药物发现和基因组学;谷歌推Co-Scientist和ERA,把多Agent系统塞进科学推理流程;Anthropic上线面向科研流程的Claude Science工作台。
虽然大家想的都是让大模型读完论文后,写个「完美」的实验方案,再真正走进实验室,但奈何现实很骨感:
真正让AI接管实验室并跑通实验的?约等于无
就拿最接近终点的OpenAI和Ginkgo Bioworks的合作来说,GPT-5在那个项目里负责的是实验设计和参数探索,真正在实验台上执行的Catalyst protocols,全部由Ginkgo的人类工程师编写。
换句话说,强如OpenAI,模型也没有真正接触到「做实验」这一层。

△图源:OpenAI官网
不过现在,全球第一个补上这关键一步的来了。
华大智造子公司涌生智能×上海人工智能实验室,联合发布两项新成果
- :一款由真实实验室场景驱动的自进化多智能体系统;
ProtoPilot
- :生命科学领域首个从用户需求到设备可执行的全流程Agent评测体系。
BioLab Bench
从自然语言实验意图到湿实验物理执行,完整闭环,真实验证。
这一次,让AI「真正走进实验室」的不是哪家AI巨头,是一家跨界做AI的中国Bio公司。
这事估计连老黄都没想到:年初他在CES上说,「Physical AI的ChatGPT时刻」到了,说的是机器人和自动驾驶。但现在,
第一个在生命科学实验室交出Physical AI答卷的,来自深圳
AI for Bio,到底卡在哪了
为什么硅谷这帮最不缺算力的玩家,集体卡在了实验室门口?
要回答这个问题,其实只需要弄清楚一件事:
从模型到实验室,这中间到底缺了什么?顶尖模型在手,怎么就跨不过这道坎呢?

让我们从AI for Bio这个赛道的真实进展说起。
过去几年,AI在生命科学领域的应用多聚焦于「理解」和「分析」。文献阅读、知识问答、序列比对、蛋白质结构预测,模型确实博学,但它本质上是个坐在屏幕后面的助理。
它能帮你理解世界,但还没真正进入世界
Agent时代来了之后,事情开始变了。AI不再只满足于回答问题,它开始「设计和行动」。应此潮流,以OpenAI、Anthropic为代表的前沿AI玩家,开始把目光投向更下游、更主动的方向:假设生成、实验设计、参数空间探索、药物发现、蛋白工程、自动化实验。
听起来是不是已经很接近「让AI进实验室干活」了?但现实情况是——还差得很远。
当下AI for Bio最真实的现状就一句话:
能出方案,出不了结果

△图片由AI生成
这中间几乎隔着一整条转换链。ProtoPilot的论文拆得很清楚:一个实验意图要变成湿实验台上的真实操作,需要穿过五层——科学意图、Protocol(方案设计)、SOP(标准操作流程)、设备代码,再到物理执行和反馈修正。而每一层都要解决不同的模糊性,比如Protocol要表达生物逻辑、样本谱系和质控结构;SOP要把逻辑落到可操作的体积、浓度、耗材和温控条件上;设备代码要绑定deck布局、孔位映射、液体处理动作和厂商SDK指令……就这一套下来,只要有任一环节出错,实验就可能失败。
所以,当AI for Bio的竞争从「模型能不能回答生命科学问题」转向「模型能不能走完从屏幕到实验台的全链路」时,行业真正缺的也就浮出水面了。
一块是「铲子」,能接住模型输出、连接专家、设备和湿实验反馈的Bio Agent Harness
一块是「尺子」,能评价Bio Agent真实实验链路能力的benchmark
需要提醒的是,这两件事都不是坐在屏幕前就能凭空设计出来的,它们必须来自真实实验室:真实任务、真实设备、真实约束、真实失败和真实专家判断。
所以现在你明白,为啥两家国产团队选择联手了:坐拥全栈生命科学设备、自动化实验平台、AI4Science经验和丰富真实实验场景的
涌生智能
把最难被复制的「物理底座」和「场景底座」带了进来
上海人工智能实验室
两边一合,沉淀出了ProtoPilot和BioLab Bench
ProtoPilot和BioLab Bench,如何填补行业空白
ProtoPilot和BioLab Bench,具体如何填补行业空白?仔细扒了扒论文,答案渐渐清晰。
ProtoPilot:第三方测评超越OpenAI最强旗舰GPT-5.6 Sol
先说多智能体系统ProtoPilot。
目前AI for Bio赛道上,能打通Design2Protocol、Protocol2Code、设备执行与湿实验反馈验证的系统仍然极少,大多还停留在分段优化阶段,
而ProtoPilot是少数已经实现全链路贯通的代表之一
怎么个「全链路贯通」?举个例子:当你用自然语言对ProtoPilot说「构建8个GLuc突变体」,它就能把这句话拆解成科学合理的Protocol,识别可用设备,转化为可执行的工作流代码,下发到物理设备执行,并根据湿实验反馈持续修正和进化。

注意,这不是聊天机器人,也不是单一设备的脚本生成器。ProtoPilot背后是多个Agent在协同发力:Orchestrator Agent统筹全局工作流状态,Protocol Expert Agent生成实验方案和SOP,Coding Agent将方案转化为设备可执行代码。三个Agent各司其职,逐层推进。通过这种行业主流的「多Agent协同工作」方案,它成功解决了三个过去卡死行业的「老大难」。
第一个,需求模糊
第二个,写得好≠跑得通
第三个,没有反馈闭环
就这几招下去,ProtoPilot能交出下面这份硬核成绩单,真不意外。
做实验第一步,你得真懂实验
别的不说,行业公认「试金石」ProtocolQA总得挑战一下吧。ProtocolQA由AI4S领域的顶级机构FutureHouse推出,是专门考察AI对实验流程理解与故障排查能力的第三方独立benchmark。OpenAI家目前最顶的GPT-5.6 Sol的系统卡中也收录了该benchmark结果。
结果呢?在开放式问答上,GPT-5.6 Sol得分43.5%,距离人类专家54%还有明显差距;
而ProtoPilot拿到了52.38%
ProtoPilot更是取得了85.18%的成绩
在行业公认的第三方考卷上,跑赢OpenAI目前最强的旗舰模型,ProtoPilot的实力不言自明

有了这个大脑,方案生成自然能打
在Protocol任务上,ProtoPilot综合评分94.7(满分100),在所有8个评估维度上几乎全线领跑。参数合理性98.9、方法学一致性97.7、内容完整性98.4,全部碾压通用大模型和专用Bio Agent。

盲评中,三位独立湿实验科学家在不知道系统身份的情况下,70.6%的情况将ProtoPilot排在第一,90.2%的情况将ProtoPilot排在前三。从下图也能一眼看出,ProtoPilot生成的方案普遍更受科学家喜爱。

更关键的是,这个大脑能搞定最难的事。

但光有脑子还不够,还得手脚利索。
考查代码转化和设备执行

跨设备迁移更猛

BioLab Bench:首个从实验意图到设备执行的全链路评测体系
说完了选手,再说考场。
现有的第三方benchmark,比如刚才提到的ProtocolQA,考的还是实验理解和知识问答。但AI for Bio真正要回答的问题,从来不是「你懂不懂实验」,而是「你能不能把实验跑出来」。
这就是BioLab Bench要填的坑,它衡量的核心只有一件事:
系统能不能在真实自动化设备上跑得通

具体而言,BioLab Bench作为该领域首个覆盖从用户需求到设备可执行的全流程Agent评测体系,覆盖理解用户实验意图→Design2Protocol→Protocol2SOP→SOP2Code→设备code→真实实验执行链路
和传统的生物benchmark的区别在哪?以前的考试是做阅读理解,看你懂不懂实验原理,而BioLab Bench考的是真上手——从实验意图到方案、SOP、设备代码,一路到真实执行,全链路打通。而且它还能跨平台检验。同一个任务,换到不同自动化设备上,看Agent能不能适应。说到底,ProtocolQA这类测评考的是「知不知」,BioLab Bench考的是「做不做得到」。
不是纸面分数,是实验台上跑出来的闭环
系统有了,考场也有了,剩下的问题只有一个:
在真实实验台上,能不能跑出结果来?
忙着「搭桥修路」这么久,总得让人看到实际成果。
ProtoPilot用四组递进难度的湿实验给出了回答。(湿实验指真实实验台操作,和纯计算模拟相对应)
第一组是最基础的活儿,在96孔板里接菌培养
第二组加了点难度,做了24个菌落PCR
第三组是真正的分子克隆,质粒构建和定点突变
当然最能体现水平的还是第四组,基于PCA方法的DNA组装




更关键的是,这个系统还会自我修正
显然,这就不是纸面分数了。这是从需求理解、流程生成、自动化执行、结果验证到异常修正的完整闭环,在真实实验台上真刀真枪跑出来的。
一家跨界AI的中国Bio公司,比Claude更先交卷了
系统跑通了,数据打完了,湿实验也验过了。问题只剩下一个:为什么交出这份答卷的,是一家中国Bio公司?
答案想必你已经猜到了,因为做AI for Bio,最稀缺的从来不是模型,是场景和设施
正是在这样的背景下,涌生智能这家公司的出现也就不那么让人意外了:
一家从设备侧生长出来的AI公司,天然比从模型侧空降的玩家,更懂物理世界的语法

△图片由AI生成
涌生智能
当然了,一家成立仅几个月的公司能快速拿出新成果,底气无疑离不开其母公司
华大智造
所以,一切都很清楚了:
涌生智能赢就赢在,他们不是从外部给实验室装一个AI,是从实验室内部长出AI
这是一条和硅谷完全不同的路线。头部AI公司选择scale compute,用更大的算力推高通用模型能力;而涌生智能则从真实实验世界出发,基于国产开源模型,结合自研Bio Agent Harness架构,通过真实实验数据回流与Agent协同驱动系统进化,将任务执行、设备约束、专家反馈与湿实验结果统一纳入训练闭环。路线不同,结果说话。

而这种差异,也很快体现在产品层面:
ProtoPilot和BioLab Bench的能力,已经在向涌生智能的整个产品体系回流,构建起真正的干湿闭环
有意思的是,Anthropic的Claude Science平台瞄准的下一站,正是干湿闭环。

而涌生智能和上海人工智能实验室这次联合发布的,已经是干湿闭环了。一家跨界做AI的中国Bio公司,不仅抢在硅谷前面交卷,更用一条完全不同的路线证明:
Bio公司在自己的场景里用AI做AI,确实比AI公司从外部攻进来更猛
回到开头。年初黄仁勋在CES上说,Physical AI的下一站是机器人和工厂,但物理世界还有一块他没圈到的版图:
全球每天运转的生命科学实验室
涌生智能和上海人工智能实验室的这次联手,释放了一个明确信号:AI for Bio的竞争,正在从「谁的模型更强」转向「谁的闭环更完整」。
这一次,Physical AI真正长在了生命科学实验室里,而不是聊天框里
论文:https://arxiv.org/abs/2606.31763
-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |