OpenAI报告展示AI科研工程师进入实验室:智能体参与真实的科学开发流程
编辑丨

过去几十年,科学计算的发展几乎完全依赖于软件。从基因组分析到蛋白质结构研究,再到物理模拟和数据处理,科研人员每天使用的工具,都建立在复杂软件的基础上。但这些软件有一个长期存在的痛点:它们很重要,却很难维护。
许多关键工具通常只是由少数几位开发者在维护。随着编程语言、硬件和计算需求不断演进,那些陈旧的代码逐渐成为科研发展的瓶颈。想要重写这些软件,往往需要投入大量的工程时间,而传统的开发方式又很难同时兼顾准确性、高性能和长期维护。
OpenAI 近期发布了一份名为《Scientific Computing in the Age of Agentic AI》的报告,尝试探索一个全新的可能性:如果让具备自主编码能力的 AI 智能体参与到科研软件开发中,它能否帮助研究人员完成那些过去难以承担的工程任务?
这份报告涵盖了八个主要涉及生命科学领域的智能体辅助科学计算项目。其中五个项目仅使用了 Codex,另外三个则结合了 Codex 和 Claude Code。报告汇集了各项目团队撰写的案例研究,并总结了反复出现的主题,详细描述了从常规维护和针对性优化,到大规模语言迁移和 GPU 原生重新设计等不同层次的工作。
原文链接:https://openai.com/index/scientific-computing-agentic-ai/#case-study-helixforge
科研软件最大的难题
在普通软件开发中,代码能跑起来,往往就代表了一部分成功。但科研软件完全不同。对于科学计算工具来说,最重要的反而是前后的一致性。
图示:案例研究项目概述。
以 RNA 测序分析中的 STAR 比对工具为例。这是一款被广泛使用的基因组分析软件,但由于原始项目长期缺乏维护,研究人员希望用 Rust 语言重新实现一个更现代、更易于维护的版本。
当然,这并非简单的语言转换。STAR 的原始代码超过 2 万行,涉及复杂的数据结构、算法实现,以及大量隐藏的行为。如果重新实现后的工具只是在多数情况下“差不多”,那么对于依赖它的科研流程来说,这种误差是无法接受的。
因此,团队没有采用自动代码转换,而是让智能体辅助从零开始重写。研究人员负责制定架构选择、测试策略以及验证标准,智能体则负责大量的实现和迭代工作。说到底,最终判断哪些结果是真正正确的,还是得靠人。
图示:八个智能体编码案例研究的总结。
最终,rustar-aligner 在结果一致性上几乎做到了与原始STAR平分秋色。在单端 RNA-seq 测试中,tie-adjusted parity 达到 99.815%;在双端 RNA-seq 测试中达到 99.883%;同时没有出现仅由某一个工具比对成功的 reads,suffix array 甚至实现了字节级的完全一致。另一个项目 SVB 重新实现了已建立的纳米孔数据压缩编解码器,运行速度是最广泛使用的现有工具的 1.7-2.9 倍,其中 VBZ2 双链解码相比传统三阶段流程提升了约 2.32 倍。
反复出现的主题
在多个案例研究中,一个反复出现的主题是:智能体能够有效处理具体且范围明确的请求,但无法可靠地判断自己的工作是否具有科学有效性或是否符合预期。事实上,即使智能体的工作存在明显错误,它们也常常表现出对自身推理过程或结果的十足自信。
因此,人工评审需要找到可靠的方法来验证结果。最有效的方法是采用外部参考或可衡量的接受标准,例如输出完全一致、与现有工具的对齐程度、合理的统计行为,或者使用模拟数据预先确定的答案。
另一个反复出现的主题是,项目通常采用基于反馈的迭代方式分阶段推进,而不是一次性完成。贡献者会将总体目标拆解为较小的改进任务,然后通过中间基准和测试系统来评估并优化智能体的工作。智能体往往能快速实现初步版本,但解决边缘情况和细微的数值差异则耗时更长。完成实现过程中的“最后一公里”,通常需要投入最多的工作量。
长期管理的必要性
从报告中的项目来看,智能体在科学计算中的价值已经开始显现。它可以帮助研究人员:
重写长期维护困难的软件;
探索传统方式难以尝试的优化方案;
扩展科研工具的功能边界;
缩短从想法到可用软件之间的距离。
但科学计算与普通软件最大的区别在于,结果必须可信。这使得长期管理与责任归属变得至关重要。成熟的科学软件包含未记录的惯例、兼容性要求以及用户信任,而仅靠翻译源代码是无法重现这些内容的。
在报告提及的案例中,MHCflurry 和 cyvcf2 的修改已整合到其原有的上游项目中,而 rustar-aligner 由于原项目已被弃用,转由新的社区负责管理。OpenAI 提示,在可与现有维护者协调的情况下,应尽早开展合作。当需要独立实现时,必须明确负责人并制定可信的维护计划。否则,今天完成的现代重写,可能会演变为明天被废弃的代码,而非可靠的科学基础设施。
从长期来看,编码智能体的价值仍在于人类在“应构建什么”、“如何验证”以及“由谁维护”等方面所做的决策。更深层次的变革不仅在于研究人员能够开发出更多软件,更在于他们可以将更多精力投入到工具的定义、验证和管理之中。
报告链接:https://cdn.openai.com/pdf/scientific-computing-in-the-age-of-agentic-ai-an-exploratory-field-report.pdf