ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统
来源:互联网
时间:2026-08-04 22:13:36
ForgeStencil是什么
先说说ForgeStencil是什么。这是面壁智能联合OpenBMB开源社区推出的一个AI优化系统,号称全球首个支持Stencil自动研究、自动部署的系统。它的核心是两个智能体——Kernel Agent和App Agent——形成一个闭环,能从优化策略的发现一直干到真实生产软件的集成,全程不需要人插手。效果怎么样?一周之内,它完成了100多个工业与科学计算软件的端到端优化,中位加速1.41倍,覆盖油气勘探、电磁仿真、医学影像等8大工业领域和5大科学领域。这可不是纸上谈兵,而是实实在在跑出来的数据。

ForgeStencil的主要功能
- :Kernel Agent 负责研究并合成高性能 CUDA Kernel,App Agent 则搞定热点定位、算子锻造、正确性验证和应用集成,分工明确,自动配合。
双 Agent 闭环优化
- :Agent 不是在一个固定的搜索空间里瞎转,而是自主探索分块、融合、布局、占用率甚至主机端重构这些优化策略——说白了,它自己会“想办法”。
自动策略发现
- :直接面向生产级软件优化,以应用自身的GPU代码为基线进行端到端验证,而不是用那些简化的Benchmark糊弄事。
真实应用部署
- :通过一个单一的环境开关,在原始路径和优化路径之间来回切换,用程序自带的检查和计时器,确保加速比真实可信,没水分。
可审计测量协议
- :支持A100、H100、B200这些GPU,同一套代码库会根据架构自动选择最优的Kernel路径,省心。
跨代 GPU 适配
ForgeStencil的技术原理
- :Kernel Agent 负责理论层面,通过Plan→Code→Profile这个循环,自主研究并合成逼近硬件物理极限的Stencil算子;App Agent 负责工程落地,定位应用性能热点、建立GPU基线、调用Kernel Agent构建的算子矩阵知识库,锻造出应用专属的优化方案,最后完成正确性验证和集成。两个Agent一研究一落地,配合默契。
双 Agent 协同架构
- :Kernel Agent 在优化过程中不断构建专用的算子矩阵作为知识库,后续App Agent可以直接复用已有技术。多个并行Agent共享这个知识库,经验实时共享、集体同步进化——这就突破了人类专家经验难以规模化传递的瓶颈。说白了,一个Agent学会的,所有Agent都能用。
算子矩阵与知识库进化
- :测量以应用自身的生产级GPU实现为唯一基线,原始路径和优化路径只通过一个
可审计端到端协议
USE_OURS开关区分,而且原始路径与上游代码字节一致。使用程序内置的正确性检查和计时器,多轮交错运行后取中位数,最后报告所有标准用例的几何平均加速比。这套机制从系统层面杜绝了造假空间。 - :不捆绑任何第三方的源码,每个应用只提供上游出处记录、获取脚本和集成补丁,通过
Patch 模式与零源码捆绑
vendor.sh自动拉取指定版本的上游代码。这样既保证了许可证清洁,结果也完全可复现。

如何使用ForgeStencil
- :先把仓库克隆下来,确保手上有NVIDIA GPU(A100上验证过)、CUDA 12.x、C++17编译器以及Python 3.9+环境。这些是基础门槛。
环境准备
- :想试试单算子效果?跑一行命令
快速体验算子
python tools/run.py --stencil star_1 --shape 256 --gpu 0,一分钟内就能测出性能,还能跟Halide基线对比。 - :进到目标应用目录,执行
端到端复现
./vendor.sh拉取上游源码,应用集成补丁后,再跑python ../../harness/run_e2e.py --app,就能完成真实应用验证。--gpu auto - :参考
驱动 Agent 工作
agents/README.md配置好,然后启动Kernel Agent和App Agent的自主优化循环,剩下的交给它们。 - :通过
查阅结果注册表
results/integration_registry.json可以查看100个已验证应用的审计加速比数据,一目了然。
ForgeStencil的核心优势
- :从应用分析、热点定位、Kernel锻造到集成验证,全流程自动化,HPC专家可以歇着了。
零人工介入
- :直接优化生产级工业软件,42%是真实工业生产软件,基线就是应用自身的GPU代码,不是玩具。
真实场景导向
- :以前优化一个应用可能需要好几个月,现在一天内搞定。一周完成100多个应用,相当于省下了20-30人年的研发投入。
研发效率飞跃
- :端到端中位加速1.41倍,43%的应用达到1.5倍以上,算子级几何平均2.16倍领先最优开源基线。这成绩相当硬核。
性能表现强劲
- :支持多代NVIDIA GPU运行时分发,架构升级时自动重锻Kernel,捕获新硬件特性,不怕过时。
跨架构可持续
ForgeStencil的项目地址
- :https://github.com/OpenBMB/ForgeStencil
GitHub仓库
ForgeStencil的同类竞品对比
| 维度 | ForgeStencil | Halide |
|---|---|---|
| 优化策略来源 | Agent 自主发现新策略,非固定空间搜索 | 人类设计 DSL 与调度策略,自动化受限于预设规则 |
| 部署范围 | 支持真实应用端到端集成与验证 | 主要面向单算子/图像处理管线,缺乏应用级自动部署 |
| 基线对比 | 以应用自身生产 GPU 代码为基准 | 通常以简化参考实现或 CPU 版本为基准 |
| 正确性验证 | 使用程序自带检查,交错测量确保可信 | 依赖框架内置测试,无系统级防造假协议 |
| 知识积累 | 多 Agent 共享算子矩阵知识库,经验可复用 | 优化经验分散于各专家,难以规模化传递 |
ForgeStencil的应用场景
- :优化RTM逆时偏移、道达尔mini-app等核心算法,加速石油勘探数据处理流程。
油气地震勘探
- :提升gprMax/FDTD等Yee网格Maxwell方程求解效率,服务于雷达与芯片电磁分析。
电磁仿真设计
- :加速非笛卡尔MRI重建、数字乳腺断层成像反投影等医疗影像计算负载。
医学影像重建
- :优化大气动力学、宇宙学模拟等Stencil密集型科学计算应用。
气候与天体物理
- :为QuantLib等金融机构定价库提供Stencil热点自动优化,降低交易计算时延。
量化金融计算