双Agent零人工介入:ForgeStencil如何一周优化百款工业软件

1 阅读

在现代工业体系与前沿科学研究的宏大叙事中,高性能计算(HPC)软件构成了隐形的数字基石。无论是预测极端天气的气象模型,还是勘探地下油气资源的地震波模拟,亦或是研发新型材料的分子动力学仿真,这些应用的底层逻辑往往指向同一个核心计算模式——Stencil(模板)计算。这种计算模式的本质,是通过网格点及其邻居的加权组合,反复刷新整个多维网格数据。然而,正是这种看似简单的数学操作,成为了制约计算效率的最大瓶颈。

Stencil计算具有极高的访存密度,其性能表现往往被内存带宽牢牢锁定,而非计算单元的峰值能力。在许多大型科学应用中,Stencil部分消耗了超过一半甚至更多的运行时间。过去,要将这类代码优化至硬件物理极限,必须依赖极少数具备深厚底层知识的HPC专家。他们需要手动调整循环展开、数据预取、线程映射等复杂参数,这不仅耗时漫长,且难以在不同硬件架构间迁移。随着算力需求的指数级增长,这种依赖“手工作坊”式的优化模式已无法适应规模化工业软件的发展需求。

面对这一行业痛点,面壁智能联合OpenBMB开源社区推出的ForgeStencil系统,提供了一种颠覆性的解决方案。作为全球首个支持Stencil自动研究与自动部署的AI优化系统,ForgeStencil的核心创新在于引入了“双Agent”驱动机制,实现了从代码分析到最终部署的全流程零人工介入。这标志着HPC优化领域从“辅助工具”向“自主智能体”的关键跨越。

ForgeStencil的架构设计巧妙地分离了“科学研究”与“工程落地”两个维度,分别由Kernel Agent和App Agent承担。Kernel Agent扮演着“算法科学家”的角色,它的任务是在抽象层面探索最优的数学表达与代码实现。针对主流的Stencil类型、不同的网格形状(Shape)以及精度要求,Kernel Agent能够自主构建专用的算子矩阵。它不仅仅是在现有模板中进行选择,而是能够根据目标硬件的特性,合成出逼近硬件极限的高性能Kernel代码。这种能力使得系统能够处理包括固定系数、变系数以及复杂边界条件在内的多种计算场景。

与此同时,App Agent则是一位严谨的“工程实干派”。它的职责是将Kernel Agent生成的通用算子,精准地嵌入到具体的真实应用程序中。App Agent负责自动分析待优化应用的源码,定位其中的热点函数,建立GPU基线性能指标,并执行严格的正确性验证。更重要的是,它利用应用自带的测试用例进行端到端的性能评测,确保优化后的代码不仅在微基准测试中表现优异,更能在实际业务负载中稳定运行。这种分工协作机制,有效解决了传统自动调优系统难以兼顾通用性与特定应用兼容性的难题。

在实际性能表现上,ForgeStencil展示了惊人的效率。据披露,该系统仅用一周时间便完成了100多个真实工业和科学计算软件的自动优化,将单个应用的优化时长从数周压缩至小时级,研发效率提升了约100倍。在与Halide、Devito、EBISU、DRStencil、FlashFFTStencil等知名框架的同台竞技中,ForgeStencil在单精度(fp32)下取得了2.35倍的几何平均加速。若进一步启用混合精度(fp16)读写技术,还能额外获得1.95倍的提速。即便是在公认最难优化的变系数Stencil全Shape场景下,相比当前最优基线,它仍保持了1.34倍的几何平均加速优势。

更为重要的是,ForgeStencil并未停留在理想化的基准测试(Benchmark)层面,而是深入到了真实的工业生产场景中。数据显示,约42%的优化案例直接对应着真实的工业生产负载。例如,在结构化多重网格求解器库hypre中,系统实现了3.86倍的加速;在核反应堆中子学输运模拟软件minisweep中,加速比高达5.78倍。此外,在电磁仿真软件gprMax与FDTD中加速2.47倍,在油气地震成像的逆时偏移(RTM)中加速1.81倍,在道达尔能源的mini-app中加速1.22倍,在金融债券定价库QuantLib中加速1.82倍,以及在非笛卡尔MRI重建和数字乳腺断层成像中分别加速2.45倍和1.63倍。

这些数据背后,是石油公司、医疗设备制造商、气象部门等关键行业对算力效率的迫切需求。以地震成像为例,更高的计算速度意味着更高分辨率的地下结构图像,从而直接提高油气勘探的成功率。在医疗影像领域,更快的重建速度能够缩短患者等待时间,提升诊断效率。ForgeStencil的出现,使得这些存量工业软件无需重写底层代码,即可通过自动化优化获得接近硬件极限的性能释放,极大地降低了企业的算力成本和研发门槛。

从技术演进的视角来看,ForgeStencil代表了软件工程范式的一次重要升级。继ForgeTrain之后,面壁智能基于Forge Engineering理念,将AI的能力从单纯的代码生成拓展到了自动研究优化领域。传统的人类专家经验往往局限于个体头脑中,难以共享和复用,而ForgeStencil通过让大量并行Agent共用一个知识库,实现了经验的实时互通与集体同步进化。这种“群体智能”的模式,使得系统在面对新硬件、新算法时,能够快速积累优化策略,形成正向反馈循环。

此外,该系统的开源策略也为HPC生态注入了新的活力。通过向全球学者、工业软件从业者和开源开发者开放,ForgeStencil有望吸引更多贡献者共同完善其算子库和优化策略。这种开放协作的模式,有助于打破国外商业软件在高端工业仿真领域的垄断,为国产制造业的数字化转型提供强有力的底层技术支持。

当然,全自动优化也面临着挑战。例如,如何处理极度复杂的非规则网格计算,如何保证在极端规模并行下的数值稳定性,以及如何进一步降低AI模型本身的训练与推理开销,都是未来需要持续探索的方向。但不可否认的是,ForgeStencil已经证明了AI在底层系统优化领域的巨大潜力。它不再仅仅是一个辅助工具,而是一个能够独立承担复杂工程任务的智能主体。

长远来看,当CAE仿真、地震成像、电磁与流体计算等高端装备研发的数字底座被自动化优化技术全面赋能,国产制造业的升级进程将被按下加速键。这不仅关乎计算速度的提升,更关乎国家在关键工业软件领域的自主可控能力。随着算力规模的不断扩大和应用场景的日益复杂,像ForgeStencil这样能够规模化、自动化释放硬件潜力的系统,将成为连接算法创新与工业实践的关键桥梁。

对于开发者而言,这意味着可以将更多精力投入到高层算法设计与业务逻辑创新中,而不必深陷于底层性能调优的细节泥潭。对于企业而言,这意味着能够以更低的成本获取更高的计算效能,从而在激烈的市场竞争中占据优势。ForgeStencil的开源,不仅是技术的共享,更是行业协作新模式的一种探索。它提示我们,在人工智能时代,软件工程的边界正在被重新定义,而自动化与智能化将是通往未来的必经之路。