面壁智能联合OpenBMB开源社区,正式发布全球首个面向Stencil计算的全自动优化与部署AI系统ForgeStencil,实测在真实科学计算场景中最高实现5.78倍加速,为高性能计算领域带来重要突破。
Stencil计算:隐身于万亿次运算中的性能瓶颈
在高性能计算(HPC)领域,Stencil(模板计算)是一种极为基础且广泛使用的计算模式。它像是一张滑动的网格,在每个位置上用周围若干个点的数值更新中心点的数值,模式简单却贯穿于计算流体力学、气象模拟、电磁仿真、核反应堆设计、地质勘探等众多关键科学工程应用。以常见的7点模板为例,一个三维空间网格的更新就涉及自身和6个邻居的数值,而这类计算常常占据整个仿真程序运行时间的80%以上。
然而,Stencil计算的性能优化一直是一个棘手难题。由于不同应用场景的网格形状、访存模式、边界条件千差万别,靠人工为每一种场景定制优化几乎不可能。硬件架构又在不断演进,GPU、新型加速器层出不穷,进一步加剧了优化复杂度。长久以来,开发者只能依赖经验性规则或部分自动调优工具,但效果始终有限,大量算力被白白浪费。
ForgeStencil:从“自动研究”到“自动部署”的AI闭环
ForgeStencil的出现,第一次将Stencil优化的全流程交给AI自动完成。系统构建了一个“自动研究+自动部署”的大闭环:AI不仅能够自动搜索最优的Stencil优化策略,还能直接将优化后的代码部署到目标硬件上运行,无需人工干预。
其核心思路借鉴了近年AI编译器的进展,但将焦点牢牢锁定在Stencil这一特定模式上。系统通过机器学习模型预测不同优化组合(如循环分块大小、向量化策略、内存预取等)的性能表现,并利用强化学习等算法在巨大搜索空间中高效探索。同时,它融合了混合精度计算技术,在保证数值精度的前提下进一步压榨硬件吞吐能力。
公开的实测数据显示,在保持full precision(fp32)的条件下,ForgeStencil相对于主流基础实现的几何平均加速达到2.35倍。当开启混合精度优化后,还能额外获得1.95倍的性能提升。这意味着,原先需要3天才能完成的仿真,现在可能不到1天就能跑完,且精度丝毫不受影响。
真实应用验证:从3.86倍到5.78倍的跨越
更令人信服的是在真实世界应用中的表现。团队选取了三种具有代表性的科学计算软件进行验证:通用CAE求解器hypre、电磁仿真时域有限差分(FDTD)程序,以及核反应堆中子学输运计算程序minisweep。在hypre中,ForgeStencil带来了3.86倍的加速;在电磁仿真FDTD中达到2.47倍;而在计算强度极高的minisweep上,加速比最高狂飙至5.78倍。
minisweep代表着极端复杂的Stencil场景,涉及多群中子输运方程的求解,计算密集且访存压力巨大。5.78倍的加速意味着原本需要运行数周的关键核安全仿真,现在可能在一周内完成,这对缩短工程设计周期、加速创新迭代具有直接且巨大的价值。这些数字并非来自孤立的小测试,而是嵌入到完整软件栈中的真实加速,证明了ForgeStencil的工程鲁棒性。
行业意义:AI for Science走向务实落地
ForgeStencil的发布,表面上是一次性能优化工具的升级,更深层地看,它标志着AI for Science正在从“精妙算法”阶段迈向“务实工程”阶段。过去,AI更多被用来发现新物理、预测分子性质,而ForgeStencil直接切入到科学计算的基础设施层,用AI自动提升千千万万研究人员每天都在使用的仿真软件的运行效率。这种“底层推动”的影响力更为广泛且立竿见影。
同时,开源策略也极为关键。面壁智能与OpenBMB开源社区合作,将系统完整开放,允许全球开发者、研究机构和工业用户自由使用、修改和集成。这不仅降低了高性能计算优化的门槛,也意味着Stencil优化方案可以快速在气象、能源、制造、药物研发等众多行业扩散,形成持续的社区贡献生态。对于国产算力平台而言,自动获得性能优化也是提升竞争力的一条捷径。
长远来看,ForgeStencil的思路或许能扩展到更广泛的循环优化模式中,成为AI编译器的标准组件。当AI学会了自动优化Stencil,下一步就是自动优化张量运算、稀疏计算,乃至整个科学计算栈。AI不仅在做科学,更在让科学做得更快。