开源科学计算框架 OpenFPM 新增 Metal 后端 PR,通过 Clang/HIP-SPIR-V-Vulkan-MoltenVK 让原 CUDA kernel 几乎不改跑在 M3 Pro 上,3D SPH 实测约 10 倍加速。


开源科学计算框架 OpenFPM 新增 Metal 后端 PR,通过 Clang/HIP-SPIR-V-Vulkan-MoltenVK 让原 CUDA kernel 几乎不改跑在 M3 Pro 上,3D SPH 实测约 10 倍加速。
一段原本为英伟达 CUDA 写的计算程序,几乎不改内核代码,就直接跑在了一台搭载 M3 Pro 的苹果设备上——而且不是向量加减那种玩具演示,是在真实的三维流体模拟任务里拿到了约 10 倍加速。
实现这件事的是开源科学计算框架 OpenFPM 新开的「实验性 Metal 后端」PR。先把丑话说前面:
⚠️ 三项必须诚实说明的边界:
- 这是尚未合并的开放 PR(GitHub PR #18,作者 abhinavsns,2026-07-17 开启)。截至撰稿仍未 merge,属实验性,别拿来直接上生产。
- Apple Metal 对双精度浮点支持不足,不适合天气预测、航空航天这类依赖双精度的超算场景。这类活还是英伟达专业 GPU 的主场。
- 目前是单机后端。多机扩展要靠 Thunderbolt RDMA,属于未来工作。
关于网上流传的"GPT-5.6 Sol 6 小时搞定"说法——这只是作者在 X 上的自述,GitHub PR 本身没有任何 AI 助手相关的说明。本文不把它当事实写,你看到类似宣传也请自行打折。
OpenFPM 是一个面向粒子方法和网格方法的并行科学计算框架,官方仓库 mosaic-group/openfpm、项目主页 openfpm.mpi-cbg.de。
过去十几年 GPU 计算高度碎片化——英伟达有 CUDA、AMD 有 HIP、苹果有 Metal,互相不兼容。这个 PR 的核心贡献不是"再写一套 Metal 版本",而是搭了一条转换通道,让原 CUDA/HIP 风格的 .cu kernel 源码保持不变("source of truth"),底层透明地跑在 Apple Silicon GPU 上。
PR 标题是 "Add transparent Metal GPU support through MoltenVK and SPIR-V while keeping existing .cu files as the source of truth",正好说清了链路:
.cu kernel (CUDA/HIP 风格)
│ Clang/HIP 编译
▼
SPIR-V
│ Vulkan
▼
MoltenVK
│
▼
Apple Metal GPU关键点是应用层无感知——开发者没有新增任何 Metal 专用的粒子 API,应用层依然写原有的 CUDA/HIP 风格 kernel 调用,硬件差异在框架内部消化。这实现了真正的"硬件透明"。
PR 里的考验用例是一个复杂度足够的三维 SPH(光滑粒子流体动力学)大坝溃坝模拟,涉及扫描、排序与重排、单元格和相邻列表构建、ghost 粒子交换、归约操作、原子操作等多个模块。
在搭载 M3 Pro 的苹果设备上:
| 后端 | 耗时 | 备注 |
|---|---|---|
| Metal GPU | 约 6 秒 | GPU 利用率接近 100% |
| CPU 顺序计算 | 约 60 秒 | 基线 |
加速比约 10 倍,仅靠换计算后端实现。开发者进一步检查发现,Metal 版本和 CPU 版本得到的物理结果保持一致——这点对科学计算至关重要,光快不准没意义。
粒子存储随粒子数 N 线性增长,邻居搜索等工作量大致是 O(N·k)。目前展示的 10 倍加速是单机后端对比的结果。
未来计划是借助苹果 Thunderbolt 支持的 RDMA 技术实现多机动态负载均衡,但这部分目前还没有落地代码,属于 roadmap。
适合尝鲜:
不适合:
直接看 PR 比看文章更靠谱,作者在 PR 描述里贴了复现步骤:
如果你决定跑,请用 PR 分支而不是 main,并做好"实验性代码随时会改"的心理准备。跑通后,建议先在小规模 SPH 或粒子问题里验证物理结果一致性,再扩大规模——就像 PR 作者做的那样,先确认 Metal 和 CPU 结果对得上,再谈加速比。
如果这个 PR 最终合并,对 Apple Silicon 在科学计算领域的定位会是一个实质性推进:开发者可以保留已有的 CUDA/HIP 投资不被浪费,同时拿到 Mac 上 Metal GPU 的算力。
但同时也请记住前面那三条边界——实验性、单精度、单机。把它当作一个有潜力的方向去跟踪,而不是一个明天就能上生产的方案。

开源 Skill 把 4.7 寸墨水屏变成 AI 驱动的桌面信息中心,自动同步日历、GitHub PR、天气,AI 决定显示什么

Transformer 作者开源首个 Apache 2.0 旗舰模型,2180 亿参数 MoE 架构,单张 B200 可跑,支持 48 种语言和原生引用

Claude 性格对齐团队负责人分享的方法:让 AI 用寓言故事帮你理解任何新概念,附带优化版 Prompt 模板