发生了什么
9 月 30 日,DeepSeek 在其官方 GitHub 组织下开源面向华为昇腾 NPU 的底层组件。此前其 DeepGEMM、DeepEP、FlashMLA 等库只面向英伟达 GPU;本次新增的 DeepGEMM-Ascend 与 DeepEP-Ascend 均与英伟达版本 API 对齐,采用 MIT 许可。据公告及媒体报道,本次开源成套组件,与英伟达平台版本一一对应。
- DeepGEMM-Ascend:昇腾矩阵乘库,兼容 DeepGEMM 的 API 与包名,支持 BF16、FP8、FP4 GEMM、MQA logits 与 MegaMoE 算子。
- DeepEP-Ascend:昇腾 MoE 专家并行通信库,提供 dispatch 与 combine 的 all-to-all 与延迟 epilogue,buffer API 与英伟达版对齐;另提供流水线并行、Bucket 集合通信与 Engram 远端内存访问,后三项为实验性。
- 配套更新:同日 TileKernels、FlashMLA、DeepSelect 等算子库同步更新;DeepJIT 与 clangd-ascend 两个昇腾新仓库近日建立。
- 编译层:TileLang 上游同日宣布正式支持昇腾 950 NPU,提供原生代码生成与自动调度。
官方测得的性能
数据均在昇腾 950DT 配合 CANN 9.20 下实测,算子形状取自 DeepGEMM 测试集,覆盖 DeepSeek 模型系列负载。
- DeepGEMM-Ascend:面向 MoE 专家的分组 GEMM(FP8×FP4 输入、BF16 输出)在多组形状下达 831 至 862 TFLOPS;融合 dispatch、两次分组 GEMM、SwiGLU 与 combine 的 MegaMoE 峰值约 846 TFLOPS。
- DeepEP-Ascend:EP8 下 dispatch 373 至 375 GB/s、combine 345 至 347 GB/s;EP128 下 dispatch 313 至 320 GB/s。官方称 EP 不超过 32 时,持续分发带宽接近物理载荷带宽上限的 90% 至 95%。
为什么重要
过去两年国产算力的公开叙事是推理能用、训练不敢全押,痛点不在单卡算力,而在 CUDA 十余年积累的算子、通信与编译栈。本次开源把 DeepSeek 自己训练中真正使用的底层工具延伸到昇腾:按其公告口径,训练所用的每个 TileLang 算子在昇腾上都有对应实现,双方还共同推进昇腾 950 的 128 卡超节点方案。对企业选型而言,国产平台第一次补上训练栈级软件层,而不再只是把训好的模型搬来跑推理。
不确定之处
- 性能数字均来自开发方一侧,暂无第三方复现;新仓库社区规模尚小。
- DeepEP-Ascend 的实测使用一套仅提供给 DeepSeek 的 PoC 硬件配置并附带手工调参,并非公开发布版本;官方建议以华为第三季度商用 HDK(面向 Atlas 850E,约 10 月 15 日发布)为公开部署基线。
- 官方明确其他昇腾世代或 CANN 版本的内核支持尚未通过测量确认。
- 一一对应等表述均为 DeepSeek 公告口径,本文未能逐项核验全部仓库。

