A5站长网10月5日消息,DeepSeek开源了面向华为昇腾平台的一整套组件,包括TileLang高级语言、DeepGEMM矩阵运算库、DeepEP通信库、TileKernels、FlashMLA稀疏注意力和DeepSelect六个项目。和英伟达版本一一对应,这是它自己训练V4系列模型时在用的那套底层工具。这次开源里最有信息量的不是代码,是仓库README里那张性能表。
表里的数字来自昇腾950DT NPU,实测环境是CANN9.2.0、手动配置的PoC固件包,跑的是超节点对外的Clos网络。配置写得很具体:每rank容量16384token,隐藏维度7168,256个专家里选6个,dispatch用FP8,combine用BF16,每个rank预热10次采样50次并清缓存。EP规模从8到128,每一档都给了区间。
EP8是最好的一档:dispatch达373到375GB/s,combine达345到347GB/s。往下递减,EP16是348到352和338到341,EP32降到335到340和320到324,EP128只剩313到320和272到278。官方给的结论是EP不超过32时,持续dispatch能达到物理载荷带宽上限的九成到九成五。规模再往上以及combine这一侧还在优化,理由是combine多了本地规约开销,以及和URMA之间的HBM资源争抢。
这里有件容易被跳过的事:这些数字跑在华为给DeepSeek的PoC固件包上,需要额外手动配置,不是公开发布的版本。仓库README里明确写了,商业版HDK在Atlas850E上预计2026年10月15日左右公开,现在拿到的用户带宽可能更低,建议先查自己的HDK版本和配置。官方还提醒,这些数据不是从那个未发布的商业版上测的。
华为侧同步披露了一组超节点数据。双方联合定义了昇腾超节点SuperPoD Flex和UBL128组网方案,128卡实现3.2Tbps的单层交换Scale-up网络,两层交换的Scale-out网络可以扩到256K卡。基于这个全互联的UBL128超节点,华为提供了ASC-COMM自定义通信编程库,支撑通信算子和通算融合算子。
推理性能也有一组数:EP32部署策略、128K上下文、offline模式下,DeepSeek-V4.1-Flash在不带框架的纯模型性能上,TPOT等于5毫秒时每卡输出吞吐2469tokens每秒,TPOT等于10毫秒时到5102tokens每秒。这个口径明确排除了服务调度和框架负载均衡的开销。联合成果都以recipe形式放进了CANN社区,覆盖大EP低时延推理、单卡单机部署、大规模训练、超长文本KV Cache池化和Agentic RL五个方向。
A5创业网 版权所有