DeepSeek开源昇腾版TileLang:训练里的每个算子都有昇腾实现

来源:互联网 时间:2026-10-02

A5站长网10月2日消息,DeepSeek宣布开源面向华为昇腾算力平台的基础设施组件,其中打头的是TileLang高级语言编译工具的昇腾版,同时放出的还有计算库与分布式通信库。DeepSeek的说法是,这批组件与它此前为英伟达平台开源的组件一一对应,昇腾这边的开发者拿到的是一套对称的工具,而不是另外一套需要重新学习的东西。

要理解这批组件的分量,得先看TileLang在英伟达平台上做到了什么。DeepSeek在开源说明里给的理由是,要建一套完整的GPU软件生态,第一步得先有一个通用、好写、又能把硬件性能吃满的高级语言。对比英伟达的CUDA,TileLang的编程门槛更低,代码逻辑更简洁;对比其他同类高级语言,它的编程模型能充分调用芯片特性。这条路线先在英伟达平台上跑通,目前已经承载了V4系列模型训练中大部分算子的实现。

昇腾版做的是封装。它把昇腾Ascend C的底层指令包了一层,让开发者用高级语言的写法去做事,同时不损失硬件性能,这正是TileLang设计的初衷。DeepSeek在说明里强调,目前训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。这句话的分量在于普适性:不是挑几个算子做了适配,而是整个算子集合都落到了实处。

与编译工具一起开源的是昇腾平台的核心计算与通信组件。DeepGEMM负责通用矩阵运算加速,DeepEP处理大规模跨设备通信,TileKernels提供数据处理需要的常规向量计算与访存算子,FlashMLA做的是稀疏注意力、针对长上下文场景,DeepSelect负责高效数据筛选。官方口径是,在多项关键测试用例中,这些组件的计算与通信性能已经接近硬件上限。

昇腾侧的适配不是单方面完成的。DeepSeek透露,研发过程中华为团队给予了大力支持,双方共同推进基于昇腾950的128卡超节点方案,并对计算与通信做了深度优化。开源说明里还有一句表态:希望TileLang昇腾版能对其他AI芯片建立可用软件生态起到示范作用。

把这件事放到国产算力的位置上看,它补的是软件那一环。芯片要真正被用起来,光有算力不够,还得有让开发者愿意写的编程抽象和拿得出手的算子库。DeepSeek的路径不是另起一套封闭栈,而是复用此前为英伟达开发的组件再做可移植适配,这对使用方来说迁移成本更低。需要保留判断的是,CUDA近二十年积累的广度远不止几个内核,这套方案能不能真正改变开发者的使用习惯,现在还没有答案。

相关文章

标签:

A5创业网 版权所有