国产算力Day-0适配:摩尔线程MTT S5000跑通DeepSeek V4.1 Flash

来源:互联网 时间:2026-09-12

9月11日,摩尔线程宣布,基于MTT S5000 AI训推一体智算卡和自研MUSA软件栈,已完成对DeepSeek新一代原生多模态大模型DeepSeek-V4.1-Flash的适配,实现了对该模型的Day-0支持,也就是模型发布当天就能在国产算力卡上跑起来。同时,国家超算互联网平台已上线该模型的API服务与权重文件,企业、科研机构和开发者可以下载权重,做二次开发和本地部署。

先看这个模型的分量。DeepSeek-V4.1-Flash是一个5520亿参数的MoE(混合专家)模型,采用了全新的Causal-Encoder-Decoder非对称架构:输入侧激活参数约80亿,输出侧约160亿。这种“两边不对称”的设计,思路是在保住模型能力的同时压低推理成本——真正参与计算的那部分参数被控制住,部署门槛随之下降。据披露,它在部分核心指标上超过了此前的旗舰模型V4-Pro。

摩尔线程这次适配,路径上有几处值得看。第一,它直接对接SGLang官方主线。MUSA已经成为SGLang的官方后端,这意味着国产算力卡可以复用开源推理框架的模型定义、调度逻辑、服务接口和多模态输入处理管线,不用为每个新模型从零写一套适配代码,从模型发布到服务拉起的周期被大幅缩短。第二,它复用了已有基础设施。摩尔线程此前已完成DeepSeek-V4相关算子、缓存、通信和运行时的建设,在多模态适配上积累过视觉编码、图文预处理的经验,所以面对V4.1-Flash,主要工作是补齐新架构的差异、关键路径和多模态链路,而非从零开始。第三,针对新引入的算子,它用了多渠道并行的方式补:有的跟随官方主线快速适配,有的用于快速建立正确性基线,有的负责持续迭代关键算子性能。

能力上,这次适配同步支持了V4.1-Flash的原生多模态能力。依托SGLang主线的多模态接入路径和MUSA在视觉编码、图文处理链路上的适配,图文混合输入、图像理解、视觉问答、图表解析等任务,都可以在MTT S5000上直接运行,无需额外拼装视觉模型。

后续优化方向也已经列出,包括融合内核、FP4精度的KV Cache、长上下文内存管理、算子调度和图模式,以及Prefill/Decode分离等。这些优化逐步落地后,模型在国产卡上的性能还会继续释放。

为什么Day-0适配值得单独说?因为在大模型时代,一款新模型发布后能不能第一时间在某种算力上跑起来,直接决定了这条算力路线是否“可用”。适配慢一步,开发者和企业就会先流向适配更快的平台。这次国产智算卡能在模型发布当天完成权重加载、推理服务启动和文本问答验证,说明国产算力在软件栈和开源生态的对接上,已经从“事后追赶”走到了“同步跟进”。对那些希望把大模型私有化部署、又不希望被单一生态锁定的团队来说,多一个可选的国产算力底座,等于多一分议价空间和自主权。

相关文章

标签:

A5创业网 版权所有