郭震 AI公众号:郭震AI

实时 AI 消息

DeepSeek开源昇腾基础组件:TileLang、DeepGEMM与DeepEP同批落地

9月30日,DeepSeek正式开源面向昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库,与此前面向GPU平台开源的组件一一对应。本次开源包括DeepGEMM、FlashMLA、TileKernel、DeepSelect等昇腾算子库组件和DeepEP通信库,华为同期把大EP低延时推理部署等联合创新成果在CANN社区开源。

发布时间

据量子位报道,9月30日,DeepSeek正式开源面向昇腾算力平台的基础设施组件,涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库,与此前面向GPU平台开源的组件一一对应。报道称,这件事对中国AI软件生态具有里程碑意义,为算力平台提供了新的选择。

本次开源的具体内容,包括DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能昇腾算子库组件,以及DeepEP分布式通信库。也就是说,DeepSeek在GPU侧已经跑通的一整套性能组件,正在被系统性地搬到昇腾平台上。

在工具链层面,昇腾提供稳定、开放的Ascend C API接口,使用户可以对访存路径及计算流水线进行深度调优,完成高性能算子开发;同时依托开放的Ascend C编程接口与PTO ISA底层指令体系,支持了DeepSeek的TileLang编程开源工作。这套生态兼顾不同开发范式,既支持资深开发者进行精细的手工调优,也支持TileLang等高级语言的编译对接。

硬件与组网侧,华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换的Scale-up网络和256K卡两层交换的Scale-out网络,用以支持超低时延推理和前沿基座模型的大规模训练。基于全互联的UBL128超节点,昇腾还提供ASC-COMM高性能自定义通信编程库,支撑用户通信算子与通算融合算子编程。

通信是这次开源的另一个重点。DeepSeek团队开发的高性能DeepEP通信库,涵盖EP、CP、PP、FSDP等模式下的通信算子,为更大模型向更大集群扩展提供支持,实测互联带宽达到Dispatch 375 GB/s、Combine 347 GB/s,接近硬件上限。

为了让开发者能在昇腾950及超节点集群上部署DeepSeek模型,华为将此次联合创新的成果在CANN社区开源,覆盖大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。其中面向大规模推理场景,基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash不带框架的纯模型性能可实现TPOT=5ms时每卡输出吞吐2469 tokens/s,TPOT=10ms时每卡输出吞吐5102 tokens/s。

报道同时说明,上述Benchmark数据均基于offline推理模式采集,不包含Serving调度和框架负载均衡的影响,上下文长度为128K,Dspark投机接受率为0.85。需要指出的是,这篇内容由华为提供、量子位获授权转载,属于厂商视角的口径,但它也从侧面说明,芯片厂商与模型团队正以开源协作的方式争取开发者对国产算力软件栈的信心。

真正的看点在"芯模协同"这条路线本身:当头部模型团队把训练、推理、通信算子和编译工具同时开源到某个国产算力平台,模型迁移和调优的成本会明显下降。接下来可以观察这些组件在CANN社区的迭代速度,以及是否会有更多模型团队跟进,把核心算子库同步到昇腾平台。

为什么重要

这次开源把DeepSeek在GPU侧验证过的算子与通信组件搬到了昇腾平台,为国产算力提供可用的软件栈底座。对行业而言,头部模型团队与芯片厂商深度绑定的模式,可能加速开发者从CUDA生态向昇腾等国产平台的迁移。

微博邮件

DeepSeek华为开源算力
返回实时消息

附近消息

全部