实时 AI 消息
零GPU跑通DeepSeek满血版:国产超算"灵晟"纯CPU推理,16节点顶80张显卡
据报道,全球排名第一的国产超算"灵晟"完成了纯CPU架构下的MoE模型分布式推理部署,仅用16个计算节点即可流畅运行DeepSeek-V3/R1-671B满血模型,在batch_size=2048时输出吞吐量与80张主流GPU集群相当。这是纯国产CPU架构首次在大模型推理领域与GPU集群正面抗衡。
大模型推理"必须用GPU"的传统认知正被打破。据报道,全球排名第一的国产超算"灵晟"成功完成纯CPU架构下的MoE模型分布式推理部署,仅用16个计算节点即可流畅运行DeepSeek-V3/R1-671B满血模型。
在并发数batch_size=2048时,该超算的输出吞吐量与80张主流GPU组成的集群相当。这意味着纯国产CPU架构首次在大模型推理领域实现了对GPU集群的正面抗衡。
灵晟超算最独特之处在于其纯CPU架构路线:它没有采用堆砌GPU或专用加速卡的传统方案,而是在自研的LX2 CPU中直接集成了矩阵加速单元,支持多精度计算,让每颗CPU都能同时处理超算科学计算与AI推理任务。
这种片上融合的设计消除了CPU与加速卡之间数据搬移的开销。不过计算能力只是第一步,大模型推理的真正瓶颈在于内存带宽——模型参数需要频繁在计算单元和内存之间搬运。为此,LX2 CPU集成了首颗国产高带宽内存(HBM),总带宽达4TB/s,相比传统CPU内存带宽提升10倍。
搭配自研的"灵启"高速网络,该超算支持微秒级时延与10万节点组网,扫清了计算、带宽和通信三大障碍。
这一进展对国产算力生态意义重大:纯CPU路线为大模型推理提供了另一条不依赖GPU的国产化路径,也让"大模型算力不看显卡脸色"从口号变成可验证的工程实践。
当然,相关数据目前主要来自媒体报道,尚未看到灵晟超算方面发布的官方基准报告。接下来值得关注的是,这一纯CPU推理方案能否在更大规模的商用推理场景中复现,以及LX2 CPU与国产HBM的量产进度。
为什么重要
国产超算灵晟以纯CPU架构跑通DeepSeek-V3/R1满血模型,若数据属实,将为不依赖GPU的国产大模型推理提供一条可替代路径。后续看点在于官方基准披露与LX2 CPU、国产HBM的量产进展。
附近消息
全部08/08 17:40
Apple智能正式支持阿里千问大模型,双方达成深度技术协作
据SmartHey报道,Apple智能已正式支持阿里千问大模型,双方达成深度技术协作。这意味着苹果在中国市场的AI服务将引入国产大模型能力,Apple智能的本土化落地迈出关键一步。
08/08 18:24
Firebird在亚美尼亚启动独联体地区最大AI工厂:NVIDIA与戴尔科技提供算力支撑
新兴AI云厂商Firebird在亚美尼亚正式启动了独联体地区规模最大的AI工厂,打造由NVIDIA加速计算与戴尔科技高性能AI基础设施支撑的全新算力枢纽。亚美尼亚总理帕希尼扬与副总理马迪耶夫等官员出席启动仪式,显示AI基础设施的全球扩张正加速深入新兴市场。
08/08 16:37
谷歌称Gemini应用月活跃用户已达9.5亿
谷歌表示,旗下Gemini应用的月活跃用户数已达到9.5亿。这一数字标志着谷歌AI助手应用在用户规模上的重要里程碑,也反映出生成式AI在消费端的快速普及。
08/08 13:59
阿里云发布Qwen3.8-Max大模型,押注AI驱动云业务增长
据相关报道,阿里巴巴推出新一代大模型 Qwen3.8-Max,被视为以更强模型能力驱动云业务增长的最新动作。目前公开信息有限,其参数规模、能力表现与商用细节仍有待官方进一步披露。