实时 AI 消息
华为汪涛:要打造AI算力底座,只做好一颗芯片远远不够
在今年的华为全联接大会上,轮值董事长汪涛公布昇腾960与960超节点,并给出2028年昇腾970、2029年昇腾980的“一年一代”演进节奏。华为同时推出业界首个采用NPO光引擎的超节点与Hi-ONE光引擎,并称CANN生态已跨过拐点,核心使命是打造AI算力底座。
在今年的华为全联接大会上,华为轮值董事长汪涛公布了一条更完整的AI基础设施路线:围绕昇腾960与960超节点展开,并把后续芯片节奏一并摊开——2028年昇腾970、2029年昇腾980,未来几年保持“一年一代”的演进节奏。
芯片层面,华为给出的进展比预期更快。据量子位报道,昇腾960DT的研发进度比原计划提前三个季度,单芯片算力实现倍增,支持2 PFLOPS FP8、4 PFLOPS FP4,HBM容量最高288GB、带宽9.6TB/s;对应的昇腾960超节点做到4096张NPU卡,最高8 EFLOPS FP8算力、超过1PB HBM容量。
华为想讲的并不只是一颗更快的芯片。汪涛在会后接受量子位专访时表示,960芯片已经在实验室测了好几个月,“芯片从立项到产品化往往要三年,我们任何一次发布,都是产品已经在实验室反复测试、有准确交付时间之后才做”。
更关键的变化发生在芯片之外。华为把突破口放在“规模算力”上:910C是384卡,950做到1024卡,960进一步扩到4096卡,并通过跨物理节点的统一内存编址,让多颗NPU互联起来更接近一台逻辑计算机。汪涛提到,从仿真训练里看到,在同样十万卡集群下,4096卡超节点组成的集群相对传统八卡服务器组成的集群,MFU可提升2.75倍。
支撑这套系统的硬件创新是NPO(近封装光学)。昇腾960是业界首个采用NPO光引擎的超节点,具体产品为Hi-ONE光引擎:单引擎集成36路200G,总传输容量7.2Tbps,并把光源直接内置。汪涛在圆桌上把Hi-ONE的领先性概括为“三个第一”:第一个规模商用、最大的带宽、唯一内置光源的。
华为没有直接一步走向CPO(共封装光学)。汪涛解释得很具体:“CPO把光引擎和主芯片放一起,光引擎坏了整个主芯片就报废,可用度差,故障成本极高,对封装厂要求也高。现在NPO的TCO至少比CPO低40%以上。”他也留了口子:未来CPO如果解决了可靠性、良率问题,华为也可能转向。按照披露,昇腾960超节点用约5500个Hi-ONE替代原本约4.8万个800G光模块,功耗降低超过550kW,系统无故障运行时间提升一倍,系统可用度为99.8%。
硬件往前跑,软件生态要同步跟上。CANN进入常态化开源社区运营,月活开发者超过5200人,外部开发者占比达到61%;昇腾也进入PyTorch官方支持路线,开发者可以直接在PyTorch社区获得相关支持。汪涛对此的表述反而很克制:“经过八年努力,我们今天只敢说CANN生态跨过了拐点。”他同时希望把适配动作进一步前置,在模型进入预训练阶段时就与模型厂商协同。
这背后是华为对自己在AI产业链中位置的一次明确划分。汪涛直言“华为的核心使命是打造算力底座”,盘古会继续服务华为自身产品智能化,但华为并不打算在每一层都和伙伴竞争;灵衢协议已经开放,CANN代码也持续开源,华为想把更多研发资源放在芯片、超节点和算力底座上。
值得注意的是,华为的选择带有现实约束的印记。汪涛提到,中国最先进的制造工艺还没有取得完全突破,华为必须有一条创新路线,同时满足中国AI训练、推理、行业应用的需求,这也是它在提升单芯片性能之外,把大量资源投向超节点、光互联与系统工程的原因。后续可以观察三件事:一年一代的节奏能否兑现,昇腾原生训练的模型能否规模化出现,以及“算力触手可及”的交付能力能否被客户真正接住。
为什么重要
这条路线把AI算力竞争的焦点从单芯片参数转向超节点、光互联与软件生态的系统工程能力,并明确了华为作为算力底座供应商、而非全栈竞争者的位置。对国内大模型公司而言,适配前置与CANN持续开源意味着更低的迁移与优化成本。
附近消息
全部09/19 14:44
陶哲轩代表SAIR Foundation启动“开放数学模型计划”
菲尔兹奖得主陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”,意在联合学术界与产业界,为数学及科学研究构建开放权重模型与配套开源工具。计划首阶段聚焦论证理解、文献核对、代码编写与形式化证明等日常科研场景,并以开放许可、可复现评测与社区治理作为运作原则。
09/19 08:12
AI 演员蒂莉·诺伍德宣传行程遇挫:采访中疑似故障改说中文
TechCrunch AI 报道称,AI 演员蒂莉·诺伍德正在展开一轮宣传行程,但整体效果并不理想。报道提到,在一场格外反常的采访中,她似乎出现故障,转而开始用中文说话,成为这轮宣传中最受关注的一幕。
09/19 08:07
Anthropic向药物研究人员开放更多AI模型
据FirstWord Pharma报道,Anthropic正在向药物研究人员开放更多AI模型,扩大其在生物医药研发场景中的可用范围。这则消息由面向制药行业的专业媒体披露,说明通用大模型厂商与医药研发之间的接口正在变得更具体。
09/19 08:02
Google成为最新一家在AI安全测试中出现失误的实验室
Axios报道称,Google成为最新一家在AI安全测试环节出现失误的实验室,这类事故正在被当作一个反复出现的类别来追踪。报道把焦点放在实验室内部测试流程的可靠性上,而不是模型上线后的产品问题。