在年度华为全联接大会上,华为更新了其AI硬件路线图,正式发布下一代Ascend 960加速器,并披露了Ascend 970和980的技术规格。公司宣布引入基于UnifiedBus的Peerium架构,扩展垂直整合的AI基础设施组合,并将Ascend加速器的底层架构从沿用近十年的SIMD过渡至全新的SIMD+SIMT混合架构,旨在提升向量处理与线程级并行性,优化各类AI工作负载的硬件利用率。

Ascend 950系列商用现状与挑战

首批采用新架构的产品包括面向预填充和推荐的Ascend 950PR,以及面向解码和训练的Ascend 950DT。华为透露,Atlas 950 SuperPoD系统已进入大规模商业应用,Ascend 950DT测试取得“良好结果”,预计明年中国AI开发者将广泛基于该平台训练模型。但公司也承认,目前产能仍难以满足国内市场需求。

值得注意的是,尽管华为在2025年9月宣布Atlas 950 SuperPoD最大配置可支持8,192颗Ascend 950DT NPU,但在2026年7月的公开展示中,实际部署规模仅为256颗CPU和1,024张加速卡。虽然官方声称架构具备扩展至最大规模的潜力,但官网未列出超大规模配置清单,暗示实际商用进度可能受限于供应瓶颈或软件适配难度。作为华为的“探路者”,Atlas 950系列的部署经验将为后续更强大的Ascend 960系列铺平道路。

Ascend 960系列提前发布,性能显著提升

华为大幅加快了Ascend 960系列的上市进程。面向训练的Ascend 960DT将于2027年第一季度推出,比原计划提前三个季度;面向推理的Ascend 960PR将于2027年第三季度跟进,比原计划提前一个季度。

规格方面,Ascend 960DT提供2 FP8 PFLOPS和4 FP4 PFLOPS算力,配备288 GB HiZQ内存(带宽9.6 TB/s)及2.2 TB/s互连带宽。Ascend 960PR则提供2 FP8 PFLOPS训练性能和8 FP4 PFLOPS推理性能,后者较此前公布数据翻倍,配备192 GB内存(带宽2.4 TB/s)及2.2 TB/s互连带宽。相比之下,英伟达预计于2026年第四季度推出的VR200 GPU,其训练和推理性能分别达到35 NVFP4 PFLOPS和50 NVFP4 PFLOPS,搭载288 GB HBM4内存。

未来路线图:2028-2029年推出Ascend 970/980

华为副董事长兼轮值董事长王劲表示,Ascend芯片系列将保持每年一代的演进节奏。得益于Tau(τ)缩放定律,后续产品在计算规格、内存带宽及容量上将实现全面翻倍。

根据规划,Ascend 970将于2028年推出,具备3.6 FP8 PFLOPS和14 FP4 PFLOPS算力,配备288 GB内存(带宽14.4 TB/s)及4.4 TB/s互连带宽。Ascend 980将于2029年问世,初步指标显示其算力将达到7.2 FP8 PFLOPS和28 FP4 PFLOPS,配备384 GB内存(带宽38.4 TB/s)及8 TB/s互连带宽。从Ascend 960开始,FP4性能显著高于FP8将成为该系列的重要特征,表明华为对低精度计算能力进行了实质性重构。