7 月 17 日,2026 世界人工智能大会(WAIC)在上海世博中心开幕。华为在展区内首次线下展出了全配置的昇腾 950 超节点(Atlas 950 SuperPoD)真机,这是华为迄今为止公开亮相的最强 AI 计算设备。华为公布的数据显示,昇腾 950 超节点的总算力达到英伟达 NVL144 系统的 6.7 倍。

核心规格
昇腾 950 超节点基于华为自研的灵衢(UnifiedBus)互联协议和超节点架构,核心技术参数如下:
| 参数 | 数值 |
|---|---|
| 集群规模 | 1024 卡(16 台计算柜,单柜 64 卡为基本单元) |
| FP8 算力 | 1 EFLOPS |
| FP4 算力 | 2 EFLOPS |
| 全局统一内存编址 | 256 TB |
| 卡间互联带宽 | TB 级 |
| RTT 时延 | 3 微秒 |
| 最大扩展 | 8192 卡(SuperCluster 可至 50 万卡) |
现场展出的版本搭载 16 台计算柜、共计 1024 张昇腾卡。以单柜 64 卡为基本单元,最大可支持 8192 张昇腾卡高速互联,卡规模是上一代昇腾 384 超节点的 20 多倍。
与英伟达 NVL144 对比
根据华为公布的规格,昇腾 950 超节点在总算力上达到英伟达 NVL144 系统的 6.7 倍。NVL144 是英伟达搭载 144 张卡的同级别系统。此前华为昇腾系列产品主要通过企业渠道和政府项目供应,鲜有公开的基准测试数据。这次在 WAIC 上的真机展示,是华为首次向外界完整呈现其超大规模算力集群的硬件实物。
超节点架构的技术含义
超节点架构与传统算力集群的关键区别在于跨物理节点的统一内存编址。传统算力集群中,不同服务器节点之间的数据交换需要经过网络协议栈,存在不可忽略的传输开销。超节点通过自研互联协议(灵衢),将大量 AI 芯片紧密连接为一个计算单元,实现 TB 级互联带宽和 3 微秒级 RTT 时延,减少芯片间的数据传输等待,提高大模型训练和推理过程中的有效算力。
256 TB 的全局统一内存编址空间意味着 1024 张卡共享一个连续的内存地址空间。对于万亿参数级别的大模型训练,模型参数、梯度、优化器状态需要分布在数百甚至上千张卡上,统一内存编址简化了数据调度的复杂度,同时降低了通信开销。
昇腾 950 在工程层面实现了从散热到互联的全栈创新:散热采用低沸温组冷板和多冷链路液冷方案,散热能力提升 2 倍;互联方面采用柜级正交架构配合星云 800G LPO 光互联方案,光互联时延降低 90%;供电采用高效 TPSU 电源搭配 Si Turbo 电容,配电效率峰值提升 20%。系统层面实现了 2+2 光路保护和灵魂交换芯片双备份,单链路故障零中断。

Atlas 850E 风冷超节点
华为同期展出的 Atlas 850E 风冷超节点面向传统机房部署场景。当前大规模 AI 算力集群普遍依赖液冷散热,许多企业现有 IDC 机房不具备液冷基础设施,改造成本高昂。Atlas 850E 依托自研 VCE 相变散热技术,企业无需对现有风冷 IDC 机房进行液冷基建改造,通过标准机柜即可直接上架部署。
单个风冷超节点可扩展至 96 卡商用部署,原生覆盖 FP8、mxFP8、HiF8、INT8、mxFP4 全量低精度格式,搭配 4.0 TB/s 高速内存带宽,可稳定实现 10ms 级时延推理。这一规格针对 Agentic AI 推理场景设计:Agent 多轮对话需要高频 KV 缓存读写,10ms 级时延和 M 级超长上下文支持可以匹配这类负载需求。
商用落地进展
昇腾 384 超节点已商用落地 750 多套,规模应用于互联网、运营商、金融、教育、医疗、交通、制造等行业,是国内唯一训练出 SOTA 模型的超节点。昇腾携手 3000 多家行业合作伙伴,孵化了 7000 多套行业解决方案,服务 2000 多家政企核心客户。
软件生态方面,昇腾 CANN 异构计算架构已于 2025 年底全面开源。截至当前,CANN 开源社区已上线 67 个社区项目,开源代码超 1244 万行,月活跃开发者突破 3500 人,日均代码下载量达 6 万次。昇腾联合 90 多个第三方社区优化使用体验,持续提升训练和推理效率。
行业背景
昇腾 950 超节点的发布处于全球 AI 算力竞争加速的背景下。英伟达凭借 GPU + NVLink + InfiniBand 构建的算力集群长期占据主导地位,华为的路径是通过自研 NPU 芯片、灵衢互联协议和超节点架构构建完整替代方案。
华为此前已宣布计划在 2026 年第四季度将昇腾系列 AI 加速芯片和 Atlas 950 SuperPod 计算系统推向韩国市场。昇腾 950PR 推理芯片已于 2026 年 4 月量产,华为声称其推理性能可达英伟达 H20 的 2.87 倍,价格仅为后者的四分之一。昇腾 950DT 训练芯片计划在 Q4 同步推出。
超节点路线的核心优势在于通过互联架构创新提升有效算力利用率。在万卡以上规模的训练任务中,传统集群的有效算力利用率通常受限于节点间通信开销,而超节点的统一内存编址和超低时延互联可以显著降低这一损耗。昇腾 384 超节点已在 DeepSeek V4 等大模型中完成部署验证,950 超节点则将规模上限提升了一个量级。