华为发布昇腾960超节点 系统级创新筑牢中国AI算力底座
魏伊雪 2026-09-20 10:23
财π新闻 9月17日,华为在全联接大会2026上正式发布昇腾960超节点,这是业界首个采用NPO近封装光学技术的超节点,标志着AI基础设施进入系统架构创新阶段。作为华为面向十万亿参数级大模型训练与推理需求打造的新一代核心算力载体,昇腾960超节点的推出,是华为在AI算力基础设施领域持续深耕的重要成果,也为国内AI产业的规模化发展提供了坚实的底层支撑。
华为AI战略的核心是算力,坚持硬件变现,围绕超节点集群通过系统架构创新构建竞争力,打造中国坚实算力底座。在当前大模型参数规模快速向十万亿级迈进的行业背景下,算力集群的规模不断从万卡向十万卡乃至更大规模拓展,卡与卡之间的通信代价持续攀升,传统算力架构下的互联瓶颈日益凸显,华为依托自身在芯片、互联技术、系统架构等多个领域的长期技术积累,以超节点作为核心突破方向,通过系统性的架构优化,破解大规模算力集群建设过程中面临的通信、功耗、可靠性等多重挑战,为AI产业的高速发展筑牢算力根基。
昇腾960超节点最多搭载的算力卡数量从上一代1024卡升级到4096卡,可用于匹配10万亿参数模型训练和推理需求。相较于上一代超节点产品,算力卡规模的大幅提升,使得单个超节点的算力供给能力实现量级增长,能够为超大规模大模型的训练提供更为集中、高效的算力支撑,大幅降低大模型训练过程中的跨节点通信开销,提升整体训练效率。同时,该规模的算力配置也能够充分满足十万亿参数级大模型的高并发推理需求,支撑各类面向行业场景的大模型应用实现低延迟、高吞吐的稳定运行。
昇腾960芯片研发进度超预期,性能实现倍增。960DT比原计划提前三个季度,将于2027年第一季度就绪;960PR比原计划提前一个季度,将于2027年第三季度就绪。芯片作为整个AI算力系统的核心计算引擎,其研发进度的提前落地,将进一步加快昇腾960超节点的整体商用节奏,让行业用户能够更早享受到新一代算力产品带来的性能提升红利。性能层面的倍增升级,也使得单颗算力芯片的计算能力得到大幅增强,为整个超节点系统的算力规模跃升打下了坚实的硬件基础。
未来昇腾系列芯片将坚持一年一代的演进节奏,2028年和2029年将陆续推出昇腾970和980芯片,实现算力规格继续翻倍。这一明确的产品迭代节奏,为整个昇腾算力生态的长期稳定发展提供了清晰的预期,也让基于昇腾算力进行应用开发、模型训练的行业用户和生态伙伴能够提前做好长期规划,持续跟进算力升级的步伐,保障相关技术投入的长期价值。除了核心算力规格的持续翻倍之外,后续推出的新一代昇腾芯片还将同步实现访存带宽、访存容量、互联带宽等关键指标的大幅提升,进一步补齐大规模算力集群运行过程中的各类性能短板,让整个算力系统的综合运行效率得到全方位的优化。
华为研发了新一代NPO光互联产品Hi-ONE,这是业界首个量产的NPO产品,容量高达7.2T,也是唯一实现内置光源的NPO产品。作为支撑昇腾960超节点实现高效互联的核心光互联部件,Hi-ONE产品的成功量产,标志着华为在近封装光学技术领域已经实现了从技术研发到规模化落地的关键跨越。不同于传统的可插拔光模块产品,Hi-ONE将光引擎部署在算力卡附近的位置,能够在算力卡边缘几厘米的距离内实现电信号到光信号的转换,既突破了传统铜缆传输的距离与带宽物理极限,大幅降低互联过程中的信号损耗与传输延迟,同时还保留了光引擎可插拔、可独立维护的特性,在制造良率和运维成本之间实现了良好的平衡,完美适配高密度算力系统下的布线与散热需求。
昇腾960超节点用5500个Hi-ONE模块替代原本需要的4.8万颗800G光模块,功耗降低超550千瓦,系统无故障运行时间提升一倍,系统可用度达到99.8%。这一组实打实的技术指标,直观展现了NPO近封装光学技术为整个算力系统带来的全方位价值提升。光模块使用数量的大幅减少,不仅直接降低了整个超节点系统的硬件采购成本,也大幅简化了高密度算力集群内部的布线复杂度,让整个系统的空间布局更加紧凑合理。功耗层面超过550千瓦的降低,意味着单台超节点运行过程中的电力消耗得到显著控制,能够有效降低数据中心的供电与散热压力,减少算力运行的长期用电成本。系统无故障运行时间的翻倍提升,以及99.8%的系统可用度指标,进一步增强了整个超节点系统的运行稳定性,能够为长时间不间断的大模型训练任务提供更为可靠的算力支撑,减少因系统故障导致的训练中断风险,保障大模型训练任务能够平稳推进。
华为马尔科夫实验室仿真数据显示,组建10万卡集群时,采用4096卡超节点相比传统8卡服务器,模型浮点算力利用率(MFU)可提升2.75倍。这一仿真结果充分验证了超节点架构在大规模算力集群场景下的显著优势,传统基于8卡服务器搭建的大规模算力集群,由于跨服务器、跨机柜的通信链路复杂,通信延迟高、带宽受限,大量算力资源在实际运行过程中被通信开销占用,导致整体算力利用率长期处于较低水平。而基于4096卡超节点搭建的10万卡集群,依托超节点内部高效的互联架构,能够将成百上千张算力卡融为一体,实现像一台计算机一样协同工作的效果,大幅减少集群内部的通信开销,让更多的算力资源能够直接投入到模型计算任务当中,从而实现模型浮点算力利用率的数倍提升,让整个大规模算力集群的实际产出能力得到充分释放。
截至目前,昇腾910C超节点已规模商用超过1000套,昇腾950超节点也已开始规模商用。此前两代昇腾超节点产品的规模化落地,已经在互联网、运营商、金融、教育、医疗、交通、制造等多个行业场景中得到了广泛应用,积累了大量的实际部署与运行经验,也为后续新一代昇腾960超节点的快速商用推广打下了扎实的市场基础。大量行业用户已经基于此前的昇腾超节点产品完成了自身AI业务的部署与落地,形成了成熟的使用习惯与运维体系,能够平滑对接新一代昇腾960超节点产品,快速实现算力的升级扩容,进一步支撑自身AI业务的深化发展。
华为坚持构建开源开放的算力生态,CANN已进入常态化开源社区运营阶段,外部开发者占比达61%,社区月活开发者数量突破5200名。基于昇腾的原生训练模型数量已超过40个。开源开放的生态建设思路,能够充分调动广大外部开发者的参与积极性,汇聚全行业的技术创新力量,不断完善昇腾算力平台的软件栈能力,丰富各类工具链与开发组件,降低基于昇腾算力进行AI应用开发的门槛。超过半数的外部开发者占比,以及超过5200名的月活开发者规模,标志着昇腾开源社区已经形成了相当的活跃度与影响力,大量来自不同行业、不同技术领域的开发者持续在社区内贡献代码、分享经验、解决问题,推动整个昇腾软件生态不断走向成熟。而超过40个的基于昇腾的原生训练模型,也进一步验证了昇腾算力平台对主流大模型训练任务的良好适配能力,能够为各类大模型的原生训练提供稳定高效的算力支撑,助力国内大模型产业实现自主可控的发展。
华为自研的盘古大模型聚焦于华为自身产品的智能化,持续增强华为自身产品的竞争力。不同于面向行业开放的通用大模型产品,盘古大模型的研发与应用方向始终围绕华为自身的产品体系展开,通过将大模型的智能能力深度融入华为的各类硬件与软件产品当中,不断提升产品的智能化水平,优化用户的使用体验,让华为的全系列产品都能够享受到AI技术带来的能力升级,进一步强化华为产品在市场中的核心竞争力。
华为面向丰富的端侧场景,通过提供大中小微多样性算力,推进AI入端上车及物联轻智能升级。覆盖不同算力等级的多样性算力供给体系,能够适配从高性能端侧设备到低功耗物联网终端的各类差异化场景需求,让AI能力不再局限于云端的数据中心,而是能够下沉到各类端侧设备当中,在手机、汽车、智能家居、各类物联网终端等场景中实现本地化的智能计算,进一步拓展AI技术的覆盖范围,让智能能力渗透到用户日常生活与行业生产的各个角落,实现真正的无所不及。
华为围绕用算构筑新一代通信网络,把智能传递给每个人、家庭和企业。依托自身在通信网络领域的长期技术积累,华为将算力能力与通信网络深度融合,打通算力资源的传输与调度通道,让分布在不同区域的算力资源能够通过通信网络实现高效的互联互通,用户无需受限于本地的硬件算力条件,就可以随时随地便捷地获取所需的智能算力服务,让AI技术带来的智能红利能够覆盖到每一个社会成员、每一个家庭以及各类不同规模的企业,推动整个社会的智能化水平实现整体跃升。
(编辑:姜心源)
快讯
- 淡水河谷筹备2026年发行熊猫债 多个矿项目投产进度提前
- 海恩时富(HAIN)财报日换手率创历史极值 股价冲高回落收跌
- 巴克莱调整Verisk分析(VRSK)目标价至225美元 仍保持买入评级
- 拜耳两款新药落地美国市场 领投A轮融资布局生物农药赛道
- 华纳兄弟探索(WBD)并购和解临近 股价后续走势存不确定性
- 华纳音乐联合Suno推出全新AI模型 李佳隆正式加入华纳音乐中国
- 联合包裹(UPS)推转型举措:调整高管团队 20亿布局新业务
- 声网(API)AI业务多线推进 拿合规资质接入头部大模型生态
- 世纪互联(VNET)上半年IDC营收增近3成 AI订单落地节奏压制估值
- 涂鸦智能(TUYA)上半年净利涨45.8% 股价近期触及上市最低点

购物车