算力基础设施向系统级协同演进 超节点推动有效算力规模化落地

算力基础设施向系统级协同演进 超节点推动有效算力规模化落地

财π新闻 2026年,国产算力领域最受关注的核心概念之一便是超节点,这一技术化的名词正在逐步改写算力世界的底层运行逻辑。随着传统云计算分布式计算时代逐步过渡到AI主导的算力时代,单颗GPU已经无法适配当前AI产业的实际算力需求,将多颗GPU所在的服务器深度融合为一台逻辑层面的超级计算机,正是超节点技术正在推进的核心方向。市场端的需求变化已经直观体现出这一趋势,AI算力领域的用户提问已经从过去的“你能给我多少卡”,全面转向“你每秒能稳定产出多少有效Token,对应的成本是多少”,这一转变的背后,是大模型产业发展重心从训练为主转向推理为主的核心变化。过去两年间,大模型的参数规模实现了快速增长,从千亿级逐步演进到万亿级,MoE混合专家架构成为行业主流选择,每生成一个Token,模型内部就要触发几十甚至上百次跨卡通信,这种量级的通信需求,是传统服务器集群完全无法承载的。

业内相关领域的共识已经逐步形成,大模型当前已经进入规模化生产阶段,行业关注的核心问题不再是单卡峰值性能和GPU卡的总数量,而是整套算力系统能否稳定承载大模型运行、持续产出有效Token,同时将时延与整体使用成本控制在合理区间。中科曙光高级副总裁李斌明确指出,整个行业衡量算力的标准已经发生了根本性转变,当前行业更看重一套算力系统能够持续输出多少有效算力,而非单纯的理论峰值算力。这一行业标准的转变,受到来自模型侧和应用侧两方面需求的共同推动。首先是模型侧的倒逼效应,MoE混合专家架构驱动大模型参数规模持续膨胀,推理过程对互连带宽和时延提出了近乎苛刻的要求,传统集群的通信能力已经完全无法跟上模型迭代的速度。其次是应用侧的需求放大,智能体Agent的兴起让一次普通用户请求就可能触发多轮模型调用、工具调用和并发任务,智能体推理需要生成比传统模型多近百倍的数据词元,进一步放大了对算力系统协同能力的要求。

在需求端持续升级的同时,供给侧的相关技术条件也在逐步走向成熟,高速互连、液冷、分布式存储和系统管理软件的持续进步,使得更多计算资源能够被装进一个更紧密的系统当中,超节点也从最初的概念阶段逐步走向全行业共识,其本质是把高速互连域从传统的8卡规模扩展到几十卡甚至上百卡,让卡间通信的延迟降低到内存访问级别的超低水平。当前AI算力产业的发展阶段,已经从过去的“缺卡”转向“如何把卡用好”,随着大模型从简单问答场景逐步走向长上下文、复杂推理、Agent、多模态和高并发推理场景,单次任务需要调用的Token数量、显存占用量和数据传输量都在快速增长。与此同时,国内外AI基础设施建设仍在持续扩张,过去依靠单纯增加GPU数量、增加服务器数量来获取算力的方式,已经开始遇到明显的性能瓶颈,真正影响AI集群实际性能的因素,已经不再只是芯片本身的性能,而是大量GPU/NPU之间能否以足够高的带宽、足够低的时延完成高效通信。相关产业报告已经提出明确的产业判断,算力基础设施的发展方向,正在从“扩充算力卡数量”全面转向“提升有效算力占比”,超节点的核心意义,就是通过扩大高带宽域、缩短高频通信路径,把大量分散的GPU/NPU组织成一个统一、可调度的计算系统,让原本的“理论峰值算力”真正转化为能够实际产出价值的“有效算力”。

超节点正在逐步成为下一代AI算力基础设施的核心形态,传统AI集群主要采用单机多卡、多服务器横向Scale Out扩展的架构模式,但随着模型规模越来越大,Tensor Parallel、Expert Parallel以及All-Reduce、All-to-All等通信操作的通信量快速增加,服务器之间的通信链路逐渐成为整个系统的性能瓶颈。超节点则试图打破传统服务器的物理边界,把几十、几百甚至更多AI芯片放进一个更大的Scale Up高带宽域当中,最终形成GPU/NPU、计算托盘、整柜超节点、多柜SuperPOD、超大规模AI Factory的完整层级架构。这也意味着未来判断AI基础设施的实际能力,不能只看“拥有多少张卡”,还要看其中有多少张卡能够像“一台计算机”一样实现高效协同运行。超节点的通信架构升级,主要沿着Scale Up和Scale Out两条主线推进,其中Scale Up负责超节点内部的高频通信,核心追求超高带宽、超低时延的通信效果,Scale Out则负责多个超节点、多个机柜之间的横向扩展,核心解决大规模集群的扩展问题。当前行业出现的一个重要变化是,Scale Up和Scale Out的边界正在从过去的“服务器物理边界”转向“性能边界”,也就是说过去Scale Up基本局限在单台服务器内部,未来这一范围可能扩大到整柜甚至多柜的规模。目前行业内已经出现多条主要的Scale Up技术路线,包括NVIDIA NVLink/NVSwitch、华为灵衢UB、AMD/UALink、海光HSL、阿里ALink、字节EthLink、腾讯ETH-X以及ETH+等,未来Scale Up并不会只有单一技术路线,而是会形成闭环私有协议、国产总线、云厂商自研和开放以太网协议并行发展的多元格局。

随着超节点的规模持续扩张,连接介质也将迎来从“铜”到“光”的升级趋势,CPO相关技术将迎来重要的产业发展机会。在单机柜、短距离连接场景中,高速铜连接仍然具备成本、功耗和可靠性方面的明显优势,铜介质并不会马上被光介质完全替代,但当Scale Up的覆盖范围从柜内扩展到跨柜、多机架、POD规模之后,连接距离、线缆数量的大幅增长,将推动光互联技术的大规模落地。真正的超节点必须具备大带宽、低时延和内存统一编址三大核心能力,大带宽与低时延是超节点的基础属性,超节点通过更先进的互联技术,将节点内和跨节点的通信带宽提升到TB级,通信时延从传统的几十微秒降低到几微秒,甚至百纳秒级,这意味着数据能够在节点之间实现快速流动,计算过程不再被通信环节拖慢,从而大幅提升整个系统的运行效率。以昇腾384超节点为例,相较于传统服务器架构,其通信带宽提升15倍,RTT通信时延从7微秒降低到3微秒,降幅超过50%。经过实际场景验证,在DeepSeek、Qwen等多模态、MoE模型的运行场景下,超节点相较于传统集群可以实现3倍以上训练性能的提升,同时在强化学习场景下,依托大带宽能力,可以将训推权重的传输时间从小时级降低到60秒。

内存统一编址是超节点的关键核心特性,在传统算力架构下,每个计算节点的内存都是独立且互相隔离的,数据传输需要经过复杂的序列化、网络打包和解包过程,整体效率极低。而超节点通过构建统一内存地址空间,让所有芯片可以像访问本地内存一样直接读写远程内存,省去了大量中间处理环节,这样大模型训练过程中频繁的参数同步、中间结果复用等操作,就可以通过高效的内存语义通信完成,不仅运行速度大幅提升,还能支持更大规模的共享内存池。更重要的是,超节点不只是多种技术的简单叠加,而是一个包含互联协议、工程设计与系统能力的完整体系,它需要在散热、供电、模块化架构、高可靠机制等工程层面进行深度优化,同时具备大规模部署、灵活切分、高容错等系统特性,才能真正实现逻辑上一台万卡计算机的目标,这就需要全行业协同发力,推动硬件标准化与软件生态的持续繁荣,让超节点相关技术为千行百业提供强大、灵活、可靠的算力支撑。

9月17日,华为全联接大会2026在上海开幕,华为副董事长、轮值董事长汪涛在会上表示,截至目前,昇腾910C超节点已经部署超过1000套,昇腾950超节点也已经实现规模商用,超节点在实现规模商用的同时,已经成为建设超大规模AI基础设施的必然选择。汪涛介绍,超节点是一种在物理上由多个计算节点通过高效的互联协议紧密连接组成,具备跨物理节点统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统,目前已经成为产、学、研在AI基础设施领域的广泛共识。汪涛提到,当前10万卡集群已经成为训练十万亿级SOTA模型的标配,但传统服务器架构会导致集群内通信时间超过训练总时间的40%,严重制约了MFU也就是模型浮点算力利用率的提升。根据华为马尔科夫实验室的仿真结果显示,由4K超节点组成的10万卡集群,相比由8卡服务器组成的10万卡集群,MFU提升了2.75倍。在本次大会上,华为还发布了全球首个采用NPO技术的超节点昇腾960超节点,用于加速十万亿规模的大模型训练和推理。华为AI战略的核心聚焦于算力领域,坚持硬件变现,专注做好AI基础设施,打造智能世界的硅基黑土地,华为坚持围绕“超节点+集群”的方向,通过系统架构创新构建核心竞争力,打造中国坚实的算力底座,构建开源开放的算力生态,为全球产业发展提供新的选择。随着大模型迈向十万亿级规模,超节点已经成为超大规模AI基础设施建设的必然选择,华为超节点的设计理念是以一套协议平等连接集群内所有组件、支持跨物理服务器的内存访问、并采用近铜远光的互连策略。华为坚持推进系统级创新,把多年积累的光技术应用到超节点系统内部,推出全球首个NPO光引擎Hi-ONE,这也是业界首个量产的NPO产品,是当前行业内传输能力最大的NPO产品,总容量达到7.2T,同时也是唯一实现内置光源的NPO产品。

基于“灵衢+Hi-ONE”打造的昇腾960超节点,作为全球首个采用NPO光引擎的超节点,采用领先的正交架构和全液冷设计,基于灵衢实现内存统一编址,可扩展至4096卡规模,实现8EFLOPS FP8、16EFLOPS FP4的算力性能。昇腾960超节点使用5500个Hi-ONE,替代原本需要的4万8千颗800G光模块,功耗降低超过550千瓦,系统无故障运行时间提升一倍,系统可用度达到99.8%,能够有效加速前沿模型的训练与推理创新。华为还将超节点架构引入通算系统,全新升级鲲鹏超节点,基于灵衢全光组网,最大支持4096节点,形成256TB统一内存池,可实现Agent更高密的沙箱、更快的沙箱启动速度和更好的Agent向量检索性能。同时发布了基于灵衢UnifiedBus总线、支持“一跳直连”的L3.5层PB级KV缓存解决方案OceanStor M900集群。多个昇腾960超节点,采用灵衢网络或RoCE连接在一起,能够构建更大规模的超节点集群,通过二层CLOS四平面组网,最大集群规模可达到51.2万卡,再结合多轨道拓扑技术,最大可支持100万卡昇腾超节点集群。

2026年2月6日,中兴通讯发布《超节点技术白皮书》,提出以超节点为核心打造标准化“AI工厂”,通过系统级架构创新,突破算力极限与能效瓶颈,为AI基础设施的可持续发展提供新路径。白皮书指出,随着AI模型参数规模突破万亿量级,算力需求正在从单芯片堆叠向系统级协同转型,传统分布式训练面临通信开销剧增和算力利用率下降等挑战,为解决这一问题,超节点采用高速互联协议和专用交换芯片,构建高带宽域,将数十到数百颗GPU芯片逻辑整合为统一编址、低延迟、高带宽的协同计算系统。这一架构在保留GPU物理独立性的同时,带来了类单机的编程与调度体验,显著提升了算力利用效率,为大规模模型训练和推理提供了高性能的算力底座。在硬件层面,白皮书重点阐述了中兴通讯自研的OEX正交无背板互联交换架构,该架构通过物理设计的根本性创新,实现四大核心亮点,一是高密集成,突破物理空间极限,采用计算托盘与交换托盘垂直交叉的无线缆互联设计,彻底消除机柜内部成千上万根高速线缆,极大释放机柜空间,实现单位空间算力密度的飞跃。二是高可靠,保障信号完整与系统稳定,通过正交无背板互联显著降低通信损耗,大幅降低误码率,极短的板间互联路径确保了大规模集群通信的高速与稳定。三是简化运维,极简架构提升可维护性,无线缆设计从根本上减少了因线缆松动、老化或连接器故障导致的宕机风险,极简的物理架构将系统平均故障修复时间从小时级缩短至分钟级,极大提升了系统的可维护性和运行效率。四是开放互联,自研芯片多协议兼容,依托自研的“凌云”大容量交换芯片,系统支持TB级互联带宽与百纳秒级时延,并全面兼容国内外主流标准及专业定制化互联协议。针对AI落地复杂度高、交付周期长的痛点,白皮书倡导从“项目制”向“工厂模式”转型,将AI能力建设升级为标准化的现代化流水线,通过软件栈即操作系统的设计,依托统一虚拟化资源池与智能编排,在软件层实现对异构算力的深度调度与管理,最大化资源利用率,同时依托Nebula单体超节点与Nebula Matrix集群超节点,实现算力从百卡到万卡规模的平滑弹性扩展,灵活满足不同阶段的大模型训练需求。

进入智能体时代后,AI具备自我迭代能力,推理需求呈指数级增长,对低延迟、高带宽、长上下文提出了更高要求,沐曦股份联合创始人、CTO彭莉介绍,超节点是解决推理效率的关键,通过多卡互联形成高带宽域,提升推理响应速度,满足大规模并发和长序列处理需求。彭莉同时强调,“超节点”不是简单的“堆卡”,而是完整的系统级方案,涉及算力、带宽、互联、管理、软件栈的协同优化,国产算力要走向规模化,必须突破系统级设计、软件协同、长期稳定性等瓶颈,而非仅追求单卡性能。摩尔线程高级副总裁董龙飞从端云协同视角指出,随着模型能力下沉,手机、PC、家庭设备、机器人等终端都有可能承载不同层级的AI能力,端侧AI算力将是未来重要的市场方向,而在更大规模智算基础设施建设中,十万卡集群也不是万卡集群的简单扩容,而是完整的系统级工程,可靠性、互联、散热、功耗、工程调校都成为超大规模集群必须解决的问题,需要全产业链上下游共同面对。目前摩尔线程正在前瞻布局光互联、新材料散热等新一代技术,为超大规模算力集群做好技术储备。尽管超节点已经成为行业共识,但从技术验证走向规模化商用,仍面临多重挑战,中昊芯英创始人、CEO杨龚轶凡总结了超节点规模化落地的四大核心行业痛点,一是集群通信瓶颈,二是多客户业务隔离与算力平衡难题,三是散热基建迭代压力,四是软硬件协同成熟度不足,因此超节点距离标准化稳定商用仍有较长周期。在技术路线上,行业也呈现分化趋势,杨龚轶凡认为,GPU架构最初是为单卡、少量芯片二维图形渲染设计,而TPU架构立项之初就面向深度学习分布式并行运算打造,天然适配万卡级别超节点集群,中昊芯英TPU可无缝适配国内中兴等所有主流整机厂商超节点硬件方案,支持混合算力集群部署,目前已经有超节点成熟合作案例落地。工业和信息化部数据显示,截至2026年6月底,我国智能算力规模达2185EFLOPS(FP16),下一步工业和信息化部将持续按照“点、链、网、面”体系化工作思路,优化算力基础设施资源部署,打造算力互联互通节点,提升算力资源利用效率。上海交通大学副教授张志刚认为,AI芯片行业正发生结构性变化,从通用计算向专用细分架构分化,长期来看全球仅中美具备完整产业链研发能力,海外供应链限制正倒逼国内芯片全链路极致优化。投资界相关人士指出,具备完整自研架构、全链路优化能力的企业更具长期价值,核心评判标准是底层自主研发能力与真实落地价值,而非资本叙事,依托庞大的应用市场,未来国产算力有望实现全球引领。

(编辑:杨学萍)