国产算力以系统架构创新构建自主可控体系

国产算力以系统架构创新构建自主可控体系

财π新闻 据北京日报2026年9月23日报道,人工智能时代,算力正成为新的核心生产力。当单颗芯片性能的提升路径日益收窄,国产算力正通过系统级架构创新,走出一条不同于传统追赶逻辑的突围之路。从底层硬件的架构突破到全链条生态的协同构建,从国家级算力网络的统筹布局到细分赛道的差异化深耕,国产算力产业正在多个维度同步推进,逐步打破过往的技术路径依赖,构建起自主可控的算力发展体系。

超节点架构突破十万卡集群通信瓶颈

在万亿参数大模型的训练过程中,当算力开足马力,最大的堵点并非计算本身,而是芯片之间的数据传输交互过程。在近日举行的华为全联接大会上,全球首个采用NPO近封装光学技术的超节点——昇腾960超节点正式发布,针对性破解大规模算力集群中的通信效率难题。所谓超节点,是指具备跨物理节点的统一内存编址能力,逻辑上具备一台计算机特征的计算系统。通俗而言,训练一个大模型,好比组织成千上万名工人同时建造一座大厦,过去芯片之间的协同,就像一群人隔着围墙传话,如果每个人各干各的、消息靠层层传递,大量时间就耗在了等人传话上。超节点则相当于直接推倒围墙,搭建一条高速通道,让不同芯片能像一台计算机一般高效协同,从而解决超大模型数据的堵车难题。

华为副董事长、轮值董事长汪涛表示,当前智能体已经可以按小时级连续工作,到2030年预计将以月为单位执行任务;中国推理词元已增长到每日500万亿左右,到2030年预计将达到百万万亿级。模型从回答问题走向持续处理复杂工作,对计算系统的规模、效率和可靠性均提出了更高要求。同时,随着大模型参数规模持续增长,AI算力集群从千卡向万卡甚至十万卡扩展,决定AI算力实际产出的,正在从单颗芯片峰值转向整套系统的协同效率。在这一趋势下,仅提高单颗芯片的计算能力已经难以覆盖整套系统的需求,如何降低大规模集群中的通信损耗,让更多理论算力真正转化为有效算力,超节点成为AI基础设施竞争的新焦点。

汪涛表示,在10万张算力卡规模的集群中,如果仍采用传统的8卡服务器架构,内部通信时间可能超过训练总时间的40%,也就是说近一半的算力都堵在了传话路上。华为马尔可夫实验室的仿真数据则显示,在相同的10万卡规模下,由4096卡超节点组成的集群,相比由8卡服务器组成的集群,MFU模型浮点算力利用率可以提升2.75倍。相关测算显示,MFU每提升1个百分点,10万亿参数大模型的训练可以缩短三天。在模型竞争以周为单位计算的时代,这无疑是一笔无法用金钱衡量的时间账,很可能直接影响前沿大模型训练效率竞争的胜负。

国产算力产业集体推进超节点落地

如果说早期的超节点还是个别厂商的探索,2026年,它已成为国产算力的集体动作。在两个月前举行的世界人工智能大会上,壁仞科技、沐曦股份、燧原科技、摩尔线程等国产厂商相继推出超节点产品,超节点已成为产学研在AI基础设施领域的共识。共识之下,落地也开始提速,华为方面公布,昇腾系列超节点全球部署已突破1000套,服务国内AI企业、科研院所与各地算力中心,昇腾950超节点也迈入规模商用阶段。

从产业发展脉络来看,以往衡量国产算力的进步更多体现在单卡性能的追赶上,进入AI时代,大模型参数规模动辄千亿乃至万亿,单台机器、单张芯片已无法承载,必须由大量节点协同串联才能完成计算。如果仍沿用传统的节点加网络连接模式,数据传输瓶颈将严重拖累整体效率。在此背景下,超节点架构应运而生,它将几十张乃至数百张加速卡集中部署,通过高速带宽实现低延迟、高吞吐的芯片间互联,将传统的分布式集群升级为集中式超算单元。超节点是全新的产业生态,各家厂商的技术积累差距并不大,几乎都站在同一起跑线上,对国产芯片而言是一个难得的换道契机。

目前,国产超节点已初步形成产品供给、公开采购、规模部署和云服务输出的完整链条。国产算力正从单卡竞争转向系统级放量,超节点通过纵向扩展高速互联将数十至上千张卡封装为统一算力单元,价值量不再集中于芯片本身,而是向交换芯片、高速连接器、液冷、整机柜等国产优势环节扩散。多家头部厂商均推出超节点整机柜,多款万卡甚至十万卡集群亮相,华为、中科曙光、摩尔线程、沐曦股份、壁仞科技等企业纷纷推出融合自研新技术的超节点产品。通过自研高速互联协议、提升集群有效算力利用率,国产超节点方案在部分场景下已能实现与国际主流方案相当的训练效率,标志着国产算力正从单卡可用迈向集群好用。

国家级算力网络体系建设持续推进

2026年7月20日举行的国新办新闻发布会公布数据显示,截至6月底,我国智能算力规模达2185EFLOPS(FP16),同比增长177%,全国算力设施整体上架率达71.4%。工业和信息化部信息通信管理局局长谢存在发布会上说,工业和信息化部与有关部门协同配合,持续推动算力设施高质量建设,加快枢纽—区域—边缘算力设施协同布局,依托中国算力平台搭建全国一体化算力态势感知自动化监测体系。加速建设高速宽带网络,近两年围绕国家算力枢纽节点建设超70条算力大通道,相关算力枢纽节点间网络性能提升10%。

2026年9月13日从2026中国算力大会上获悉,中国算力平台实现全国一体化算力统筹监测,我国算力一张网、一盘棋、一体化发展格局基本形成。近年来,我国算力基础设施建设规模持续扩大、布局不断优化,同时也面临算力布局分散、资源底数不清、动态监测滞后、跨域协同不足等挑战。在工业和信息化部指导下,全行业系统推进算力态势感知自动化监测体系建设。中国算力平台是国家级综合性算力服务平台,目前已汇聚注册企业用户超万家,上架算力产品2000余项,接入各类大模型超300个,为广大开发者提供算力调用服务,累计沉淀数十亿条算力监测大数据。

中国信息通信研究院总工程师何宝宏介绍,中国算力平台有序推动了全国31个省份平台对接入网,建成统一规范、协同高效的全国算力态势感知监测体系,有效破除地域壁垒、打通数据孤岛,实现全国算力底数可摸清、态势可感知、运行可监测,推动算力建设从粗放式规模扩张向集约高效、全域协同跨越式升级。工业和信息化部总工程师钟志红表示,接下来将加快构建枢纽—区域—边缘多层次、梯次化算力架构,持续完善中国算力平台功能;搭建高速互联、超低时延、韧性强健的算力传输通道,按需部署城域毫秒接入;推动算力设施、算电协同等领域创新,加快算力标准体系建设指南编制;降低用算成本和应用门槛,推动分行业凝练高价值场景等。

底层软件与3D算力芯片实现自主突破

当前,人工智能产业高速发展,大模型算力需求持续激增,国内智算产业规模稳步扩容。随着传统芯片制程逼近物理极限,三维集成、存算一体等新技术成为算力升级的核心突破口。算力网建设的关键,不仅在网络层面的互联互通,更在于底层芯片与软件底座的自主贯通。在2026中国算力大会上,全球首个面向3D算力芯片的编程模型与开源软件框架Open3D‑PIMC正式对外开源,全部代码已上线开源社区,面向全球开发者、产业机构开放使用。该项目由清微智能与北京智源人工智能研究院联合打造,纳入国产AI开源软件栈FlagOS体系,标志着我国初步打通3DAI芯片从上层算法框架到底层编译编程的完整自主技术链条,补齐了下一代国产算力产业的核心软件短板。

在后摩尔时代,传统芯片遭遇存储墙、功耗墙瓶颈,3D算力芯片通过三维堆叠,将存储与计算单元纵向集成,大幅缩短数据传输距离,提升带宽同时降低功耗,已经成为下一代AI芯片的主流技术路线。从产业现状看,国内多家企业已经实现硬件突破,华为、小米、清微智能相继推出3D架构算力芯片产品;国家层面,《电子信息制造业发展十五五规划》明确提出布局存算一体范式,推进三维集成技术攻关,国家自然科学基金也将三维集成芯片列为重点研究方向,政策、科研、产业三方共同推动3D算力赛道快速发展。但行业也面临现实痛点,硬件性能实现突破,配套软件底座却跟不上迭代节奏,过去国内芯片行业普遍存在一芯片一软件栈的烟囱式开发模式,各家搭建独立软件体系,代码重复开发、生态相互割裂,应用迁移成本居高不下。即便硬件性能优异,缺少统一编程模型,也容易陷入先进硬件、低效软件的困境,硬件算力难以充分释放,制约产业化落地进程。

Open3D‑PIMC提供一套面向3D算力芯片的行业通用语法,该框架构建统一编程模型,开发者只需定义数据分布与任务划分,系统自动完成算法向硬件的适配优化。同时采用插件化设计,兼容多家厂商硬件,保留企业私有指令集与微架构能力,兼顾开源共享与企业核心技术权益,真正实现一次开发,跨芯运行,破解行业碎片化难题。依托FlagOS生态底座,这套框架可对接30余款国产芯片,打通前沿大模型与新型硬件的闭环链路。当前全球3D算力产业正处于标准构建的关键窗口期,算力竞争已经不再局限于单芯片性能比拼,底层软件栈、开源生态、技术标准成为博弈核心。过去国内大模型开源成果丰硕,但面向新型硬件的底层编程软件长期存在短板,Open3D-PIMC将国内开源创新向下延伸到芯片底层,探索企业核心贡献加社区共建的新模式,避免行业重复建设,汇聚产学研力量参与全球算力标准制定。北京智源人工智能研究院AI系统研究负责人门春雷表示,随着3D芯片关键技术突破,量产芯片陆续出现,但如果缺少配套编译器能力,会造成先进硬件、低效软件的困境,Open3D-PIMC为3D芯片产业提供了设计参考,通过产业力量的汇聚,加速迭代,形成3D芯片编译器的全球技术合力。

推理算力赛道与全栈自研体系加速成型

当前AI产业已迎来清晰的结构性拐点,正式从训练驱动迈入推理驱动的全新阶段。相关预测显示,2028年推理工作负载将占据AI整体算力的73%,成为算力需求的核心增量。相较于趋近饱和、生态壁垒极高的训练芯片市场,推理赛道场景更丰富、落地门槛更低、国产化率提升的空间更广,是本土算力企业突围的最优赛道。基于这一行业判断,国内算力企业持续深耕推理算力领域,完成产品矩阵的迭代升级,首款推理芯片HL100已于2025年11月上市,该款芯片历经两年全流程研发、流片回片、内部测试、工信部权威机构检测及大客户实测,产品落地成熟度得到充分检验。该芯片实测功耗仅68瓦,远低于行业同期主流产品370瓦至480瓦的功耗水平,凭借超低功耗、超高能效比、低成本优势,精准适配全场景推理需求。

不同于行业单一芯片布局模式,国内部分算力企业坚持双芯协同战略,在GPU推理芯片迭代升级的同时,全力推进自主知识产权CPU研发工作,相关新品将于2026年10月发布。针对这款CPU产品,企业已长期开展配套研发、联合技术攻关,积累了深厚技术储备。依托自主CPU加GPU双芯研发能力,相关企业跻身国内极少数掌握双芯技术体系的第一梯队。随着AI智能体加速普及,长上下文应用带来Token消耗快速攀升,未来低成本、高效率处理超长上下文的能力,将成为算力赛道的核心竞争力。相关算力企业依托自主底层架构、全栈产业链布局、安全可控三大核心优势,构建起难以复制的核心壁垒,实现从硬件供应商到全栈算力解决方案服务商的跨越式升级。

作为国内少数具备全栈能力的行业第一梯队企业,相关企业不仅从事芯片研发,还保留和强化整机业务板块,并可独立提供AI服务器、千卡及万卡集群数据中心整体建设方案,形成完整算力交付闭环。当前推理算力需求爆发带动大量企业入局,行业目前呈现需求很大、供给很散、差异化才是未来的格局。企业的核心壁垒分为两大方面,一方面是全栈闭环能力,不局限于单颗芯片研发,打通芯片、整机、智算解决方案整条产业链,可以交付开箱即用的全国产推理算力,降低客户集成迁移成本。另一方面是安全可控优势,产品从指令集和底层架构实现自主可控,契合政务、金融、运营商等关键行业客户的信息安全诉求。相关企业客户服务模式分为两类,实现市场化全覆盖,一是面向整机厂商,提供芯片板卡产品,由合作厂商完成整机集成;二是直接服务三大运营商、大型数据中心、金融、交通、能源等领域终端大客户,直接交付整机设备与全套算力集群解决方案,目前相关企业已成功中标中国移动、中国电信大型算力项目,商业化成果持续落地。

算力赋能实体经济与政策引导持续深化

工业和信息化部总工程师王卫明介绍,我国深化拓展人工智能加,规模以上制造业企业人工智能技术应用普及率超30%,人工智能开源大模型全球累计下载量突破100亿次。工业大模型加速抗体、小分子药物筛选,抗肿瘤靶向药等新药临床前研发周期缩短40%。从算力区域分布来看,东部、中部、西部、东北地区智算规模占全国比例分别是55.9%、10.6%、32.6%、0.9%,算力资源与产业需求形成了良性适配格局。同时,产业生态逐步完善,深入实施算力强基揭榜和算力互联互通行动,加强算网一体化、绿电直连、源网荷储等技术创新应用,加快研究形成《算力标准体系建设指南2026版》,以体系化标准引领产业规范升级。

2026年9月7日,工业和信息化部印发《信息通信行业发展十五五规划》,提出要提升算力设施发展水平,深化算力协同发展能力,强化公共算力服务能力。到2030年,新建大型超大型算力设施运行电能利用效率降至1.2以下,智能算力规模达到9800EFLOPS。在打造高效协同的算力设施方面,《规划》强调,提升算力设施发展水平加快全国一体化算力网建设,构建枢纽—区域—边缘多层次算力设施体系,有序部署万卡、十万卡及以上智算集群,面向场景按需部署推理算力设施,加大力度适配国产算力芯片。

谢存表示,下一步将优化算力资源供给部署,打造梯次化算力布局,加强算力统筹监测;推动建立算力服务能力评估、算力市场化定价等标准;开展新型传输协议、卡间互联等技术攻关;深入实施普惠算力赋能中小企业发展专项行动;组织算力企业开展国际交流等。一系列政策引导与产业实践相互配合,推动国产算力产业逐步从技术追赶转向体系化引领,在全球算力竞争中走出一条自主可控的特色发展路径。

(编辑:杨学萍)