过去AI服务器最常见的是8卡服务器。现在,这个规模正在迅速扩大。

英伟达GB200 NVL72已经把72颗GPU放进同一个高速互联系统,国内的产品规模更大。中科曙光scaleX640单机柜可以部署640张计算卡,华为、阿里、字节也陆续推出或规划更大规模的超节点。

国海证券判断,国产AI芯片、互联协议和整机方案正在逐步成熟,2026年国产超节点已经开始进入规模化出货阶段。

一、为什么8卡服务器开始不够用了

先看训练;

现在的大模型越来越多采用MoE架构,也就是把一个大模型拆成很多个专家。每处理一个Token,系统会根据内容选择其中几个专家参与计算。

问题在于,这些专家通常分布在不同GPU上。

一批Token进入系统以后,需要先被分发到不同GPU,计算完成以后再把结果传回来。这个过程中,很多GPU会同时向其他GPU发送数据,业内称为All-to-All通信。

模型越大,参与计算的GPU越多,这种通信就越频繁。

如果卡间网络速度不够,GPU算完自己的部分以后,只能等其他GPU把数据传过来。芯片的理论算力很高,真正运行模型时却有一部分时间耗在等待通信上。

超节点首先解决的就是这个问题。

它把需要频繁通信的GPU放进一个高速互联范围内,尽量缩短数据传输时间。以英伟达为例,PCIe 7.0单卡双向带宽常见上限约512GB/s,而NVLink 6可以达到3.6TB/s,已经相差数倍。

带宽提高以后,GPU之间传同样一批数据所需的时间就会缩短,等待通信的时间也随之减少。

二、推理对显存的要求越来越高

训练主要受卡间通信影响,推理还会遇到另一个问题:显存。

大模型推理可以简单分成两个阶段;

用户输入问题以后,模型先把整段内容读一遍,这个过程叫Prefill。这个阶段需要一次处理大量Token,对GPU计算能力要求比较高。

接下来模型开始逐个生成Token,也就是Decode阶段。

Decode阶段需要不断调用此前已经计算过的内容。为了避免每生成一个Token都重新计算一遍,系统会把这些中间结果暂时存在显存里,这部分数据就是KV Cache。

上下文越长,KV Cache占用的显存越多。

如果同时有很多用户使用模型,需要保存的KV Cache还会继续增加。到了这个阶段,GPU可能还有计算余量,但显存容量和显存带宽已经成为限制。

超节点把更多GPU和显存连接起来以后,软件可以在更大的范围内安排模型和数据放在哪里。

这里会用到统一内存寻址。

过去一张GPU要访问另一张GPU上的数据,需要先把数据复制过去。统一编址以后,不同设备上的内存可以放进同一个地址空间,GPU能够直接按照地址访问其他设备上的数据。

这种方式可以减少一部分数据搬运,但远端内存的速度依然比本地HBM慢。内存怎么分配、哪些数据放在本地、哪些数据放到远端,仍然需要操作系统和软件一起管理。

所以超节点需要解决的其实是一整套问题,包括卡间通信、显存使用、网络结构和软件调度。

三、Scale-Up和Scale-Out分别解决什么

AI集群规模越来越大以后,网络通常分成Scale-Up和Scale-Out两层。

Scale-Up主要负责超节点内部的连接;

几十张、几百张GPU在训练时经常需要互相传数据,因此这一层追求的是更高带宽和更低延迟。国海证券整理的技术体系中,Scale-Up的时延目标通常在百纳秒到亚微秒级。

Scale-Out负责把多个服务器或者多个超节点继续连接起来;

比如一个超节点内部有64张或者128张卡,再把几百个超节点通过网络连接起来,就可以组成万卡、十万卡集群。

这一层的数据交换没有超节点内部那么频繁,因此一般使用InfiniBand或者RoCE以太网。

可以把两者理解成两个不同的范围。

Scale-Up负责让一个超节点内部的GPU尽可能高效地协同工作;Scale-Out负责把大量超节点组成更大的算力集群。

大模型越来越大以后,这两层网络都要升级,只是解决的问题不同。

四、Vera Rubin已经是一整套算力系统

英伟达最新的Vera Rubin,可以比较直观地看出超节点已经发展到了什么程度。

这一代产品包括Rubin GPU、Vera CPU、NVLink 6交换芯片、ConnectX-9网卡、BlueField-4 DPU、Spectrum-6交换芯片和Groq 3 LPU,一共七类核心芯片。

围绕这些芯片,英伟达又设计了Vera Rubin NVL72计算机架、Groq 3 LPX机架、Vera CPU机架、BlueField-4存储机架和Spectrum-6网络机架。

Rubin GPU配备288GB HBM4,显存带宽达到22TB/s,NVLink 6单卡互联带宽达到3.6TB/s。

交换托盘也开始承担一部分原来由GPU完成的通信计算。

NVLink 6加入S HARP 网络内计算以后,All-Reduce、Reduce-Scatter等集合通信可以直接在交换设备里完成部分计算。这样可以减少GPU之间重复传输的数据,让GPU把更多时间用于模型计算。

Vera Rubin还加入了Groq 3 LPU;

LPU内部使用大量SRAM,主要用来处理对响应速度要求较高的推理任务。GPU继续负责大规模并行计算,两种芯片放在同一套系统里,根据任务特点分工。

到这一代,AI服务器厂商需要处理的已经是一整套系统:计算芯片怎么放、显存怎么配、芯片之间怎么连接、数据怎么交换、热量怎么带走、电源怎么供,以及软件怎么把这些硬件真正调动起来。

五、国内已经形成多种超节点方案

国内的超节点也在快速增加;

华为采用自研的灵衢,也就是UnifiedBus。

灵衢把CPU、NPU、GPU、内存、DPU、存储和交换设备放在同一套互联体系中,可以同时处理内存访问和设备之间的数据通信。

根据华为的规划,灵衢架构可以从单节点扩展到8192卡,后续还计划继续扩大规模,并通过UBoE连接成百万卡集群。

其他厂商也有自己的方案;

海光采用Hyswitch,沐曦有MetaXLink,阿里使用ALink。国内还有厂商参与UALink,以及基于以太网改造的Scale-Up互联。这些协议虽然技术路线不同,但都在解决同一个问题,就是国产AI芯片数量增加以后,需要更快的卡间通信。

整机产品也已经陆续出现;

中科曙光scaleX640采用单机柜640卡设计,通过正交结构实现计算板和交换板高速互联。2026年7月,曙光宣布十万卡国产AI超集群曙光8000正式落成,并接入国家超算互联网。

阿里的磐久128单柜支持128颗AI芯片,使用ALink互联。新一代真武M890超节点已经可以从8卡扩展到64卡和128卡。

字节正在推进AI Rack 3.0,两个机柜计划支持最多576颗XPU进行Scale-Up互联,单机柜功率达到500kW,同时继续使用铜互联,并同步推进光互联方案。

从这些产品可以看出,国产超节点目前没有统一架构。

有的采用正交直连,有的使用高速铜缆,有的开始准备NPO或者CPO光互联。现阶段厂商都在根据芯片、成本、功耗和产品规模选择自己的方案。

六、服务器OEM为什么会更重要

普通服务器的硬件相对标准化。

CPU、GPU、内存、硬盘和电源都有比较成熟的产品形态,服务器厂商按照客户需求进行整机设计和集成。

超节点对整机设计的要求高得多。

首先是互联;

几十张或者几百张AI芯片需要进行高速通信,PCB走线太长会增加信号损耗。华为Atlas 950、中兴OEX和阿里磐久128都采用了正交直连结构,让计算板和交换板直接连接,减少高速信号在PCB上的传输距离。

英伟达采用另一种方案,在NVL72中使用Cable Tray,通过高速线缆连接计算托盘和交换托盘。

其次是散热;

一台传统服务器的功率通常只有几千瓦,超节点单柜功率可以达到几十千瓦、几百千瓦。字节规划中的AI Rack 3.0单柜已经达到500kW,中科曙光scaleX640的千卡计算单元则配套了1.72MW液冷能力。

到了这个功率水平,传统风冷已经很难满足要求,液冷、电源和机柜结构都要重新设计。

最后还有系统稳定性;

几百张卡长期一起运行,只要其中部分芯片、连接器、交换设备或者液冷系统出现问题,都可能影响整个任务。

所以服务器厂商在超节点里的工作已经从整机组装延伸到高速互联、结构、液冷、供电和系统验证。

这也是国海证券重点关注OEM环节的原因。

七、2028年超万亿元是怎么测算出来的

国海证券给国产超节点做了一组规模测算。

先看芯片出货量;

报告预计,2026年到2028年,国产AI芯片出货量分别约为380万颗、759万颗和1290万颗。

再看其中有多少通过超节点出货;

报告假设这个比例从2026年的15%提高到2027年的35%,2028年进一步达到55%。

按这两组数推算,2026年到2028年进入超节点的国产AI芯片分别约57万颗、266万颗和710万颗。

然后统一按每台机柜64张卡折算。对应的超节点机柜数量分别约为0.89万台、4.15万台和11.09万台。

最后给单台64卡超节点机柜假设一个平均价格,1000万元。

按这个价格算下来,2026年国产超节点市场规模约889亿元,2027年达到4151亿元,2028年进一步到11089亿元。2025年到2028年复合增速341%。

这里要强调,这是一组机构测算,其中任何一个假设变了,结果都会不同。国产AI芯片出货量如果低于1290万颗,市场规模会下降;2028年超节点渗透率如果没到55%,结果也会下降。不同超节点用的芯片数量和实际售价差别很大,统一按64卡、1000万元来算,是为了方便估算。

所以这组数据更适合用来看一个变化;如果越来越多国产AI芯片从普通服务器转向超节点交付,服务器整机以及互联、液冷、电源、PCB、光模块这些配套设备的市场都会明显扩大。

八、产业链相关公司

报告对相关公司进行了分环节梳理:

1、半导体:GPU包括寒武纪、壁仞科技、芯原股份;交换芯片包括澜起科技、盛科通信、曦智科技、万通发展;

CPU包括海光信息;存储包括长鑫科技;晶圆制造包括中芯国际、华虹公司。

2、超节点OEM:浪潮信息、中科曙光、华勤技术、紫光股份、锐捷网络、中兴通讯、联想集团、工业富联。

3、超节点组件:光模块包括中际旭创、新易盛、天孚通信、华工科技、光迅科技;PCB包括沪电股份、胜宏科技、生益电子、深南电路、鹏鼎控股;

液冷包括鼎通科技、奕东电子、硕贝德、达瑞电子、意华股份、思泉新材、飞荣达、曙光数创、申菱环境、英维克、高澜股份、同方股份、恒铭达、飞龙股份;

电源包括麦格米特、欧陆通、中国长城、中恒电气;连接包括华丰科技、航天电器、沃尔核材;存储包括兆易创新、佰维存储、东芯股份、江波龙、德明利、朗科科技。

4、算力租赁和云计算:协创数据、利通电子、宏景科技、润泽科技、智微智能、盛视科技、赛意信息、润建股份。

5、数据中心IDC:云赛智联、世纪互联、大位科技、润泽科技、光环新网、奥飞数据、数据港、宝信软件。

6、智能制造设备:联讯仪器、罗博特科、精智达、华盛昌、博众精工、优利德、鼎阳科技、强瑞技术。


以上为行业及产业链资料梳理,仅供交流,不构成投资建议。