智东西 作者 陈骏达 编辑 漠影 AI大模型竞赛,正在进入新的量级。海外,十万亿参数的大模型已经逐步变成现实;国内,数万亿参数的大模型也在加速追赶。为了训出真正的SOTA模型,算力集群从万卡走向10万卡已成为标配。 然而,一个尴尬的现实是: 卡越堆越多,真正被利用起来的算力,却没有同步增长。 华为的仿真数据显示,在10万卡集群中,卡间通信可能 消耗了40%以上的训练时间 ,算力利用率(MFU)往往 不到30% 。也就是说,大量昂贵的算力,并没有真正用于计算。 对于训练周期以月计算的前沿大模型而言,MFU每提升几个百分点,都可能意味着数天的训练时间差,以及数千万元甚至上亿元的算力成本变化。 为解决这一挑战,有越来越多的厂商把目光投向一种新的算力组织方式——超节点。与传统集群把计算卡分散在大量服务器中不同,超节点试图通过更紧密的互联、统一的内存空间和更低的通信时延,把数千张卡组织成一个逻辑上的整体。 日前发布的昇腾960超节点,正是这样一套面向10万卡时代的超节点工程化方案。 一、 超节点成必然选择 ,统一内存编址是关键 从去年开始,“超节点”成为AI算力领域热度快速攀升的概念。华为昇腾910C超节点等方案率先引发行业讨论,此后,国内算力、服务器等厂商也相继推出相关产品。一时间,超节点几乎成了新一代AI算力基础设施的代名词。 在上周的HC2026大会上,华为副董事长、轮值董事长汪涛更是判断, 随着大模型迈向10T级参数规模,超节点是AI基础设施建设的必然选择。 但随着产品不断涌现,一个更基础的问题也随之而来: 到底什么才是真正的超节点? 如果只是把更多服务器放在一起,再通过高速网络连接起来,那么它与传统AI集群究竟有什么区别? 2026年7月,在世界人工智能大会(WAIC)期间, 《超节点定义与实践白皮书》 正式发布。这份白皮书由鹏城实验室与全球计算联盟(GCC)联合牵头,38家单位共同参与制定,从行业层面对超节点进行了明确界定。 白皮书提出,超节点是一种由多个计算节点通过 高效互联协议紧密连接 ,并具备跨物理节点 统一内存编址能力 的计算系统,逻辑上具有 “一台计算机” 的特征。 以MoE等主流模型为例,随着参与计算的计算单元数量不断增加,模型中间结果需要在大量单元间频繁交换。集群规模越大,通信和同步带来的开销也越明显。 此时,如果计算单元然只是分散在不同服务器中,通过网络进行数据交换,那么计算卡数量增加,并不意味着有效算力能够等比例提升。 换句话说,超节点真正改变的,并不是简单地把8卡服务器扩展到64卡、1024卡甚至4096卡,而是重新组织计算单元间的连接与协作方式, 让分散的计算资源在硬件和软件层面更像“一台机器” 。 在符合这一架构的系统中,超节点内的算力单元以访问统一的内存共享池,并通过全局地址空间实现跨物理节点访问。相比之下,传统集群中的数据往往需要依赖网络协议,在不同节点之间进行传输。 华为马尔科夫实验室的仿真结果显示,在同样为10万卡的集群中,由4000卡超节点组成的系统,MFU可达到传统8卡服务器集群的2.75倍。 而符合白皮书所定义架构的产品,已经开始进入规模化应用阶段。截至目前,昇腾910C超节点已部署超过1000套,昇腾950超节点也进入规模商用阶段,应用覆盖互联网、运营商、金融、教育、医疗等多个行业。 从标准定义到产品落地,超节点正在从一个产业概念走向现实。然而,随着超节点规模一路扩大,卡间需要交换的数据量急剧增加,对带宽、时延和可靠性的要求也水涨船高, 互联的工程难度开始集中出现 。 二、把光引擎,搬到算力身边 目前,大规模AI集群内部主要依赖铜缆进行电互联,随着SerDes速率达到224G及以上,传统电互联方案开始面临越来越大的压力。 速率越高,铜缆中的各类损耗就越明显,信号传输距离也越来越受限;而当数千根高速铜缆被集中在一个高密度系统中,布线、散热和维护也会变得更加复杂。 于是,行业开始把目光投向“光”。 在此之前,数据中心的光互连长期依赖传统可插拔光模块方案:光模块作为一个独立器件,插在交换设备或计算节点的面板上,信号先沿电路板走线传送到模块接口,再在模块内完成电光转换、进入光纤。 ▲可插拔光模块 可插拔设计的好处在于标准化与可维护,模块坏了可以单独更换,这也是它统治数据中心互联二十余年的原因。但可插拔方案也有一个先天弱点:电信号从计算单元到模块,需要经过一段漫长的电路板路径,随着速率的提升,这段电走线带来的问题变得难以忍受。 NPO(Near-Packaged Optics,近封装光学)试图改变这一过程。它的思路很直接: 把光引擎放到计算单元边缘,让电信号尽早转换成光信号。 原本需要通过较长距离电连接传输的信号,在距离计算卡更近的位置完成光电转换,再通过光纤完成更远距离的高速传输。 对于超节点