返回文章列表

从 4096 卡到 50 万卡:国产算力这一周把战场换到了超节点

9 月 17 日华为发布昇腾 960 超节点,9 月 22 日阿里发布真武 V900 与磐久超节点服务器,两家的公开指标都从单芯片算力转向 4096 卡与 50 万卡级的系统规模。本文用发布会公开参数、MFU 仿真数据,以及封装基板与 HBM 的产能变化,拆解超节点到底解决了什么问题、这条路上还有哪些没被回答的部分。

18 分钟阅读

一周之内,两家公司给了同一个答案

9 月 17 日,华为全联接大会 2026 在上海开幕。轮值董事长汪涛在主题演讲中发布了业界首个采用 NPO(近封装光学)技术的超节点——昇腾 960 超节点,单个超节点最大可扩展至 4096 卡,提供 8 EFLOPS FP8 算力与 1PB HBM 容量(科技日报)。

五天之后,9 月 22 日,阿里在杭州云栖大会上发布新一代训推一体 AI 芯片真武 V900,并同步推出新一代磐久超节点服务器,官方给出的系统级指标是:结合阿里云新一代网络架构,单一 AI 集群可扩展至 50 万卡(上海证券报)。

两场发布会隔了五天,重点却不像过去那样落在一颗芯片上。华为这次强调的是把光引擎搬进超节点内部,以及围绕 10 万亿参数模型重建互联与内存;阿里虽然发布了新芯片,但最能说明方向的新数字是集群规模,而不是单卡的绝对算力——官方也没有公布真武 V900 的具体计算能力参数(南方都市报)。

这一周里,国产算力竞争的基本单位,从"一张卡"变成了"一个超节点、一个集群"。

超节点要解决的问题:卡越多,等待越久

要理解这两场发布会为什么都在讲"超节点",得先看一个反直觉的现象:集群规模变大时,算力利用率反而可能下降。

原因是通信。大模型训练是紧耦合的同步并行计算,每次迭代都要在成千上万张卡之间交换梯度与激活值。卡数翻倍,通信的跳数和等待时间也随之增长,算力被消耗在"等别人算完"上。华为在发布会现场给出的行业数据是:在传统计算架构下,10 万卡集群的实际模型算力利用率(MFU)仅约 20%,大量算力处于等待通信完成的状态(中国经济网)。

超节点是行业给出的应对方案。按鹏城实验室与全球计算联盟联合发布的《超节点定义与实践白皮书》中的定义,超节点是"物理上由多个计算节点通过高效互联协议紧密连接、具备跨物理节点统一内存编址能力、逻辑上具备'一台计算机'特征的计算系统"(科技日报)。

这个定义里最硬的一条是内存统一编址:任何一张 AI 芯片都能访问超节点内的全部内存池。汪涛在专访中把这一条视为分水岭——做不到内存统一池化,就只能算高速互联的集群,而不是超节点(科技日报)。

华为马尔科夫实验室的仿真给出了一组量化对照:由 4K 超节点组成的 10 万卡集群,相比由 8 卡服务器组成的同规模集群,MFU 可提升 2.75 倍。汪涛也做了限定——"具体模型表现上,这个倍数并非一概而论,但能大致反映整体趋势"(中国经济网)。

华为的答案:把光搬进封装旁边

昇腾 960 超节点的核心变化在互联层。

传统大规模算力系统内部主要靠铜缆做电互联,距离和带宽都有物理极限。NPO(近封装光学)的思路是在算力卡边缘几厘米的位置完成电转光,绕开铜缆的距离与带宽瓶颈,同时降低互联功耗和延迟(经济参考报)。

配合这项技术的产品是 Hi-ONE,华为称其为业界首个量产的 NPO 光引擎,单引擎传输容量 7.2T,也是目前唯一实现内置光源的 NPO 产品。昇腾 960 超节点基于"灵衢 + Hi-ONE"构建,采用正交架构与全液冷设计,通过灵衢协议实现内存统一编址(科技日报)。

官方给出的降本数字是:用 5500 个 Hi-ONE 模块替代原本需要的 4.8 万颗 800G 光模块,功耗降低超过 550 千瓦,系统无故障运行时间提升一倍,可用度达到 99.8%深圳特区报)。

集群这一侧,多个昇腾 960 超节点通过灵衢网络或 RoCE 连接,采用二层 CLOS 四平面组网,最大集群规模可达 51.2 万卡;结合多轨道拓扑技术,最大可支持 100 万卡昇腾超节点集群(环球网)。

除了智算,华为还把超节点架构搬进了通用计算:鲲鹏超节点基于灵衢全光组网,最大支持 4096 节点,形成 256TB 统一内存池;同时发布基于灵衢 UnifiedBus、支持"一跳直连"的 L3.5 层 PB 级 KV 缓存方案 OceanStor M900 集群(中国经济网)。这两项都指向同一类负载——Agent 场景下的状态管理与沙箱调度。

落地节奏上,华为披露昇腾 910C 超节点累计部署已超 1000 套,昇腾 950 超节点实现规模商用;芯片方面,昇腾 960DT 计划 2027 年第一季度发布,比原计划提前三个季度,昇腾 960PR 计划 2027 年第三季度发布,提前一个季度,风冷与液冷超节点分别于明年第二、三季度上市(深圳特区报经济参考报)。

阿里的答案:先统一内存,再谈规模

阿里这一轮发布的主角是真武 V900。官方参数包括:单芯片性能为上一代真武 M890 的 3 倍,搭载 216GB 显存,片间互联带宽 1200GB/s,原生支持 FP8 与 FP4 低精度计算,计划 2027 年第一季度量产并在阿里云数据中心规模化部署。平头哥半导体副总裁高慧提到一个成本视角:精度每降一档,一度电换来的 token 数量基本可以翻倍潮新闻)。

真正决定集群上限的是互联。真武 V900 通过自研 ICN Switch 互联芯片实现千卡全带宽高速互联,并具备原生内存语义与内存统一编址能力——按阿里方面的说法,上千颗 V900 可以像一颗"超级芯片"一样协同工作。配套的磐久超节点服务器集成了 V900、ICN Switch、磐脉智能网卡与镇岳 SSD 主控芯片,做的是算、存、网的系统级协同(科创板日报经济观察报)。

值得注意的是阿里的表述顺序:它先讲 M890 超节点已经在跑,再讲 V900 明年到位。 现有 M890 超节点被描述为国内首个十万卡超节点集群,已跑通 Qwen3.8、Kimi K3 等超过 2 万亿参数的模型;截至 2026 年 6 月,真武系列服务的企业客户超过 650 家(科创板日报)。下一代的灵骏真武 V900 超节点计划明年推出,宣称搭载 200Pbps 通信带宽、6 微秒时延集群架构、自研 SNPO 全光互联,支持千卡 Scale-Up 互连,单集群可扩展至 50 万卡(阿里云栖大会口径)。

另一个被首次公开的部分是 CPU 路线图。平头哥计划 2027 年推出倚天 720 与倚天 730,其中 730 首次采用全自研 CPU 微架构,单核 SPECint2017/GHz 性能最高可达倚天 710 的 1.4 倍;2029 年推出基于第二代自研核的倚天 750,并支持通过 ICN 总线与真武 AI 芯片直接互联(新浪财经)。

高慧对这个调整的解释是场景变化:Chatbot 时代 GPU 是主角、CPU 打辅助;进入 Agent 时代,任务规划、状态管理、工具调用、代码沙箱、多 Agent 编排以及海量数据预处理都压在 CPU 上潮新闻)。这与华为把超节点架构扩展到鲲鹏,是同一个判断。

两组参数摆在一起

把两家公开的关键指标放在一张表里,能看到两种不同的技术路线,以及一些口径上的差异。

维度华为 昇腾 960 超节点阿里 磐久超节点 + 真武 V900
发布时间9 月 17 日,全联接大会 20269 月 22 日,云栖大会 2026
单超节点规模最大 4096 卡未公布单超节点卡数
单超节点算力8 EFLOPS FP8 / 16 EFLOPS FP4未公布整机算力;单芯片为 M890 的 3 倍
显存与内存1PB HBM,灵衢内存统一编址单芯片 216GB 显存,原生内存语义与统一编址
互联技术灵衢 UnifiedBus + Hi-ONE NPO 光引擎(单引擎 7.2T)自研 ICN Switch,片间互联 1200GB/s
集群上限51.2 万卡(二层 CLOS 四平面),多轨道拓扑可达 100 万卡单一集群可扩展至 50 万卡
供货节奏960DT 2027 Q1、960PR 2027 Q3;风冷 / 液冷超节点 2027 Q2 / Q3真武 V900 与磐久超节点 2027 Q1
现有基础昇腾 910C 超节点部署超 1000 套,950 超节点规模商用M890 超节点已大规模应用,跑通 Qwen3.8、Kimi K3

(数据来源:科技日报深圳特区报科创板日报上海证券报

两点可以直接读出来。

第一,两家都在谈十年尺度的集群,但公布的颗粒度不同。 华为给出了单超节点的卡数、算力和互联细节,再往上叠集群;阿里给了芯片参数和集群上限,中间一层(单超节点规格、整机算力)没有披露。对使用者来说,后者的真实可交付能力要等到明年量产后的实际部署数据才能验证。

第二,路线选择明显不同。 华为把光互联做到了封装旁边,用光替代铜来解决规模化的互联瓶颈;阿里的重点是自研互联芯片加统一编址,把上千张卡捏成一颗"超级芯片"。两条路的目标一致——让集群里的卡不再因为通信而闲置——但代价结构不同:光引擎的复杂度与良率控制是前者的风险,互联芯片与软件栈的成熟度是后者的风险。

水位线被抬高:基板成了新的排队项目

系统规模上去以后,供应链的瓶颈也在往上移。

据 DIGITIMES 报道,字节跳动计划到 2030 年每年投入约 1000 亿元人民币(约合 149 亿美元)采购芯片封装基板。报道提到,即使是封装基板厂商重启扩产,这一采购规模仍可能超出供应商能够承接的水平;华为海思、海光信息与字节跳动等都在争夺相关产能(电子工程专辑云头条)。

这和 2023 年以来的"抢 GPU"不是同一件事。封装基板的紧俏来自更上游:高端产能已被英伟达等大客户通过长期合约提前锁定,后来者若订单体量不够大,很难拿到优先供应;部分基板厂商甚至要求客户预付最高相当于产能价值 50% 的款项,或参与共同扩产作为供货前提(云头条)。

需要说明的是,报道中关于字节自研 AI 芯片的部分,字节方面曾回应"相关自研芯片报道并不准确"。采购基板与自研芯片之间存在关联是媒体与供应链的推断,不是官方确认的事实。

存储侧的动作同样在加速。据 DigiTimes 报道,三星计划将 HBM 月产能从今年的 18 万片晶圆提升至明年的 25 万片,增幅约 40%;HBM4 系列在产品线中的占比将从今年的 40% 提升至明年的 80%;支撑扩产的玻璃载板采购量提升至今年的 2.5 倍,从每月 2 万片增加到 5 万片(快科技)。TrendForce 的预测是,2027 年 HBM 比特出货量预计同比增长 50% 至 60%,但仍不足以满足需求增长,议价权仍偏向供应商(同上)。

把这些拼起来,可以看到一条完整的传导链:模型参数规模推高集群规模,集群规模推高互联与内存规格,互联与内存规格再推高封装基板与 HBM 的用量。 每一次发布会公布的"更大数字",最后都要在这些产能上兑现。

三个需要打问号的地方

发布会的参数表和真实集群之间,隔着几道常见的落差。

第一,集群上限是设计目标,不是已交付容量。 51.2 万卡、100 万卡、50 万卡都是架构层面的扩展能力描述,还需要软件栈、供电、散热、故障率全部跟上。华为自己给出的超节点可用度 99.8% 是产品指标;放到 50 万卡规模,单点故障带来的影响面会被放大,这是任何一家都要面对的系统工程题。

第二,MFU 的 2.75 倍来自仿真。 它是华为马尔科夫实验室的仿真结论,并附带了"具体模型表现上倍数并非一概而论"的限定。仿真是必要的论证方式,但它不等同于客户现场的长周期实测。

第三,量产时间是承诺,不是结果。 真武 V900 从原计划的 2027 年第三季度提前到第一季度,昇腾 960DT 提前三个季度——两家都在加速,但芯片从"发布"到"量产售卖"、再到"规模化部署",中间通常还有良率爬坡与软件适配两关。2027 年第一季度会是一个密集的验证窗口。

观察

把这一周放回到更长的时间线上看,变化其实很清楚。

从 2023 年到 2025 年,评价一颗 AI 芯片的常用指标是单卡算力、显存容量和带宽。 到了 2026 年,这些指标仍然重要,但已经不足以描述一套系统的能力——能不能在 4096 卡、10 万卡甚至更大规模上把算力利用率维持住,成了新的分水岭。 堆卡的收益递减是这道题的起点,超节点是答卷。

这也是为什么两场发布会里,被反复提到的词不是"算力",而是"互联""统一编址""全光"。这些词描述的都不是某一张卡有多快,而是一堆卡在一起时损失了多少。 当单芯片的性能提升逐渐撞上工艺与功耗的墙,"少损失一点"就变成了比"多快一点"更现实的收益来源。

对国内产业链而言,这一轮竞争还带来了一个副产品:标准与生态的话语权开始被摆上桌。 华为已在国际标准组织 OIF 提出 NPO 标准立项建议;CANN 计算框架全面开源并进入常态化社区运营;阿里则把 CPU 与 AI 芯片的互联做成了自研总线。硬件的竞争最终会落到标准与工具链上,而这两者恰恰是更难在短期追上的部分。

至于谁会率先把 50 万卡级集群跑成日常——这个问题现在还没有答案。可以确定的是,接下来值得盯的不是下一场发布会的参数表,而是 2027 年上半年的实际部署数据:MFU 是多少、可用度是多少、每 token 的成本降了多少。 到了那个阶段,数字才会从 PPT 走进电费单。

(内容由AI生成,仅供参考)