百万处理器当一台计算机:华为 Peerium 要改的是通信范式,不只是规模
TL;DR 速览
- 事件:9-17 华为发布面向 AI 时代的Peerium 计算架构,官方表述是让百万级处理器成为一台计算机,用于满足持续增长的 AI 算力需求
- 三个"突破":以Nested BSP突破图灵范式、扩展冯·诺依曼单机架构、颠覆长期主从架构
- 技术支点:基于嵌套并行、统一内存寻址、平等互联实现百万级强扩展;**灵衢(UnifiedBus, UB)**是关键互联技术,一条开放协议总线联接 CPU / NPU / 内存 / SSD / 网卡 / 交换机
- 落地状态要分清:首代产品是Atlas 950 超节点,25.6 万卡集群已在部署中;基于NPO(近封装光学)的 Atlas 960 系统正在测试中—— 都还不是"已上线"
- 同日另一条线:昇腾 960 芯片将提前至2027 年 Q1发布、官方称性能翻番
9 月 17 日,华为在上海发布了一个新的计算架构,名字叫 Peerium。官方对它的描述是"能实现百万级处理器成为一台计算机,以满足不断发展的 AI 算力需求"。华为轮值董事长徐直军给出的表述是,基于 Peerium 架构持续打造满足客户训练和推理需求的超节点和集群。
官方稿件里列了三条"突破",措辞很重:突破图灵范式并提出 Nested BSP、突破冯·诺依曼单机架构、颠覆长久以来的主从架构。官方同时公布了实现路径上的三个技术支点——嵌套并行、统一内存寻址、平等互联——以及一个叫"灵衢"的互联技术。
对这类架构级发布,比记结论更有用的是拆开看它到底在解决什么物理限制。
一、Nested BSP:把一次全局同步拆成层级同步
BSP(Bulk Synchronous Parallel,整体同步并行)是经典的大规模并行计算模型,它的结构很简单:一个"超步"由三段组成——各自计算、交换数据、全局屏障同步,然后进入下一个超步。它的好处是编程模型清晰、行为可预测。
它的代价也来自同一处:全局屏障意味着最慢的那个参与者决定整体节奏。参与计算的单元越多,等待的方差越大,这个模型的扩展性就越差。这正是"规模一大就掉效率"的根源之一——不是算力不够,是同步等待把收益吃掉了。
Nested BSP,顾名思义是把同步嵌套化:同步不再是每次都全局对齐,而是分成层级——层内先对齐,层间再对齐。这样最慢节点的等待方差不会被无差别地放大到整个系统。这是"百万级强扩展"能成立的前提,因为在这个规模上,全局屏障的开销已经无法用"多给点算力"来抵消。
需要说清楚的是:嵌套并行本身不是全新的并行计算思想,经典并行计算里早有层次化同步的做法。这次的价值在于把它作为百万级处理器的架构基础提出来,并且配了对应的互联与内存模型。
二、"颠覆主从架构"针对的是什么成本
传统超节点的组织方式是主从(master-slave):CPU 或某个主机节点是中心,NPU、存储、网卡作为从设备挂在它下面。任何跨设备的访问,往往要先经过主机中转。
这个结构在小规模时很自然,规模一大就暴露两个问题:
跳数增加,延迟随之增加。数据从 A 设备到 B 设备的路径不是直接连线,而是要经过中间的调度点。
带宽被中心节点限制。中心节点的带宽成为整体带宽的上限,堆再多设备也只是让中心更堵。
官方用到"颠覆"这个词,对应的就是取消这种中心化路径:让计算、存储、网络之间实现"平等互联"。对上层的影响是,跨设备访问和本地访问之间的差距被压缩,编程模型才可能从"尽量本地化"转向"不必刻意关心数据在哪"。
三、统一内存寻址改变的是编程模型
这条容易被当成实现细节带过,其实它影响最直接。
在传统的分层存储模型里,存储层级是显式的:哪些数据在显存、哪些在主机内存、哪些在远端节点,程序必须知道,并且要显式搬运。这套模型的成熟表现就是各种"offload"和"prefetch"技术——本质上都是在替人工管理数据搬运。
统一内存寻址意味着这些层级进入同一个地址空间,访问通过地址而不是通过显式的搬运调用完成。对做大规模训练的人来说,这减掉的是大量与计算逻辑无关的调度代码。
但也要看到它的隐含要求:统一寻址必须建立在足够快、足够可靠的互联之上,否则"地址可达但访问很慢"会让性能变得不可预测。所以统一寻址和平等互联这两件事是绑在一起的——这也解释了为什么官方把它们放在同一段里讲。
我做技术选型判断时有个习惯:凡是"架构级宣称",先找它对应的物理约束是什么,再看它拿什么去换。宣称越大的方案,越需要看清被交换掉的是什么。墨衍 里我把这类素材和判断依据一起存档,避免过段时间只记得结论、忘了前提。
四、灵衢:一条协议总线,把三种资源接在一起
灵衢(英文对应 UnifiedBus,UB)是实现 Peerium 架构的关键互联技术。官方定义是:基于一个开放协议、可无限扩展地联接 CPU、NPU、内存、SSD、网卡和交换机的高速总线。有了它,可以实现计算、存储和网络的平等互联。
三个特点值得单独记:
"一个开放协议"是核心表述。官方强调的是单一协议覆盖多类设备,而不是为每类设备维护一套专用互联。协议统一的意义在于扩展时不需要为每种新设备重新设计连接方式。
"可无限扩展"是针对规模上限的说法。一个互联方案的扩展性上限通常由拓扑、跳数和协议开销共同决定,"无限"显然是指架构上不设硬性节点数上限,而不是工程上真的没有边际成本。
把 SSD 和网卡和计算放在同一层。这一点比"联接 NPU"更值得注意:存储和网络不再是挂在外围的设备,而是同一互联平面上的对等节点。这与前两节讲的"平等互联"是同一件事在不同层面的体现。
五、落地状态:本次公布的两级产品
官方给出的产品化路径是清晰的,但状态必须分清楚:
| 产品 | 状态(官方口径) |
|---|---|
| Atlas 950 超节点(Peerium 首代产品) | 25.6 万卡集群已在部署中 |
| Atlas 960 系统(基于 NPO,近封装光学) | 正在测试中 |
"在部署中"和"已上线"是两个不同的状态,写选型参考时不能混。同样,NPO(近封装光学)是把光学器件更靠近封装本体的方案,主要解决高速信号在长距离传输上的损耗与功耗问题——它是 Atlas 960 的技术标签,但系统整体仍在测试阶段。
同日还有一条相关但独立的消息:华为轮值董事长汪涛表示,昇腾 960 芯片将提前至 2027 年 Q1 发布,官方称性能翻番。把两条放在一起看,架构与芯片是并行推进的两条线:芯片决定单点算力,互联与同步范式决定这些算力能堆多高、堆上去之后还剩多少效率。
六、接下来该观察什么
架构级发布最容易被当成"愿景"看过就算,所以给出几个可验证的观察点,比记住口号有用:
第一,Nested BSP 的实际效率曲线。关键不是峰值算力,而是扩展效率随规模衰减的斜率。如果嵌套同步确实解决了全局屏障问题,衰减斜率应该显著优于传统方案——这需要看大规模训练任务上的实测数据,而不是 SPEC 类的微基准。
第二,编程模型的实际改动量。统一内存寻址如果真能减少显式搬运代码,那么把现有的大规模训练框架迁移过来需要改多少代码,是最实在的验证。
第三,灵衢生态的开放程度。"开放协议"的价值取决于有多少第三方设备厂商真的接进来。如果只有自家设备支持,那它仍然是一套专有互连。
第四,25.6 万卡集群的交付进度与稳定性。这个规模的集群,稳定性本身就是一个独立难题——单点故障的恢复机制、故障率与有效算力之间的关系,都会在真实负载下暴露。
对普通开发者的实际意义:这些变化短期内不会改变你写代码的方式,但会逐步影响你选云和选硬件的逻辑。当"堆规模"的效率衰减被压平之后,可用的算力档位会上一个台阶——那时受影响的是推理成本、长上下文能力,以及能不能把更大的模型跑在更小的预算里。这几件事,最终都会传导到应用层。