2000 台 × 8 卡 = 16000 燧原 GCU 的规模,海光 x86 作为主控/数据预处理/CPU 侧科学计算节点,PyTorch 通过燧原驭算(TopsRider)栈映射到 GCU,分布式集合通信使用燧原ECCL(对应 NCCL 的国产化替代,PyTorch 接口层把"nccl"替换为"eccl")。燧原招股书明确其基于 RoCEv2 的高性能互连可支撑万卡级集群,驭算已无缝支持 PyTorch、TensorFlow、Megatron-LM、DeepSpeed 等框架。
⚠️ 重要前提:在燧原 GCU 上不能直接写
backend="nccl",需替换为backend="eccl",且torch.cuda.*体系需改用燧原对应的torch.gcu.*接口。下文代码以"逻辑等价"方式给出,实际部署时按燧原 SDK 文档做接口映射。
一、并行计算总体建模与拓扑
1.1 集群拓扑与并行维度划分
16000 卡的最优并行分解(参考 4D 并行最佳实践):
并行维度 | 规模 | 作用域 | 通信后端 |
|---|