简介:华为数据中心虚拟化解决方案是一份面向IT架构师、系统运维及云计算学习者的技术文档,重点解决企业数据中心资源利用率低、业务连续性差和运维复杂等痛点。文档系统介绍了FusionSphere虚拟化技术,涵盖计算资源池构建、HA高可用、虚拟机热迁移、SAN存储架构及HyperDP备份方案,并详解了FusionCompute与FusionManager的分工:前者提供服务器、存储、网络的基础虚拟化,后者负责统一拓扑、告警监控与容量管理。全文还给出了单数据中心方案拓扑,包含接入控制、虚拟化资源池、存储资源池、备份系统等模块,可直接作为虚拟化项目规划与方案设计的参考蓝本。资源包为单个docx文件,大小355KB,内容结构清晰。目前已有230人学习下载,适合需要快速了解华为数据中心虚拟化体系或撰写技术方案的读者。
1. 华为数据中心虚拟化解决方案:先看它到底管的是哪一层
做数据中心运维的人,几乎都会在某个阶段遇到这样一个提问:机房里有十几台甚至上百台服务器,CPU、内存、磁盘利用率参差不齐,有的机器跑得冒烟,有的机器闲着吃灰,新业务申请资源要等一周流程。华为数据中心虚拟化解决方案,就是为了解决这个问题而存在的一套软件定义计算、存储、网络的资源池化平台。它对应的落地产品形态,就是绝大多数华为虚拟化项目里看到的 FusionCompute,配合 FusionManager 做多数据中心统一管理,再往上叠加运维、备份和容灾组件。它不只是一套安装包,而是一个完整的交付方案,覆盖服务器选型、网络规划、存储设计、虚拟机规格、集群高可用策略和日常运维口径。
这篇文章写给两类人:一类是刚接手华为虚拟化平台、被一堆端口和名词绕晕的新手运维;另一类是正在评估要不要把现网 VMware 或其他平台迁到华为方案的技术负责人。我不打算给你讲大而全的产品宣传,而是把这个方案拆成“架构、部署、网络存储、避坑、验证”五段,按我在数据中心里落地这套东西的实际路径来写。你会看到哪些参数值得调,哪些坑是看了文档也会翻车的。
2. 架构先立住:FusionCompute 里 VRM、CNA 和管理平面各管哪段
2.1 控制节点(VRM)与计算节点(CNA)的职责划分
华为数据中心虚拟化解决方案的核心控制面是 VRM(Virtual Resource Management),它承担集群管理、虚拟机调度、资源分配策略、高可用判定和 API 接入。一个 VRM 可以管理多个集群,VRM 本身支持主备部署,主备之间通过心跳协商,故障时备节点接管。这里有个关键设计:VRM 是管理面,不是数据面,虚机流量不经过 VRM,所以不要担心管理节点成为瓶颈。但 VRM 出问题会直接影响迁移、HA 和新建虚机的调度,因此生产环境一定不能用单节点。
CNA(Compute Node Agent)是跑在每台物理服务器上的计算节点代理,它负责执行 VRM 下发到本机的操作,比如启动虚拟机、挂载磁盘、配置网卡、执行迁移。CNA 和 VRM 之间的通信走管理网络,端口一般用 8443 和 8080 之类的 HTTPS 端口,具体端口号在不同版本里略有差异,但调通的前提是管理网络二层互通、防火墙不拦截双向 TCP。你在部署时如果发现主机状态显示“异常”或“未受管理”,第一步永远是先 ping VRM 的管理 IP,而不是去看一堆日志。
2.2 管理平面、存储平面、业务平面的网络设计
华为这套方案在规划网络时,官方建议和现网常见的做法都是把网络拆成三张独立的平面:管理平面、存储平面、业务平面。管理平面承载 VRM 与 CNA 的通信、CNA 与存储设备的管理通信;存储平面承载虚拟机的磁盘 IO,走 iSCSI、FC 或者 FusionStorage 的网络;业务平面承载虚拟机对外提供服务的流量。三个平面原则上要隔离,用 VLAN 划分或者物理分网都行。我一般建议至少把存储平面和业务平面从物理上分开,因为存储流量是持续大流量,一旦和业务抢带宽,虚机 IO 延迟会肉眼可见地抖动。
网络参数上有几个值得注意的地方。网卡绑定策略,管理面和存储面推荐配置为主备模式而不是负载均衡模式,原因是多数存储设备不支持同一会话的多路径负载均衡,配置不当反而会造成 IO 乱序。业务面可以根据流量模型做链路聚合(LACP),但要确认交换机侧启用了对应的动态 LACP 模式。另外,**Jumbo Frame(巨型帧)**在存储网络的交换机端口和服务器网卡上要一致地开启,两端 MTU 设置为 9000,如果不一致,存储流量会表现为时通时断,这种问题排查起来非常耗时间。
2.3 版本演进与选型信号
部署前还要面对一个现实问题:市面上的项目里既有基于 Xen 的旧版本,也有基于 KVM 的新版本。华为的数据中心虚拟化方案在版本演进中逐步迁移到了 KVM 技术栈,现在是主流形态。新版本在 CPU 虚拟化效率、内存复用、GPU 直通和容器协同上都有明显改进。如果是从旧版本升级,我建议优先考虑采用迁移到新平台重建的方式,而不是在原平台原地升级。原地升级的最大风险在于:升级过程中一旦存储驱动或网卡驱动不兼容,整个集群的虚拟机都面临中断,而新平台重建可以分批割接,每批验证后再迁移下一批。
选型信号也可以看规模。二十台以内的小规模场景,直接部署 FusionCompute,VRM 主备部署在两台小虚拟机或物理机上就够了。规模到上百台、多个机房互联时,就需要引入 FusionManager 做多集群统一视窗、资源审批流程和跨数据中心调度。判断标准其实很简单:如果你在管理界面找一台虚拟机要翻半天,或者不同机房的管理面各自为政,那就是该上多数据中心管理层的信号。
3. 把平台落进机房:华为虚拟化平台部署的关键步骤与参数
3.1 部署前的 BIOS 与 RAID 准备
虚拟化平台安装的第一道坎不是软件,而是服务器底层配置。华为的服务器进 BIOS 后,必须确认打开了 CPU 的虚拟化功能:Intel 平台对应 VT-x,AMD 平台对应 AMD-V。很多人会看到提示“此平台不支持虚拟化的 amd-v”,这时候第一反应不应该是怀疑 CPU 型号,而是先检查 BIOS 是否禁用了虚拟化开关。尤其批量采购的服务器,厂商默认可能关闭该选项,一定要逐台检查。部分机型还需要在 BIOS 中开启 VT-d(I/O 虚拟化),否则后面做 PCIe 直通或 GPU 直通时会发现设备无法分配给虚拟机。
RAID 配置同样需要提前规划。CNA 所在物理机通常用两块 SAS/SATA 盘做 RAID1 装系统,剩余磁盘按存储方案决定是不做 RAID 直通给分布式存储,还是做 RAID5/RAID6 后交给虚拟化平台作为本地数据存储。这里有个经验值:本地盘场景下 RAID 卡缓存策略要设置为“Write Back + 电池保护”,如果 RAID 卡没有电容/电池保护,则必须改回 Write Through,否则突然断电可能丢数据。存储面磁盘数量太少时不要强行开 RAID6,两个盘做 RAID6 是浪费容量,两台起步的规模直接 RAID1 更合理。
3.2 安装 VRM 与 CNA 的路径和参数
VRM 的安装一般有两种落地方式:一种是在物理机上直接安装,另一种是先在裸金属上装好 CNA,再在 CNA 上创建一个虚拟机来承载 VRM。绝大多数项目采用第二种,因为节省物理服务器,而且 VRM 虚拟机跟随集群资源调度,部署更灵活。安装 VRM 时,需要准备虚拟机的规格建议是 4 核 CPU、8GB 内存、100GB 磁盘,这个规格对千台虚拟机以内的规模是够用的。超过这个规模再加配置,但加配置的过程需要停机。
CNA 的安装相对机械:通过 ISO 引导服务器,配置管理 IP、子网掩码和网关,然后指向 VRM 的 IP 完成注册。一个容易忽略的参数是主机名,务必按机房资产规范命名,形如site-rack-server的格式,否则后续定位故障时很难辨认。安装完成后在 FusionCompute 界面能看到主机状态变为“正常”,如果状态是“连通性异常”,最常见就是管理 IP 不通,或者 VRM 侧没有放通对应端口。检查命令其实很简单,我一般手动敲一条,确认三平面能通再继续:
ping -c 3 <VRM管理IP> # 若不通,先查网线/光纤状态与交换机端口是否UP代码逻辑很简单:先确认二层可达,再看 VLAN 和防火墙规则。很多部署卡在这一步是因为人忙着在界面上看状态,忘了从底层网络开始查。
3.3 创建集群与添加主机
VRM 和 CNA 都就绪后,接下来操作界面上创建集群。集群是资源管理的基本单元,HA、DRS 这类能力都是按集群粒度开启的。创建集群时需要设置几个关键参数:一个是“CPU 兼容模式”,建议选择“严格兼容”,这样热迁移时不会因为指令集差异而失败;另一个是“内存复用”,默认是开启的,但如果虚拟机跑的是数据库这类内存敏感型业务,我建议针对该业务单独设置关闭复用,避免超配导致的内存争抢。
添加主机时,FusionCompute 会要求输入 CNA 的管理账号密码。这里要注意:添加过程中系统会自动检查主机 CPU、内存、网卡驱动兼容性,发现有硬件不在兼容列表里时,界面会报错或告警。不建议强行忽略这类报错,数据中心里“硬件不在列表”往往意味着后续迁移或休眠唤醒时会遇到黑匣子般的问题。添加主机完成后,第一件事是先做一次虚拟化健康检查:在“主机”页面确认 CPU 虚拟化标志是否启用、存储心跳是否正常,再创建测试虚拟机验证业务网络。
部署完成后的最小验收项
| 检查项 | 预期结果 | 失败时重点排查方向 |
|---|---|---|
| VRM 管理界面登录 | 正常显示资源概览 | VRM 虚拟机状态、数据库服务 |
| 主机状态 | 正常,无告警 | 管理网络、VRM 与CNA心跳 |
| 存储数据存储 | 已就绪,容量正确 | 存储网络、多路径配置 |
| 创建一台测试虚拟机 | 启动成功、网络可通 | 网络策略、安全组、DHCP |
4. 网络与存储的日常操盘:分布式交换机、存储池和虚拟机承载参数
4.1 分布式交换机的几个必调参数
华为虚拟化平台的网络核心是分布式交换机。每个宿主机上都会创建vSwitch,管理流量和业务流量分别绑定在不同虚拟交换机上。配置分布式交换机时,第一个要确定的是上行链路,也就是绑定哪些物理网卡。生产环境建议至少两根物理网卡做绑定,绑定模式选“负载均衡”还是“主备”取决于上联交换机的链路聚合方式。
第二个必调参数是端口组策略。同一台分布式交换机上可以建多个端口组,对应不同 VLAN。这里最容易翻车的是 VLAN 模式的设置——界面上有“VLAN 透传”和“VLAN 标签”两种模式。虚拟机网卡用的是“VLAN 标签”模式,需要指定 1~4094 之间的 VLAN ID;“VLAN 透传”一般给虚拟机内部再开子虚拟化或多租户场景用。用错了标签,虚机网络表现为能 ping 通网关但访问不了同网段其他机器,或者干脆完全不通。
第三个参数是网络 QoS。对业务虚拟机,建议在端口组上设置“平均带宽”和“峰值带宽”。有业务方抱怨虚拟化网络不如物理机稳定,很大原因是没做带宽限制,某台虚拟机跑备份占满网卡,其他机器全部受到牵连。设置合理的 QoS 不是限速,而是保护整个集群的可用性。
4.2 存储资源池划分与磁盘类型选择
存储规划直接影响虚拟机 IO 的命根。华为方案中,存储可以对接商业 SAN 存储、FusionStorage 分布式存储,也可以使用服务器本地磁盘。三类存储的定位完全不同:商业 SAN 存储适合核心数据库和稳定性要求高的业务;FusionStorage 适合既要容量又要性能、还要弹性扩展的云化业务;本地磁盘则适合测试环境或 IO 要求不高的应用。它们在管理界面上都一样,但故障表现完全不一样。
创建存储资源池时,一个经常被忽略的参数是“多路径类型”。同一台服务器连接存储阵列时,路径数量、链路类型(FC 或 iSCSI)不同,多路径策略也应该不同。华为平台通常会自动识别,但有时候需要手动指定为“ALUA”或“非对称”模式。你可以观察存储数据存储的路径状态:如果显示有多条路径但都是“不可用”或“降级”,那多半是存储侧的控制器配置和主机侧多路径策略不匹配指向了不同控制器。
磁盘类型的选取上也有一套经验值:虚拟机系统盘用“精简置备”模式,可以节省空间;数据库数据盘用“厚置备延迟置零”或“厚置备快速置零”,避免运行中出现磁盘空间不足和写零带来的性能尖刺。把虚拟机快照当作备份手段是反面典型,快照链过深会磁盘 IO 急剧下降,我见过一个项目,快照链到了六层,整机启动耗时超过四十分钟。任何情况下,快照只能当临时后悔药,不能当备份策略。
4.3 虚拟机规格记忆表:CPU 预留、内存复用与磁盘置备
创建虚拟机时,很多新手直接用默认配置,之后业务变卡才开始逐项排查。这里我列一份参数记忆表,方便你在创建虚拟机的时候直接参考。CPU 部分,核心数按业务实际负载设置,但必须关注“CPU 预留”和“份额”。有 SLA 要求的核心业务,预留 100%,份额调高;普通业务不需要预留,份额可以低一些。内存部分,平台支持内存复用(超配),但对延迟敏感的 Java 应用和数据库应用,建议关闭内存复用并设置“内存预留”。磁盘部分,按前文说的匹配置备模式即可。
| 业务类型 | CPU 预留 | 内存复用 | 磁盘置备 | 网络 QoS |
|---|---|---|---|---|
| 核心数据库 | 100% | 关闭 | 厚置备快速置零 | 高优先级+峰值限速 |
| Web/应用服务器 | 不预留 | 开启 | 精简置备 | 普通优先级+限速 |
| 测试/开发机 | 不预留 | 开启 | 精简置备 | 低优先级+严格限速 |
这张表不是死规矩,但它代表一套可落地的默认建议。实际生产里我还会做一件事:对固定的业务类型建立“虚拟机模板”。从模板发放虚拟机比从头创建快得多,模板制作的关键在于 Sysprep 或类似工具的配置——华为平台支持自定义虚拟机参数,在模板中设置好主机名、IP 和管理密码的变量,发放时自动替换,省掉每次登录虚机改网络的时间。模板要定期更新补丁,否则新发的虚机天生带有旧漏洞。
5. 运维避坑:华为虚拟化方案最常见的 5 个故障与排查方法
5.1 主机失联:CNA 与 VRM 心跳异常
现象:管理界面某台主机显示为“异常”或“维护中”但实际没有人为操作,节点上虚拟机仍在运行,但无法进行迁移和新建虚拟机。
原因:CNA 与 VRM 之间的心跳链路中断,通常是管理网络抖动、CNA 负载过高导致心跳响应超时,或者 VRM 误判。华为平台默认对主机做周期性心跳检测,如果连续多次未收到 CNA 响应,就标记为主机异常。
解决:先确认管理 IP 是否能 ping 通;能通的话登录到 CNA 后台,检查 CPU 负载和vrmserver相关进程是否异常。检查管理网卡是否发生链路切换,如果网卡绑定组在切换瞬间丢包,需要把心跳超时时间调大。调整路径是 VRM 的配置文件,一般调大超时倍率到默认值的 1.5 倍,能显著减少误报。
5.2 虚拟机 IO 抖动:存储链路复用导致的拥塞
现象:业务报告磁盘写延迟飙升,出现阶段性的卡顿,但存储阵列本身的 CPU 和缓存负载并不高。
原因:存储网络配置成了单链路,或者多链路之间负载不均衡。常见错误是 iSCSI 场景下多个 VLAN 复用了同一对物理网卡,链路本身没有拥塞,但虚拟交换机排队机制导致的报文延迟变大。
解决:在分布式交换机上为存储流量单独划一个上行链路,或者物理上把存储业务挪到专用交换机端口。同时检查多路径链路在所有主机上数量一致,避免出现一台主机 4 条路径、另一台主机 2 条路径的情况,路径数量不一致会导致 IO 负载失衡。
5.3 热迁移失败:CPU 指令集与内存复用参数冲突
现象:在线迁移虚拟机到另一台主机时,进度卡在 90% 后回滚,迁移失败。
原因:两台宿主机 CPU 型号存在差异,新指令集不兼容,或者目标主机的内存复用开启,迁入后内存资源无法满足虚拟机预留。
解决:把集群 CPU 兼容模式改成“严格兼容”并重新启动集群内虚拟机让配置生效;对迁移目标主机单独检查内存复用率和可用内存。最好的办法是提前查看 CPU 型号库——华为平台提供 CPU 兼容性档案,不同物理机混插时先在界面上查看兼容性评估结果再做迁移,不要硬迁移再排查。
5.4 Linux 虚拟机网卡丢包:vNIC 队列与 CPU 绑核
现象:Linux 虚拟机大量 TCP 重传,但网络带宽没有跑满,物理网卡也不存在错包。
原因:vNIC 多队列配置不正确,中断没有分发到多个 CPU 核心。华为平台默认虚拟机网卡队列数与 vCPU 数量相关,如果虚拟机 CPU 数量多但队列数被限制,会造成单核软中断处理瓶颈,吞吐量上不去且伴随丢包。
解决:将虚拟机的 vNIC 队列数提升到与 vCPU 数量一致,同时在虚拟机操作系统内设置 RSS(Receive Side Scaling)。对于高流量业务,还可以配合 CPU 绑核,把网卡中断绑定到固定的物理 CPU 核上,避免中断在核间漂移造成缓存命中下降。
5.5 去虚拟化与异构迁移:从 VMware 迁到华为平台
现象:项目里从 VMware 环境迁入华为平台,虚拟机导出再导入后启动蓝屏或无法加载磁盘。
原因:Windows 虚拟机在原有平台使用了特定虚拟硬件,尤其是 IDE 控制器、网卡型号迁移后驱动不识别。很多人以为“去虚拟化工具”能通吃,但实际上不同虚拟化平台间的磁盘控制器、网卡型号差异依然存在,迁移前不处理设备驱动就会翻车。
解决:在源平台先把目标机器转为通用设备驱动再迁移。Windows 系统提前注入华为虚拟化平台的 VirtIO 网卡和磁盘控制器驱动,方法是在源虚机上暂时添加一块新网卡并安装驱动,确认驱动可用后再进行迁移导入。Linux 系统则重新生成 initramfs,确保能加载新平台的存储驱动模块。迁移后的虚拟机要第一时间安装平台工具,否则后续做快照、备份和热迁移都会受限。
6. 验证与进阶:把虚拟化平台的性能压出来
搭建完成只是第一步,交付一个数据中心虚拟化方案,最后要的是能证明它真正可用。我一般会在平台割接前做一份一小时的验收测试,内容集中在三个点:虚拟机生命周期操作是否稳定、热迁移在大压力下是否成功、存储故障时 HA 是否按预期拉起业务。
1 小时验收清单:批量创建 10 台虚拟机并发启动,记录平均启动时间;挑选其中一台跑 FIO 测试磁盘顺序读和随机写,对比物理机基线;在业务流量持续的情况下热迁移一台核心虚拟机,观察是否存在超过 5 秒的流量中断;最后拔掉一台主机的存储链路模拟故障,观察该主机上的虚拟机是否自动漂移到其他节点。这套测试跑完,平台的基础能力就有了底。
进阶方向上,关注混合负载场景。现在数据中心已经不单是跑虚拟机了,GPU 虚拟化和容器化会越来越多地和虚拟化平台并存。华为的虚拟化平台支持把 GPU 直通给虚拟机,或者切分后共享给多个虚拟机,后端训练、前端推理可以共用同一台物理服务器。在华为杯数学建模这类需要快速调度计算资源的场景里,虚拟化资源池配合调度策略,能明显缩短环境准备时间。另外,信创/国产化改造趋势下,麒麟天逸终端虚拟化平台、ARM 架构服务器与 x86 平台的异构统一管理也值得提前评估。
我自己的习惯是每季度做一次“配置漂移检查”:核对分布式交换机端口策略、存储多路径状态、虚拟机模板版本,把该清的快照清掉、该补的补丁补上。虚拟化平台并不神秘,大部分故障都是配置漂移和环境变更积累出来的。把这个底子打好,平台会安静地替你扛住业务。希望帮到你。
本文还有配套的精品资源,点击获取