ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

华为数据中心虚拟化方案全解:FusionCompute架构部署与避坑指南

华为数据中心虚拟化方案全解:FusionCompute架构部署与避坑指南 简介华为数据中心虚拟化解决方案是一份面向IT架构师、系统运维及云计算学习者的技术文档重点解决企业数据中心资源利用率低、业务连续性差和运维复杂等痛点。文档系统介绍了FusionSphere虚拟化技术涵盖计算资源池构建、HA高可用、虚拟机热迁移、SAN存储架构及HyperDP备份方案并详解了FusionCompute与FusionManager的分工前者提供服务器、存储、网络的基础虚拟化后者负责统一拓扑、告警监控与容量管理。全文还给出了单数据中心方案拓扑包含接入控制、虚拟化资源池、存储资源池、备份系统等模块可直接作为虚拟化项目规划与方案设计的参考蓝本。资源包为单个docx文件大小355KB内容结构清晰。目前已有230人学习下载适合需要快速了解华为数据中心虚拟化体系或撰写技术方案的读者。1. 华为数据中心虚拟化解决方案先看它到底管的是哪一层做数据中心运维的人几乎都会在某个阶段遇到这样一个提问机房里有十几台甚至上百台服务器CPU、内存、磁盘利用率参差不齐有的机器跑得冒烟有的机器闲着吃灰新业务申请资源要等一周流程。华为数据中心虚拟化解决方案就是为了解决这个问题而存在的一套软件定义计算、存储、网络的资源池化平台。它对应的落地产品形态就是绝大多数华为虚拟化项目里看到的 FusionCompute配合 FusionManager 做多数据中心统一管理再往上叠加运维、备份和容灾组件。它不只是一套安装包而是一个完整的交付方案覆盖服务器选型、网络规划、存储设计、虚拟机规格、集群高可用策略和日常运维口径。这篇文章写给两类人一类是刚接手华为虚拟化平台、被一堆端口和名词绕晕的新手运维另一类是正在评估要不要把现网 VMware 或其他平台迁到华为方案的技术负责人。我不打算给你讲大而全的产品宣传而是把这个方案拆成“架构、部署、网络存储、避坑、验证”五段按我在数据中心里落地这套东西的实际路径来写。你会看到哪些参数值得调哪些坑是看了文档也会翻车的。2. 架构先立住FusionCompute 里 VRM、CNA 和管理平面各管哪段2.1 控制节点VRM与计算节点CNA的职责划分华为数据中心虚拟化解决方案的核心控制面是 VRMVirtual Resource Management它承担集群管理、虚拟机调度、资源分配策略、高可用判定和 API 接入。一个 VRM 可以管理多个集群VRM 本身支持主备部署主备之间通过心跳协商故障时备节点接管。这里有个关键设计VRM 是管理面不是数据面虚机流量不经过 VRM所以不要担心管理节点成为瓶颈。但 VRM 出问题会直接影响迁移、HA 和新建虚机的调度因此生产环境一定不能用单节点。CNACompute Node Agent是跑在每台物理服务器上的计算节点代理它负责执行 VRM 下发到本机的操作比如启动虚拟机、挂载磁盘、配置网卡、执行迁移。CNA 和 VRM 之间的通信走管理网络端口一般用 8443 和 8080 之类的 HTTPS 端口具体端口号在不同版本里略有差异但调通的前提是管理网络二层互通、防火墙不拦截双向 TCP。你在部署时如果发现主机状态显示“异常”或“未受管理”第一步永远是先 ping VRM 的管理 IP而不是去看一堆日志。2.2 管理平面、存储平面、业务平面的网络设计华为这套方案在规划网络时官方建议和现网常见的做法都是把网络拆成三张独立的平面管理平面、存储平面、业务平面。管理平面承载 VRM 与 CNA 的通信、CNA 与存储设备的管理通信存储平面承载虚拟机的磁盘 IO走 iSCSI、FC 或者 FusionStorage 的网络业务平面承载虚拟机对外提供服务的流量。三个平面原则上要隔离用 VLAN 划分或者物理分网都行。我一般建议至少把存储平面和业务平面从物理上分开因为存储流量是持续大流量一旦和业务抢带宽虚机 IO 延迟会肉眼可见地抖动。网络参数上有几个值得注意的地方。网卡绑定策略管理面和存储面推荐配置为主备模式而不是负载均衡模式原因是多数存储设备不支持同一会话的多路径负载均衡配置不当反而会造成 IO 乱序。业务面可以根据流量模型做链路聚合LACP但要确认交换机侧启用了对应的动态 LACP 模式。另外**Jumbo Frame巨型帧**在存储网络的交换机端口和服务器网卡上要一致地开启两端 MTU 设置为 9000如果不一致存储流量会表现为时通时断这种问题排查起来非常耗时间。2.3 版本演进与选型信号部署前还要面对一个现实问题市面上的项目里既有基于 Xen 的旧版本也有基于 KVM 的新版本。华为的数据中心虚拟化方案在版本演进中逐步迁移到了 KVM 技术栈现在是主流形态。新版本在 CPU 虚拟化效率、内存复用、GPU 直通和容器协同上都有明显改进。如果是从旧版本升级我建议优先考虑采用迁移到新平台重建的方式而不是在原平台原地升级。原地升级的最大风险在于升级过程中一旦存储驱动或网卡驱动不兼容整个集群的虚拟机都面临中断而新平台重建可以分批割接每批验证后再迁移下一批。选型信号也可以看规模。二十台以内的小规模场景直接部署 FusionComputeVRM 主备部署在两台小虚拟机或物理机上就够了。规模到上百台、多个机房互联时就需要引入 FusionManager 做多集群统一视窗、资源审批流程和跨数据中心调度。判断标准其实很简单如果你在管理界面找一台虚拟机要翻半天或者不同机房的管理面各自为政那就是该上多数据中心管理层的信号。3. 把平台落进机房华为虚拟化平台部署的关键步骤与参数3.1 部署前的 BIOS 与 RAID 准备虚拟化平台安装的第一道坎不是软件而是服务器底层配置。华为的服务器进 BIOS 后必须确认打开了 CPU 的虚拟化功能Intel 平台对应 VT-xAMD 平台对应 AMD-V。很多人会看到提示“此平台不支持虚拟化的 amd-v”这时候第一反应不应该是怀疑 CPU 型号而是先检查 BIOS 是否禁用了虚拟化开关。尤其批量采购的服务器厂商默认可能关闭该选项一定要逐台检查。部分机型还需要在 BIOS 中开启 VT-dI/O 虚拟化否则后面做 PCIe 直通或 GPU 直通时会发现设备无法分配给虚拟机。RAID 配置同样需要提前规划。CNA 所在物理机通常用两块 SAS/SATA 盘做 RAID1 装系统剩余磁盘按存储方案决定是不做 RAID 直通给分布式存储还是做 RAID5/RAID6 后交给虚拟化平台作为本地数据存储。这里有个经验值本地盘场景下 RAID 卡缓存策略要设置为“Write Back 电池保护”如果 RAID 卡没有电容/电池保护则必须改回 Write Through否则突然断电可能丢数据。存储面磁盘数量太少时不要强行开 RAID6两个盘做 RAID6 是浪费容量两台起步的规模直接 RAID1 更合理。3.2 安装 VRM 与 CNA 的路径和参数VRM 的安装一般有两种落地方式一种是在物理机上直接安装另一种是先在裸金属上装好 CNA再在 CNA 上创建一个虚拟机来承载 VRM。绝大多数项目采用第二种因为节省物理服务器而且 VRM 虚拟机跟随集群资源调度部署更灵活。安装 VRM 时需要准备虚拟机的规格建议是 4 核 CPU、8GB 内存、100GB 磁盘这个规格对千台虚拟机以内的规模是够用的。超过这个规模再加配置但加配置的过程需要停机。CNA 的安装相对机械通过 ISO 引导服务器配置管理 IP、子网掩码和网关然后指向 VRM 的 IP 完成注册。一个容易忽略的参数是主机名务必按机房资产规范命名形如site-rack-server的格式否则后续定位故障时很难辨认。安装完成后在 FusionCompute 界面能看到主机状态变为“正常”如果状态是“连通性异常”最常见就是管理 IP 不通或者 VRM 侧没有放通对应端口。检查命令其实很简单我一般手动敲一条确认三平面能通再继续ping -c 3 VRM管理IP # 若不通先查网线/光纤状态与交换机端口是否UP代码逻辑很简单先确认二层可达再看 VLAN 和防火墙规则。很多部署卡在这一步是因为人忙着在界面上看状态忘了从底层网络开始查。3.3 创建集群与添加主机VRM 和 CNA 都就绪后接下来操作界面上创建集群。集群是资源管理的基本单元HA、DRS 这类能力都是按集群粒度开启的。创建集群时需要设置几个关键参数一个是“CPU 兼容模式”建议选择“严格兼容”这样热迁移时不会因为指令集差异而失败另一个是“内存复用”默认是开启的但如果虚拟机跑的是数据库这类内存敏感型业务我建议针对该业务单独设置关闭复用避免超配导致的内存争抢。添加主机时FusionCompute 会要求输入 CNA 的管理账号密码。这里要注意添加过程中系统会自动检查主机 CPU、内存、网卡驱动兼容性发现有硬件不在兼容列表里时界面会报错或告警。不建议强行忽略这类报错数据中心里“硬件不在列表”往往意味着后续迁移或休眠唤醒时会遇到黑匣子般的问题。添加主机完成后第一件事是先做一次虚拟化健康检查在“主机”页面确认 CPU 虚拟化标志是否启用、存储心跳是否正常再创建测试虚拟机验证业务网络。部署完成后的最小验收项检查项预期结果失败时重点排查方向VRM 管理界面登录正常显示资源概览VRM 虚拟机状态、数据库服务主机状态正常无告警管理网络、VRM 与CNA心跳存储数据存储已就绪容量正确存储网络、多路径配置创建一台测试虚拟机启动成功、网络可通网络策略、安全组、DHCP4. 网络与存储的日常操盘分布式交换机、存储池和虚拟机承载参数4.1 分布式交换机的几个必调参数华为虚拟化平台的网络核心是分布式交换机。每个宿主机上都会创建vSwitch管理流量和业务流量分别绑定在不同虚拟交换机上。配置分布式交换机时第一个要确定的是上行链路也就是绑定哪些物理网卡。生产环境建议至少两根物理网卡做绑定绑定模式选“负载均衡”还是“主备”取决于上联交换机的链路聚合方式。第二个必调参数是端口组策略。同一台分布式交换机上可以建多个端口组对应不同 VLAN。这里最容易翻车的是 VLAN 模式的设置——界面上有“VLAN 透传”和“VLAN 标签”两种模式。虚拟机网卡用的是“VLAN 标签”模式需要指定 1~4094 之间的 VLAN ID“VLAN 透传”一般给虚拟机内部再开子虚拟化或多租户场景用。用错了标签虚机网络表现为能 ping 通网关但访问不了同网段其他机器或者干脆完全不通。第三个参数是网络 QoS。对业务虚拟机建议在端口组上设置“平均带宽”和“峰值带宽”。有业务方抱怨虚拟化网络不如物理机稳定很大原因是没做带宽限制某台虚拟机跑备份占满网卡其他机器全部受到牵连。设置合理的 QoS 不是限速而是保护整个集群的可用性。4.2 存储资源池划分与磁盘类型选择存储规划直接影响虚拟机 IO 的命根。华为方案中存储可以对接商业 SAN 存储、FusionStorage 分布式存储也可以使用服务器本地磁盘。三类存储的定位完全不同商业 SAN 存储适合核心数据库和稳定性要求高的业务FusionStorage 适合既要容量又要性能、还要弹性扩展的云化业务本地磁盘则适合测试环境或 IO 要求不高的应用。它们在管理界面上都一样但故障表现完全不一样。创建存储资源池时一个经常被忽略的参数是“多路径类型”。同一台服务器连接存储阵列时路径数量、链路类型FC 或 iSCSI不同多路径策略也应该不同。华为平台通常会自动识别但有时候需要手动指定为“ALUA”或“非对称”模式。你可以观察存储数据存储的路径状态如果显示有多条路径但都是“不可用”或“降级”那多半是存储侧的控制器配置和主机侧多路径策略不匹配指向了不同控制器。磁盘类型的选取上也有一套经验值虚拟机系统盘用“精简置备”模式可以节省空间数据库数据盘用“厚置备延迟置零”或“厚置备快速置零”避免运行中出现磁盘空间不足和写零带来的性能尖刺。把虚拟机快照当作备份手段是反面典型快照链过深会磁盘 IO 急剧下降我见过一个项目快照链到了六层整机启动耗时超过四十分钟。任何情况下快照只能当临时后悔药不能当备份策略。4.3 虚拟机规格记忆表CPU 预留、内存复用与磁盘置备创建虚拟机时很多新手直接用默认配置之后业务变卡才开始逐项排查。这里我列一份参数记忆表方便你在创建虚拟机的时候直接参考。CPU 部分核心数按业务实际负载设置但必须关注“CPU 预留”和“份额”。有 SLA 要求的核心业务预留 100%份额调高普通业务不需要预留份额可以低一些。内存部分平台支持内存复用超配但对延迟敏感的 Java 应用和数据库应用建议关闭内存复用并设置“内存预留”。磁盘部分按前文说的匹配置备模式即可。业务类型CPU 预留内存复用磁盘置备网络 QoS核心数据库100%关闭厚置备快速置零高优先级峰值限速Web/应用服务器不预留开启精简置备普通优先级限速测试/开发机不预留开启精简置备低优先级严格限速这张表不是死规矩但它代表一套可落地的默认建议。实际生产里我还会做一件事对固定的业务类型建立“虚拟机模板”。从模板发放虚拟机比从头创建快得多模板制作的关键在于 Sysprep 或类似工具的配置——华为平台支持自定义虚拟机参数在模板中设置好主机名、IP 和管理密码的变量发放时自动替换省掉每次登录虚机改网络的时间。模板要定期更新补丁否则新发的虚机天生带有旧漏洞。5. 运维避坑华为虚拟化方案最常见的 5 个故障与排查方法5.1 主机失联CNA 与 VRM 心跳异常现象管理界面某台主机显示为“异常”或“维护中”但实际没有人为操作节点上虚拟机仍在运行但无法进行迁移和新建虚拟机。原因CNA 与 VRM 之间的心跳链路中断通常是管理网络抖动、CNA 负载过高导致心跳响应超时或者 VRM 误判。华为平台默认对主机做周期性心跳检测如果连续多次未收到 CNA 响应就标记为主机异常。解决先确认管理 IP 是否能 ping 通能通的话登录到 CNA 后台检查 CPU 负载和vrmserver相关进程是否异常。检查管理网卡是否发生链路切换如果网卡绑定组在切换瞬间丢包需要把心跳超时时间调大。调整路径是 VRM 的配置文件一般调大超时倍率到默认值的 1.5 倍能显著减少误报。5.2 虚拟机 IO 抖动存储链路复用导致的拥塞现象业务报告磁盘写延迟飙升出现阶段性的卡顿但存储阵列本身的 CPU 和缓存负载并不高。原因存储网络配置成了单链路或者多链路之间负载不均衡。常见错误是 iSCSI 场景下多个 VLAN 复用了同一对物理网卡链路本身没有拥塞但虚拟交换机排队机制导致的报文延迟变大。解决在分布式交换机上为存储流量单独划一个上行链路或者物理上把存储业务挪到专用交换机端口。同时检查多路径链路在所有主机上数量一致避免出现一台主机 4 条路径、另一台主机 2 条路径的情况路径数量不一致会导致 IO 负载失衡。5.3 热迁移失败CPU 指令集与内存复用参数冲突现象在线迁移虚拟机到另一台主机时进度卡在 90% 后回滚迁移失败。原因两台宿主机 CPU 型号存在差异新指令集不兼容或者目标主机的内存复用开启迁入后内存资源无法满足虚拟机预留。解决把集群 CPU 兼容模式改成“严格兼容”并重新启动集群内虚拟机让配置生效对迁移目标主机单独检查内存复用率和可用内存。最好的办法是提前查看 CPU 型号库——华为平台提供 CPU 兼容性档案不同物理机混插时先在界面上查看兼容性评估结果再做迁移不要硬迁移再排查。5.4 Linux 虚拟机网卡丢包vNIC 队列与 CPU 绑核现象Linux 虚拟机大量 TCP 重传但网络带宽没有跑满物理网卡也不存在错包。原因vNIC 多队列配置不正确中断没有分发到多个 CPU 核心。华为平台默认虚拟机网卡队列数与 vCPU 数量相关如果虚拟机 CPU 数量多但队列数被限制会造成单核软中断处理瓶颈吞吐量上不去且伴随丢包。解决将虚拟机的 vNIC 队列数提升到与 vCPU 数量一致同时在虚拟机操作系统内设置 RSSReceive Side Scaling。对于高流量业务还可以配合 CPU 绑核把网卡中断绑定到固定的物理 CPU 核上避免中断在核间漂移造成缓存命中下降。5.5 去虚拟化与异构迁移从 VMware 迁到华为平台现象项目里从 VMware 环境迁入华为平台虚拟机导出再导入后启动蓝屏或无法加载磁盘。原因Windows 虚拟机在原有平台使用了特定虚拟硬件尤其是 IDE 控制器、网卡型号迁移后驱动不识别。很多人以为“去虚拟化工具”能通吃但实际上不同虚拟化平台间的磁盘控制器、网卡型号差异依然存在迁移前不处理设备驱动就会翻车。解决在源平台先把目标机器转为通用设备驱动再迁移。Windows 系统提前注入华为虚拟化平台的 VirtIO 网卡和磁盘控制器驱动方法是在源虚机上暂时添加一块新网卡并安装驱动确认驱动可用后再进行迁移导入。Linux 系统则重新生成 initramfs确保能加载新平台的存储驱动模块。迁移后的虚拟机要第一时间安装平台工具否则后续做快照、备份和热迁移都会受限。6. 验证与进阶把虚拟化平台的性能压出来搭建完成只是第一步交付一个数据中心虚拟化方案最后要的是能证明它真正可用。我一般会在平台割接前做一份一小时的验收测试内容集中在三个点虚拟机生命周期操作是否稳定、热迁移在大压力下是否成功、存储故障时 HA 是否按预期拉起业务。1 小时验收清单批量创建 10 台虚拟机并发启动记录平均启动时间挑选其中一台跑 FIO 测试磁盘顺序读和随机写对比物理机基线在业务流量持续的情况下热迁移一台核心虚拟机观察是否存在超过 5 秒的流量中断最后拔掉一台主机的存储链路模拟故障观察该主机上的虚拟机是否自动漂移到其他节点。这套测试跑完平台的基础能力就有了底。进阶方向上关注混合负载场景。现在数据中心已经不单是跑虚拟机了GPU 虚拟化和容器化会越来越多地和虚拟化平台并存。华为的虚拟化平台支持把 GPU 直通给虚拟机或者切分后共享给多个虚拟机后端训练、前端推理可以共用同一台物理服务器。在华为杯数学建模这类需要快速调度计算资源的场景里虚拟化资源池配合调度策略能明显缩短环境准备时间。另外信创/国产化改造趋势下麒麟天逸终端虚拟化平台、ARM 架构服务器与 x86 平台的异构统一管理也值得提前评估。我自己的习惯是每季度做一次“配置漂移检查”核对分布式交换机端口策略、存储多路径状态、虚拟机模板版本把该清的快照清掉、该补的补丁补上。虚拟化平台并不神秘大部分故障都是配置漂移和环境变更积累出来的。把这个底子打好平台会安静地替你扛住业务。希望帮到你。本文还有配套的精品资源点击获取
返回列表