
简介华为路由器与交换机的基本硬件架构知识适合网络运维、系统集成及备考网络认证的技术人员阅读用于补齐设备结构认知、日常巡检与硬件维护方面的基础。内容围绕Quidway S6500系列以太网交换机展开讲解交换路由板、线路处理板、风扇区、电源区与配电区的组成并延伸至S8505等机箱式设备同时覆盖电源模块和业务板带电插拔、指示灯故障定位、防尘网清洁等维护要点。资源包共1个PDF文件约1.37MB为图文手册形式便于离线查阅与打印对照。目前已有951人学习下载说明其在同类资料中具备一定参考价值。读者可借此建立华为交换机硬件模块的整体框架理解单板、电源与风扇的冗余设计思路掌握从指示灯异常快速定位供电、散热或单板故障的排查路径为机房现场操作与设备维护提供可直接套用的判断依据。1. 从一台 AR 路由器和一台 S5720 交换机谈起硬件架构决定了什么机房里同一款盒子插错一块接口卡就整机告警两台看起来差不多的设备一台重启后业务几十秒恢复另一台要等三四分钟还有人抱怨机框式设备单板价格贵但换来的转发时延就是比盒式低一个量级。这些问题往回追最后都落到同一个地方硬件架构。华为路由器与交换机的硬件架构讲清楚的就是四件事——哪些板子负责转发、哪些负责管理、它们之间通过什么连接、掉电掉板之后靠什么活下来。运维要能凭型号判断是盒式还是机框式、有没有独立交换网板、堆叠靠什么实现采购和排障要能看懂单板丝印、光模块类型和电源冗余方式。下面按整机形态、单板器件、转发路径、可靠性设计、命令行验证的顺序拆开做到对着真机能把每块板的作用说清楚。2. 华为路由器与交换机的整机形态、槽位与背板架构2.1 盒式与机框式先看槽位数量再谈性能判断一台设备属于哪一类最快的办法不是看参数表而是看它有没有可插拔的业务槽位。盒式设备的转发表、CPU、内存、交换芯片全部焊在一块主板上端口数量出厂固定最多留一两个子卡槽插 WIC 或 WSIC 接口卡华为 AR 系列分支路由器、S5720 系列千兆接入交换机都属于这一类。机框式设备则是把主板拆成多块单板插在同一个机箱的背板上槽位编号从 0 开始主控槽位、业务槽位、交换网槽位分工明确。对比项盒式设备机框式设备端口扩展固定端口 少量子卡按槽位插业务板容量线性增长主控与转发同一块主板CPU 与芯片共用主控板与业务板分离控制面数据面解耦交换网无独立交换网芯片直连独立交换网板N1 冗余可靠性单电源、内置风扇双电源、分区风扇、可热插拔单板典型场景接入层、小型分支汇聚/核心、园区骨干、运营商边缘盒式设备的优势是时延确定、成本低、部署快缺点是背板容量被物理限制锁死端口数到了就是到了。机框式把扩展性交给背板代价是多了板间传输这一跳好处是单板故障可以只换一块、容量按需叠加。做接入层选型时如果三年内端口需求翻倍盒式的便宜往往会变成二次采购的成本。2.2 主控板、交换网板、业务板的分工机框式设备的背板后面通常站着三类单板角色完全不同。主控板运行 VRP 控制平面上面有 CPU、内存、Flash、管理网口和时钟模块负责跑路由协议、生成 FIB 和 MAC 表项再把表项下发给各业务板。交换网板只做一件事——在业务板之间高速搬运数据它本身没有对外业务端口所以故障时可以直接靠冗余板接管不影响协议邻居关系。业务板是真正干活的一块板上有转发芯片、本地缓存、PHY/SerDes 和端口收到报文后在本板查表如果出接口不在本板就把报文打上内部标签通过背板送到目的业务板或者交换网板。主控板槽位通常有主备两份业务板可以满配也可以混插不同速率前提是背板带宽和交换网容量撑得住。分布式交换机系统架构的关键点就在这里管理面集中在一两块主控板上转发面分散到每块业务板控制平面挂了转发面还能靠已有表项继续跑一段时间。提示主控板切换期间已经建立的转发表项一般不会丢但新上线的路由邻居需要重新收敛业务恢复时间主要取决于协议收敛速度而不是硬件本身。2.3 用背板带宽公式估算一台机框式设备够不够用选型时最容易踩的坑是只看端口数量不看背板交换容量。单块业务板需要的带宽可以按端口数、端口速率和双向系数估算再乘一个超速比因为转发芯片内部处理、队头阻塞和突发流量都需要额外余量。# 估算一块业务板与整机所需的背板带宽 def board_bandwidth(ports, speed_gbps, overspeed1.5): # 端口数 × 端口速率 × 双向 × 超速比 return ports * speed_gbps * 2 * overspeed def chassis_bandwidth(slots, per_slot_gbps): # 机框容量必须大于所有业务槽位峰值之和 return slots * per_slot_gbps board_48x10g board_bandwidth(ports48, speed_gbps10) # 48 口万兆板 board_48x25g board_bandwidth(ports48, speed_gbps25, overspeed2.0) print(f48×10G 板需 {board_48x10g:.0f} Gbps) print(f48×25G 板需 {board_48x25g:.0f} Gbps) print(f8 槽满配 25G 板需 {chassis_bandwidth(8, board_48x25g):.0f} Gbps)函数里的ports和speed_gbps来自实际要插的业务板规格overspeed一般取 1.5 到 2.5 之间接入层取 1.5 就够汇聚和核心建议 2.0 以上。算出来的数值要小于机框标称的交换容量并且留出至少一个槽位的余量否则将来加一块板就得整机换代。实际下单前还要核对交换网板数量只有一块交换网板的机框容量和可靠性都打折N1 才具备单板故障不断业务的能力。3. 单板上的核心器件交换机芯片、CPU、内存与存储3.1 转发芯片与 CPU 的分工嵌入式硬件架构的第一原则从嵌入式硬件架构角度看一台路由器或者交换机就是一块带专用加速器的计算机只不过加速器比 CPU 忙得多。转发芯片常见为交换 ASIC 或网络处理器负责数据面解析报文头、查 FIB、查 MAC 表、匹配 ACL、做 QoS 标记和队列调度这些动作靠硬件流水线并行完成转发时延稳定在微秒级。CPU 负责控制面跑 OSPF、BGP、STP、LACP处理 SNMP 请求响应 ICMP维护 ARP 老化。判断一次丢包到底是谁的问题就看报文有没有被送 CPU。ARP 请求广播、路由协议报文、TTL 超时的 ICMP、目的地址是自己的报文都会被上送 CPU 处理这条路径的速率通常只有每秒几千到几万包一旦遇到扫描或者广播风暴CPU 占用率会直接飙起来而转发芯片的端口利用率可能还很低。芯片表项容量也决定设备规格MAC 地址表、ARP 表、ACL 表的条数上限是芯片规格不是内存随便加就能扩的。3.2 BootROM、Flash 与配置文件设备是从哪儿把系统读起来的设备上电后的启动链条是固定的BootROM 先跑起来加载 Flash 里的系统镜像文件再把配置文件读进内存最后交给 VRP 接管。Flash 上通常放三样东西——系统文件.cc 结尾、配置文件VRP 上是 vrpcfg.zip、补丁文件容量一般不大所以升级时经常要先删旧版本腾空间。# 查看启动加载的文件、版本和补丁信息 display version # 查看 Flash 空间占用与文件列表 dir flash: # 查看当前启动配置与下次启动加载的配置文件 display startup display saved-configuration | include sysnamedisplay version输出的 Startup system software 和 Next startup system software 两行必须一致否则说明升级后没有执行startup system-software指定下次启动文件重启会回到老版本。dir flash:关注剩余空间低于系统文件大小两倍时升级可能失败。配置文件不执行save就不会写进 Flash断电后改动全部丢失这是新手最常见的一个损失点。内存方面DDR 用来装运行时的 FIB、ARP、路由表和协议进程display memory-usage长期高于 70% 就要排查是否有表项泄漏或者路由震荡。3.3 光模块与接口卡型号识别的几个硬约束接口卡能不能用取决于三件事设备支持的单板型号列表、接口卡上的连接器类型、光模块的速率和波长。华为设备上电时会读取光模块的 EEPROM 信息非认证模块可能被识别为 Unknown 而不上电或者虽然能 up 但报 CRC 错。模块类型常见速率典型距离识别要点SFP千兆几百米到十几公里单模/多模必须与光纤匹配SFP万兆300 米到 10 公里速率协商、FEC 开关QSFP40G短距多模为主可拆成 4×10G 分支QSFP28100G多模/单模光衰余量、兼容性更敏感排查链路故障时先看光功率再看协商。命令上display interface transceiver verbose会给出收发光功率、温度、电压接收功率低于灵敏度下限就会出现时通时断或者大量 CRC 错。接口卡本身的问题看display device槽位显示 Abnormal 或者 Fault 说明单板没有被正常识别先重插再考虑换板。4. 报文在华为路由器交换机硬件里怎么走转发路径与硬件可靠性4.1 一次跨板转发的完整硬件路径假设一台机框式交换机从 1 号槽位万兆口收到一个报文出接口在 4 号槽位。硬件上依次经过这些环节光模块把光信号转成电信号SerDes 串并转换后交给 MAC 层转发芯片入方向流水线解析以太头、查 VLAN 表、查 MAC 表得到出接口和下一跳发现出接口不在本板于是加上内部转发头通过背板 SerDes 送到交换网板交换网板按内部头把报文导向 4 号槽位业务板出方向芯片做 ACL 匹配、队列调度、改写 MAC 地址后从端口发出。需要 CPU 参与的报文走另一条路转发芯片识别出这是协议报文或者目的地址是本机就通过内部以太通道送到主控板 CPU处理完再下发结果。这条路径全程受 CPU 队列长度限制遇到协议报文攻击时会触发 CPCAR 限速表现是邻居关系间歇性中断。判断丢包发生在哪一段的方法是看端口计数器和队列统计display interface的入方向丢包说明拥塞在入队出方向丢包说明出队调度有问题背板侧很少丢包但一旦丢就是硬件告警。4.2 电源、风扇与温度的冗余设计机框式设备通常配 11 或者 N1 电源两个电源模块分别接不同的供电回路才算真正冗余接同一个插排等于没有冗余。电源状态用display power查看输出里每个 PSU 的 State 为 Normal 才算正常Abnormal 往往是输入电压异常或者模块本身故障。风扇是分区设计的一块业务板对应一到两个风扇模块转速随温度自动调节。display fan看转速百分比和状态转速长期 100% 说明环境温度偏高或者某个风扇堵转。温度用display temperature查看每个槽位有告警阈值和关机阈值超过关机阈值设备会自动下电保护这类事件在日志里会留下明确记录。机房空调故障时最先报警的往往不是服务器而是交换机因为网络设备的进风温度上限一般在 45 到 55 摄氏度之间。注意更换风扇和电源模块支持热插拔但同一时间只动一个模块同时拔出两个冗余模块会导致整机下电。4.3 堆叠与集群对硬件的依赖盒式设备堆叠靠堆叠口或者普通业务口堆叠线缆的带宽和距离直接决定堆叠带宽用一根千兆线把两台万兆交换机堆起来跨设备流量会成为瓶颈。堆叠需要型号和软件版本一致主备选举出主交换机后其余成员设备的转发芯片仍然各自工作只是控制平面统一在主设备上。机框式设备做集群CSS时主控板之间通过专用集群线连接物理上是两块主控板的高速通道互联逻辑上是一台设备。集群线全部断开会导致双主两边都认为自己是主设备此时 STP 和路由协议都会异常所以生产环境一般要求两条集群线走不同物理路径。display stack和display css能看到成员编号、优先级和链路状态堆叠成员编号冲突时必须先改编号再上线。5. 用 VRP 命令核对硬件架构巡检、告警定位与板卡识别5.1 一次完整的硬件巡检命令序列真机上核对硬件靠的是把命令输出和物理外观对上。下面这组命令按顺序执行一遍就能把整机硬件状态摸清楚。# 1. 版本与启动信息确认启动文件和补丁 display version # 2. 槽位与单板状态Normal 为正常 display device # 3. 单板序列号与制造信息报修时用得上 display device manuinfo # 4. 电源、风扇、温度 display power display fan display temperature # 5. 控制面资源 display cpu-usage display memory-usage # 6. 接口与光模块 display interface brief display interface transceiver verbose # 7. 堆叠或集群状态 display stackdisplay device输出里要重点看三列Slot 编号、Board Type 单板型号、Status 状态任何一块显示 Abnormal、Fault 或者 Offline 都要立刻处理因为机框式设备单板离线可能导致背板通道降级。display device manuinfo给出的序列号在报修和资产盘点时是唯一凭据建议纳入自动巡检脚本定期采集存档。display cpu-usage关注的是任务级占用如果ARP或者IP任务占用偏高说明有大量报文在送 CPU需要结合 CPCAR 统计定位来源。5.2 告警定位与常见硬件相关报错硬件告警的判断顺序是先看日志再看命令日志里有明确的时间点和槽位号。常见的几类现象和处理方式可以对照下面这张表。现象优先查看处理方向单板显示 Abnormaldisplay device、display elabel重插单板检查背板连接器端口 up 不了display interface、display transceiver verbose核对速率、光衰、光纤收发方向CPU 周期性冲高display cpu-usage、display logbuffer排查广播风暴、协议报文攻击电源告警display power检查双路供电和模块状态温度告警display temperature、display fan检查风道、滤网和机房温度堆叠分裂display stack、display logbuffer检查堆叠线确认成员编号有一种情况容易被忽略接口统计里的 CRC 错误持续增长但链路状态一直是 up。这类问题大多出在光模块老化或者光纤接头污染display interface的 CRC 计数每次刷新都在涨就可以直接换模块试。另一个高频误区是把盒式设备当成有交换网来理解实际上它的交换芯片直接连在主板走线上端口之间转发不经过任何中间板卡所以盒式设备的时延抖动通常比机框式更小——这也是接入层依然大量使用盒式机的原因。把物理单板、芯片角色、命令输出这三者对起来看硬件架构就不再是参数表上的一堆名词了。本文还有配套的精品资源点击获取