
开头做网络维护这些年我有个习惯每次接手一台华为路由器不管之前是谁配的、跑的是什么业务第一件事一定不是看配置而是先把设备的基本状态摸一遍。就像开一台二手车之前你得先看仪表盘、看里程、看有没有故障灯心里才有底。华为AR系列路由器在企业网里太常见了不管你是刚入行的网工还是被拉去救火的全能型IT都绕不开“怎么快速、准确地判断一台路由器当前到底干得怎么样”这件事。这篇文章就围绕“华为路由器查看设备基本状态”这个主题把我在实际维护中用到的命令、思路、踩过的坑一条一条掰开讲清楚。内容不只告诉你命令怎么敲更会解释每个字段背后说明什么问题、什么场景下该重点关注什么。文章覆盖的状态维度包括系统与硬件、接口链路、路由转发、性能资源、日志排错最后还会把Console密码找回、ACL查看、MAC与IP绑定这几个高频运维话题一起收录进来。适合所有正在用或准备用华为AR系列路由器做企业网络出口、分支机构接入、专线互联的工程师参考。1. 整体思路查看设备状态到底在看什么1.1 状态查看的三个层次很多新手爱把“查看状态”理解为敲一条命令看看CPU多少、接口up还是down然后就没有然后了。但真实运维场景里查看状态的目的性要强得多。我习惯把状态查看分成三个层次第一层是硬件与系统层。设备型号对不对、单板是否都在位、电源风扇是否正常、设备连续运行了多久、系统软件版本是什么。这些信息解决的是“设备本身健不健康”的问题通常是巡检和故障处理的第一步。第二层是网络与转发层。接口物理状态、链路协议状态、IP地址是否生效、ARP表是否完整、路由表是否符合预期、数据转发走的是哪条路径。这一层直接关系到业务通不通是排障时最常操作的部分。第三层是资源与业务层。CPU占用率是否异常、内存余量是否充足、日志里有没有报错、ACL规则有没有匹配到流量。这一层往往决定了设备还能撑多久、隐患在哪里。三层看下来你对一台设备的判断才算是完整的。单独看任何一层都可能误判比如CPU不高但接口疯狂丢包设备看起来活着业务却已经断了。1.2 不同接入方式对查看操作的影响华为路由器的运维通道主要有三条Console口、Telnet/SSH远程登录、Web网管界面。查看设备基本状态我强烈建议用命令行方式也就是Console或者SSH登录进去敲命令。原因很简单命令行能看到的信息最全、粒度最细、速度最快而且不会因为网管平台版本差异导致输出内容不一样。Console口适合设备首次上线、远程不可达、密码需要重置的场景日常巡检和排障走SSH就行。至于Web网管适合图形化查看趋势图比如接口流量曲线、CPU历史占用但真要定位问题还是得回到命令行。所以本文所有命令都以命令行视图为准基本适用于华为VRP平台的AR系列路由器部分命令在S系列交换机上同样有效。强调一句无论通过哪种方式登录查看状态本身用的是只读命令不影响业务可以放心执行。真正要小心的是一键采集命令可能输出较多内容建议在业务低峰期执行。2. 基础实操系统与硬件状态一屏看全2.1 设备型号、版本与运行时长display version这是我认为最该敲的第一条命令没有之一。进入系统视图后只需要在各视图下执行display version输出内容分了三块每一块都有实际用途设备型号与软硬件版本确认设备具体型号比如AR6120、AR6280以及系统软件版本。这个信息在你下载补丁、查特性支持、判断是否遇到已知缺陷时是门票。启动时间设备最近一次重启的时间。如果业务高峰期设备悄悄重启过这里会留下证据结合后面的日志才能定位是断电、死机还是被重启了。连续运行时间UpTime越长说明设备越稳但反过来说如果一台设备UpTime特别长而系统版本很老且一直没打补丁也是一种风险信号。我在实际巡检中会把display version的输出保存下来形成设备台账。每台设备什么版本、启动过几次、上次变更是什么时候一对比就能看出问题。另外排查设备重启问题时的第一条日志线索也是围绕启动时间展开的。2.2 硬件健康体检display device、display esn、电源与风扇版本信息只能证明系统活着硬件有没有毛病还得看专门的状态命令。常用的有这几条display device display esn display power display fandisplay device的输出会列出设备各单板主控板、接口板的工作状态重点看Status字段是不是Normal。如果出现Fault或者Offline那块板上的接口、业务就大概率不可用了。原因可能是板卡松动、供电异常、或者板卡本身坏了。display esn是查设备序列号的这个在很多场合会用到报障给华为400时人家第一句就问ESN设备做资产盘点、上架验收时ESN和机身标签必须一致。如果你发现设备上报的ESN和现场标签对不上这类设备八成是返修过的最好尽早核对清楚。display power和display fan分别对应电源模块和风扇的状态。机房环境恶劣的、设备用了五六年以上的电源和风扇是最容易先出问题的。风扇状态输出里如果出现转速明显偏低别等到设备过热宕机才处理那时候业务已经受影响了。实操中我还会配合一个很有用的命令display device status有些版本里它能直接汇总显示设备硬件整体健康度适合巡检场景。3. 接口与链路状态业务通不通的第一道关3.1 display interface 怎么看重点不是Up/Down这么简单接口状态是所有网络排障最先看的地方。华为路由器上查看单个接口完整信息的命令是display interface GigabitEthernet0/0/0这条命令的输出信息量很大对于新手容易看花眼。我教你一个看重点的方法物理层状态line protocol第一行和前面几行会标出物理状态和链路协议状态。物理状态是up说明网线、光模块、对端设备物理连接没问题协议状态是up说明二层协商通了。两者都是up这个接口才算基本能用。速率和双工模式确认实际协商出来的速率是否对。比如对端是千兆口这边协商成了百兆多半是网线质量差或者光模块速率不匹配业务能跑但带宽被严重缩水这种问题不细看根本发现不了。入方向/出方向的流量统计看最近一段时间的收发包数、字节数。结合两次采样间隔可以估算实际带宽占用率。错误包计数input errors / output errors这里有大文章。如果input errors里CRC错误持续增长说明物理链路质量差最常见的原因是网线过长、水晶头接触不良、光模块光衰大。如果output errors一直涨先怀疑对端是不是关了接口或者本端配置了端口速率限制。我见过太多人只盯Up/Down两个单词接口明明是Up但业务就是卡得不行。一查CRC错误计数上百万链路质量早就烂透了。所以排查接口状态时一定要养成看错误计数的习惯。3.2 快速总览display ip interface brief接口数量多的时候一个个敲display interface太慢了这时候用摘要命令display ip interface brief输出是一张表格每行一个三层接口分别显示接口名、IP地址、物理状态、协议状态。网管和工程师排障时基本都靠这条命令快速锁定哪个接口出问题了。看这张表有个小技巧所有接口中如果出现物理状态是up、协议状态是down的情况说明这个接口上配置了IP但二层或路由协议没协商起来。常见原因有两种一是接口被shutdown了二是对端设备接口没up或者直连网线有问题。另外如果接口带IP但状态全down先确认接口下是不是执行了shutdown命令。3.3 ARP表二层转发的核心线索接口通了之后还要确认二层邻居关系。华为路由器上查看ARP表的命令是display arp输出会列出IP地址、MAC地址、接口、老化时间等信息。这个表在排查“能ping通网关但ping不通远端”“某些终端时通时断”这类问题时特别有用。如果ARP表里目标设备的IP解析不到MAC说明二层链路有问题或者对端没回应ARP请求。如果ARP表里MAC地址频繁跳动比如同一个IP一会儿对应一台设备的MAC一会儿对应另一台那就要警惕网络中有人配置了相同的IP这就是典型的IP地址冲突。另外顺带提一个和安全相关的命令。热搜词里有“华为路由器mac与ip绑定命令”实操中确实常用到命令是arp static 192.168.1.100 00e0-fc12-3456意思是把某个IP静态绑定到一个MAC地址上。配置后路由器只把该IP的流量转发给绑定的MAC其他设备就算抢这个IP数据也发不出去。这个功能在办公网防止员工私改IP、在专线对端防止地址盗用的时候很实用。但注意静态ARP配置多了会增加维护成本别随便把整个网段都绑上通常只保护网关和关键服务器。4. 路由与转发路径数据到底怎么走4.1 display ip routing-table解析路由表的关键字段接口都up了、ARP也通了但业务还是不通这时候就该看路由表了。华为路由器上查看完整路由表的命令是display ip routing-table输出里每一行都包含几个关键字段我一个个解释Destination/Mask目的网段和掩码表示这条路由适用于哪些目的地。Proto路由来源协议。常见的值有Direct直连路由、Static静态路由、OSPF、BGP等。看到这个字段就知道路由是哪来的。Pre优先级。这是华为设备路由选择的关键指标数值越小优先级越高。直连路由优先级是0静态路由默认是60OSPF内部是10BGP默认是255。两条路由去往同一目的地时优先级小的先胜出。Cost开销值。当优先级相同的时候才比较Cost越小越优先。NextHop下一跳地址也就是数据包发给谁。Interface出接口数据包从哪个接口送出去。排障时最常见的场景静态路由写错了下一跳或者动态路由没学全导致路由表缺了某条关键路由。我排障第一步就是先确认路由表里有没有指向目标网段的路由以及下一跳是不是对的。如果路由表里有正确路由但业务依然不通就要看下一跳设备是否可达或者中间链路是否做了过滤。4.2 FIB表真正生效的转发路径很多人只看路由表却忽略了一个细节设备实际转发数据时查的未必是路由表本身而是转发表。华为路由器上查看FIB的命令是display fibFIB是从路由表优选之后生成的一张真正用来指导转发的表。理解它的意义在于有时候路由表里有好几条去往同一个网段的路由有主有备但真正生效的只有一条跑到FIB里看的才是当前实际转发使用的路径。我在做链路主备切换验证时有一个习惯主用链路断开后先在路由表里确认备用路由激活了再看FIB里下一跳是否已经切换到备用链路。两条命令配合看能确认切换是否真正完成而不是只看接口状态。另外还可以用display fib statistics看FIB表规模在设备内存紧张或者路由条目数量巨大时这个统计信息能帮助判断路由表是否已经膨胀到接近设备上限。4.3 连通性验证手法ping/tracert 查通路路由转发表都看了最后一步是用ping和tracert验证实际通路。华为路由器上的ping支持指定源地址和次数ping -a 10.10.1.1 -c 5 10.20.1.10-a是指定源IP-c是发包次数。日常排障建议带源地址测试因为很多设备有回程路由策略源地址不同走的路可能完全不同。tracert命令则用于查看数据包经过的每一跳tracert 10.20.1.10如果中间某跳不响应也不必慌很多设备出于安全考虑不回应ICMP超时消息。重点看最终是否到达目的地。另外tracert能直观看出路径是否走了预期方向比如明明是专线互联到分公司结果路径上出现了几个莫名奇妙的公网IP那大概率路由被引流到了别的出口。5. 性能与日志设备累不累、有没有隐患5.1 CPU与内存设备是否超负荷运转路由器的CPU和内存不像服务器那样直接打开任务管理器就能看但命令行有对应命令display cpu display memorydisplay cpu输出里包含CPU总占用率和各进程的占用率。正常情况下华为AR系列路由器CPU占用率在30%以下都算健康如果长时间超过60%就要留意了。我说的60%不是绝对标准要看设备型号和业务类型但持续高位运转的设备肯定有隐患。如果CPU占用率高别急着下结论继续查是哪个进程消耗的display cpu-task你会看到各任务/进程的CPU占用情况。常见的“凶手”有几种NTP频繁同步、ACL命中大量日志、BGP路由频繁震荡引发路由计算、或者网络里有广播风暴导致中断风暴。配合display cpu-usage history可以查看CPU占用的历史曲线判断占用率是突然上升还是长期缓慢爬坡。display memory则显示内存使用率和各内存区块的使用情况。内存占用持续接近上限时设备可能出现无法新建会话、命令响应卡顿的问题。维护老设备时尤其要注意内存因为长时间运行的进程可能会有内存碎片化的问题这种情况一般重启能缓解但要真正根治还得升级版本或调整业务负载。5.2 日志与告警display logbuffer 找故障现场设备状态再好也不可能每时每刻盯着。所以日志是目前状态与历史故障最重要的证据来源。查看日志的命令是display logbuffer日志缓冲区里记录了设备运行期间产生的系统日志、接口状态变化、协议邻居变化等。排障时常用过滤参数比如只看包含接口GigabitEthernet0/0/0的日志display logbuffer | include GigabitEthernet0/0/0如果只看某段时间内的日志可以先用display logbuffer查看日志时间再结合具体报错信息排查。还可以用display trapbuffer这个查看的是告警缓冲区设备发生端口up/down、电源异常等情况时会写入SNMP Trap信息。和中大型网管系统对接时trapbuffer里的信息能帮你确认网管平台有没有漏告警。特别佩服的是display diagnostic-information这条命令它会把设备当前几乎所有状态信息打包输出包括版本、日志、CPU、内存、接口统计、路由表等。故障报给华为400的时候技术支持让你采集信息基本就是执行这条命令然后保存输出。注意这条命令输出量很大建议用重定向方式保存到本地display diagnostic-information实操线上设备时可以在用户视图下配合时间参数导出或者直接手工把输出保存再通过网络传输到外部。5.3 日志功能的基础配置别让日志悄悄消失如果设备上根本查不到日志那前面说的查看都白搭。华为路由器默认会向日志缓冲区记录信息但有一些配置还是需要确认的info-center enable这条命令是确保信息中心功能开启的。再看看日志主机、日志级别之类的配置如果设备配置了远程日志主机那display logbuffer里查不到太早期日志也没关系可以去日志服务器上挖。另外NTP时间同步配置很重要。日志没有正确时间戳的话排障时连故障发生的先后顺序都理不清。给设备配一个可靠的NTP源让设备时间与服务器、其他网络设备保持在同一个时间轴上这是所有日志排查工作的前提。我见过太多设备时间漂移好几个小时、甚至跨了日期的情况事后追溯故障简直是一场灾难。6. 高频运维问题与避坑实录6.1 常见问题速查表把日常运维中最高频的场景整理成一张速查表大家碰到问题时可以直接对照。问题现象可能原因优先查看的命令接口Up但业务不通路由表缺路由、ARP解析失败、ACL拦截display ip routing-table、display arp、display acl all接口经常Up/Down光模块/网线松动、对端设备重启、供电不稳display logbuffer、display interface设备CPU飙高路由震荡、广播风暴、ACL匹配过多日志display cpu-task、display logbuffer设备经常重启供电异常、电源模块故障、设备高温display version、display power、display logbufferping丢包严重链路质量差、接口错误包多、带宽拥塞display interface、display cpu路由表有路由但转发不通FIB未更新、出接口故障、策略路由干预display fib、display current-configuration无法登录设备Console密码丢失、SSH配置错误、ACL限制登录源见6.2菜单重置display acl all这张表不能解决所有问题但能帮你快速定位方向。排障最怕的是东看一眼西看一眼没有逻辑照着表里逐条排查大概率能找到问题所在。6.2 Console密码与其他账号问题处理热搜词里有“华为路由器console密码”确实这也是一个高频求助点。设备Console口密码忘了或者丢了最直接的办法是通过BootROM/BootLoad菜单来重置。具体操作流程是电脑用串口线连接设备Console口打开终端软件如SecureCRT、Xshell设置波特率9600给设备断电重新上电通电瞬间留意终端窗口提示当出现Press CtrlB或类似信息时按CtrlB进入BootROM菜单。不同版本菜单提示略有差异有的直接问是否进入BootLoad有的需要按组合键。进入菜单后找到类似Password recovery console或者Clear password的选项按提示选择清除Console密码保存重启即可。重启后设备会以空密码状态进入系统这时尽快配置新密码user-interface console 0 authentication-mode password set authentication password cipher 新密码执行完记得save保存配置不然重启还会丢。这里有个大坑必须提醒有些版本进入BootROM后做密码恢复操作会让设备恢复出厂配置也就是配置也被清掉了。所以操作前如果设备配置很重要又没有备份就要特别小心认真看清楚菜单里的提示是只清密码还是清整个配置。我实操过的经验是新版平台的Clear password选项相对安全但旧版本设备上恢复密码和恢复出厂往往就在同一个菜单里手一抖就选错了。顺带说说SSH登录。日常维护尽量不要依赖Console口配置好SSH才是正道。SSH配置有几个关键点生成RSA密钥、开启SSH服务、创建本地用户、把用户绑定到VTY通道、配置认证方式为AAA或password。这条链路配置不完整登录就会失败而且失败原因经常不直观得逐项排查。6.3 ACL相关查看规则与命中情况热搜词里提到“华为路由器配置acl”和查看设备状态也是一家人。因为ACL配置错了设备状态看起来一切正常但流量就是不通。这时候你得会看ACL到底有没有在工作。查看设备上所有ACL的命令是display acl all这个命令会把每个ACL的规则逐条列出来并且给出每条规则的匹配次数。这个匹配次数是排障时的金钥匙。我发现很多人配了ACL之后从不回来看这个计数导致ACL配置错误了也浑然不知。查看ACL命中计数的具体操作步骤先看ACL规则的匹配次数。如果ACL规则里有一条deny语句匹配次数一直在涨说明确实有流量被拒绝了如果匹配次数永远是0两种可能要么ACL没有应用到接口上要么应用了但流量没到达设备。再确认ACL应用位置。用命令display traffic-filter applied-record可以查看ACL应用在哪些接口的哪些方向。ACL分入方向和出方向用错方向是配置ACL时最容易犯的错误。比如想禁止内网访问某个外网地址ACL应用在入方向结果内网流量到达路由器时被直接丢弃但出方向你看不到这条限制排查方向就容易走偏。另外在ACL规则里加一条permit语句做统计也是一种常用的排查手法。比如你在ACL末尾加一条permit ip any any的规则用于放行通过观察这条规则的计数就能知道总共有多少流量通过了接口。注意这只是排查辅助手段生产环境里要评估它对安全策略的影响。6.4 配置管理状态排障前的最后一块拼图查状态查到一定程度最终还是要回到配置。因为状态只是结果配置才是原因。华为路由器查看当前生效配置的命令display current-configuration如果怀疑某个接口配置有问题可以只看某个接口的配置display current-configuration interface GigabitEthernet0/0/0配置查看是状态排障的收尾动作。比如前面看到接口错误包很多、协议状态down、ACL计数异常最后都要回到配置里验证是不是接口被shutdown了是不是ACL的rule写错了网段是不是静态路由的下一跳敲错了。配置是各种状态的源头状态是配置的结果和证据两者配合才能完成一次完整的诊断闭环。实操中我有个习惯排障时每改一条配置都用display current-configuration确认改动生效再用ping、display ip routing-table验证业务通路最后记得save保存配置。改配置不保存设备一重启前面几个小时的排障就等于白干了这个教训我相信不少人都体会过。结尾看完整篇文章你会发现“查看设备基本状态”这件事表面上是几条命令的事实际上是一套完整的运维思路从硬件到接口、从路由到转发、从性能到日志每一层都要看每一条输出都要知道它背后的含义。我个人在实际操作中的体会是别等到业务断了才开始查状态平时每周花几分钟跑一遍display version、display device、display interface brief、display ip routing-table、display cpu这些命令把输出保存起来形成设备健康基线。有了基线设备状态出现异常时一对比就能看出来排障效率会高很多。最后再分享一个小技巧很多华为路由器的命令行支持快捷键和管道符比如display interface | include error可以快速过滤错误计数display logbuffer | include down能快速抓接口down的记录。多熟悉这些配合管道符的用法能帮你从一大堆输出里快速捞到最有价值的信息。网络运维这条路没有捷径但养成好的查看习惯绝对能让你少走很多弯路。