ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Monitoring实战:vSphere插件监控ESXi的34项VM与主机指标全解析

Monitoring实战:vSphere插件监控ESXi的34项VM与主机指标全解析 Monitoring实战vSphere插件监控ESXi的34项VM与主机指标全解析【免费下载链接】MonitoringMonitor ESXi, Synology, Docker, PiHole and Raspberry Pi and Windows using Grafana, InfluxDB and Telegraf项目地址: https://gitcode.com/gh_mirrors/moni/MonitoringMonitoring 是一个基于Grafana、InfluxDB 和 Telegraf的一体化监控项目可覆盖 ESXi、Synology、Docker、PiHole、Plex 与 Windows 等多种设备。本文聚焦其中的Telegraf vSphere 插件只需几行配置即可从 vCenter 采集34 项虚拟机VM指标与46 项 ESXi 主机指标并在 Grafana 中呈现为直观的 CPU、内存、磁盘与网络性能面板无需在宿主机上部署任何 Agent。 为什么选择 Telegraf vSphere 插件监控 ESXi传统做法是写自定义脚本轮询 vCenter API维护成本高且容易失稳。Monitoring 项目直接采用 Telegraf 官方的 vsphere 插件优势非常明显✅零 Agent 部署插件直连 vCenter Server 的 SDK API如https://vcsa.lan/sdkESXi 主机侧无需安装任何东西✅统一数据管道与 Docker、SNMP 路由器、PiHole 等采集任务共用同一份 Telegraf 配置数据统一写入 InfluxDB✅指标白名单机制通过vm_metric_include/host_metric_include精确控制采集范围避免拉取全量指标撑爆 API 与数据库✅30 秒采集周期agent 级interval 30s对家庭实验室和小机房足够及时又不会给 vCenter 造成压力️ 监控架构Grafana InfluxDB Telegraf 如何协同整套系统只有三个角色数据单向流动Telegraf采集层运行在 Raspberry Pi 或任意 Linux 主机上通过 vSphere 插件每 30 秒拉取一次 vCenter 指标InfluxDB存储层telegraf.conf中 outputs 指向http://synology.lan:8086写入telegraf数据库时间序列存储天然适合这类高频指标Grafana展示层导入 VMware 性能仪表盘按 host 变量筛选实时刷新 CPU、内存、磁盘曲线采集配置集中在项目根目录的 telegraf.conf其中 vSphere 插件配置位于L626–L774是整个文件里最值钱的一段。⚙️ 最快接入步骤5 分钟配置 vSphere 插件第一步获取项目git clone https://gitcode.com/gh_mirrors/moni/Monitoring第二步编辑 telegraf.conf 的 [[inputs.vsphere]] 段L626–L774核心只有三行必填项其余按环境微调[[inputs.vsphere]] vcenters [ https://vcsa.lan/sdk ] username AdministratorVSPHERE.LOCAL password PASSWORD insecure_skip_verify true # vCenter 自签名证书时跳过校验几个容易踩坑的细节datacenter_metric_exclude [ * ]数据中心级别指标默认不采集保持即可噪声大且意义有限max_query_objects/max_query_metricsvCenter 5.5 / 6.0 建议调小到 64防止 API 查询超时object_discovery_interval默认 300 秒新增 VM 后最多 5 分钟自动被发现并开始采集第三步验证与展示用telegraf -test跑一次单次采集确认指标入库再导入 VMware performance 仪表盘 JSON参考 README.md 中 VMWare 一节的说明仓库Grafana Dashboards/目录另附 Docker overview.json 等多套现成仪表盘可供参考。 34 项 VM 指标全解析以下清单完整对应 telegraf.conf 的L635–L670vm_metric_include按五大类拆解类别指标共 34 项一句话解读CPU9 项cpu.demand.averageVM 当前需要的 CPUMHz需求持续走高说明规格该升了cpu.idle.summation空闲时间总和资源充裕的直观信号cpu.latency.average从可运行到真正运行的等待毫秒数调度排队核心指标cpu.readiness.average就绪但未获得 CPU 的百分比宿主机超分的直接体现cpu.ready.summation/cpu.run.summation就绪 / 实际运行的累计时间cpu.usagemhz.average/cpu.used.summation实际消耗的 MHz 与已用时间cpu.wait.summation因宿主机资源争抢产生的等待时间内存9 项mem.usage.average/mem.active.average内存使用量与活跃内存量mem.granted.average实际被授予给 VM 的内存mem.latency.average内存操作延迟mem.swapin*.average/mem.swapout*.average4 项换入/换出量与速率非零即代表内存紧张mem.vmmemctl.average虚拟机控制平面内存持续增长常伴随 vmmemctl 告警网络5 项net.bytesRx/Tx.average收发字节数换算后就是带宽曲线net.droppedRx/Tx.summation丢包计数出现增长要先查 vSwitch 与网口net.usage.average网络总使用量虚拟磁盘9 项virtualDisk.read/write.average每秒读/写字节数IOPS 与吞吐的流量面virtualDisk.numberRead/WriteAveraged.average平均读/写 IOPS与上一条配合判断 I/O 模型virtualDisk.readOIO.latest/writeOIO.latest当前排队中的 I/O 数量突增预示磁盘瓶颈virtualDisk.throughput.usage.average吞吐量百分比接近 100% 说明磁盘到顶virtualDisk.totalRead/WriteLatency.average端到端读/写延迟最贴近业务体感的指标系统2 项power.power.average功耗读数需硬件支持sys.uptime.latest运行时长配合告警可快速发现意外重启️ 46 项 ESXi 主机指标速览宿主机侧指标对应 telegraf.conf 的L676–L723host_metric_include是 VM 指标背后的真相来源类别数量重点关注CPU13cpu.utilization.average总使用率、cpu.coreUtilization.average单核峰值发现单核打满、cpu.readiness.average、cpu.wait.summation、cpu.costop.summationc-state 开销功耗调优参考磁盘10disk.read/write.average吞吐、disk.numberRead/WriteAveraged.averageIOPS、disk.device*/kernel*四级延迟拆解——区分延迟来自设备还是内核层内存10mem.usage.average、mem.state.latest内存状态soft/hard limiting 一目了然、mem.swapin/outRate.average、mem.vmmemctl.average、mem.totalCapacity.average网络7net.bytesRx/Tx.average、net.errorsRx/Tx.summation错误计数、net.droppedRx/Tx.summation、net.usage.average存储适配器4storageAdapter.read/write.average与平均读写次数定位到具体 HBA/RAID 卡层电源 / 系统2power.power.average、sys.uptime.latest 新手避坑先看哪 5 个指标面对 80 项指标不必逐个盯排障时优先看这 5 个信号弹mem.swapin/outRateVM 主机两侧非零 内存已不够用加内存或减负载cpu.readiness.average持续偏高 宿主机 CPU 超售VM饿着virtualDisk.totalRead/WriteLatency虚机侧延迟 主机侧disk.device*Latency对照可快速判断瓶颈在数据存儲还是虚拟化层net.droppedRx/Txnet.errorsRx/Tx网络抖动的直接证据sys.uptime.latest曲线突然归零 主机或 VM 发生过重启 监控不止 ESXi同一套体系顺手覆盖全家设备这套 Telegraf 实例并不只服务 ESXi——同一份 telegraf.conf 里还配置了 Synology SNMP 采集磁盘、RAID、UPS、温度、Docker 容器、ASUS 路由器、PiHole 与树莓派温度Grafana 里切换仪表盘即可纵览全栈。从 vCenter 到 NAS从虚拟机到路由器Monitoring 项目用一个配置文件 一套时间序列数据库就把整个机房纳入了视野——这正是 vSphere 插件方案最值得新手借鉴之处先跑通最小管道再逐步扩展指标清单。【免费下载链接】MonitoringMonitor ESXi, Synology, Docker, PiHole and Raspberry Pi and Windows using Grafana, InfluxDB and Telegraf项目地址: https://gitcode.com/gh_mirrors/moni/Monitoring创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表