ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

pv unknown导致ceph osd down故障处理

pv unknown导致ceph osd down故障处理 【现象】云平台的虚拟机被自动关闭了手动开机后又很快关闭无法正常启动。【分析】虚机刚开机又自动关闭且大批量这样按经验一般是后端存储异常 当然也可排查nova-compute.log日志。 此处为节省时间直接排查底层分布式存储健康状态。【排查】1、检查ceph发现12块盘有10块osd down此时ceph集群处于不可写状态。2、查看3个节点时间一致、且ceph网络正常。 再检查osd down的日志发现以下问题提示找不到lv卷此套ceph部署的lvmcache filestore3、检查节点pv发现pv丢失提示unknow4、由于Linux的LVM会默认存储用户对PV/VG/LV的操作并把信息自动备份到一个文件位置/etc/lvm/backup/VGNAME基于此我们可通过这份备份文件来恢复磁盘与pv uuid对应关系。5、根据找到pv uuid对应关系根据备份文件来创建pvpvcreate 盘符名 -u pv_uuid --restorefile /etc/lvm/backup/vgname6、将vg中所有pv都创建后再恢复vg以及激活vgvgcfgrestore vgname vgchange -ay vgname7、将所有节点osd都恢复后等待ceph同步完成集群恢复正常。【总结】当集群的服务组件或虚拟机出现大批量异常时优先考虑公共部分比如公共组件数据库mariadb、消息队列rabbitmq比如后端存储设备(分布式存储、磁盘阵列)等等 会有助于更快找到问题真实原因。【参考】Linux 系统无法正常启动——pvs显示unknown device - 拓扑园
返回列表