ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

服务器冗余电源维修图纸解读与热备份电路设计实战

服务器冗余电源维修图纸解读与热备份电路设计实战 在机房干了这些年我修过不少服务器冗余电源。印象最深的不是哪块板子烧得多惨而是很多同行拿着图纸却不知道从哪里下手查。明明电源模块上的零件都能数清楚但一遇到“两路输入切换失败”“热备份不接管”这类毛病就开始瞎猜乱换最后把问题越搞越大。实际上冗余电源在数据中心就是标配N1、2N这些概念大家都聊得熟但真深入进去——热备份怎么切换、均流电阻怎么选、图纸上的光耦隔离是干什么的——能拎得清的人就少了。这篇内容我想围绕“服务器冗余电源维修图纸”和“冗余热备份电源的电路图设计”两件事展开一边讲电路逻辑一边讲维修实操适合正在做服务器运维、硬件维修或者想自己设计一套热备电源方案的工程师参考。先把话说在前面我讲的是目前通用、主流的冗余电源实现思路不是某一个品牌某一个型号的专用图纸。你在实际维修时一定要结合手里那块板的具体原理图去对照品牌型号不同元器件布局会有很大差异但底层逻辑是相通的——只要读懂了原理绝大多数故障都是可以顺着图纸追出来的。1. 冗余电源的整体思路与设计拆解1.1 冗余电源到底解决了什么问题服务器在数据中心里面是7×24小时跑着的主力设备电网抖动、供电线路检修、某个PDU插排老化短路任意一个环节出问题都可能把单路供电的机器直接干到宕机。冗余电源要解决的事情就一句话当一路输入或者一个电源模块挂了的时候服务器不丢电、不重启、数据不丢。冗余电源常见的有两个层次。第一层是输入侧冗余也就是给电源模块接两路不同的输入通常来自不同路的变压器或不同UPS这叫双路输入冗余。第二层是模块侧冗余机箱里装两个甚至四个电源模块任何一个坏了剩余模块还能继续扛这叫N1或2N冗余。热备份这个词强调的就是电源模块之间处于“一台主用、其他待命”的状态主用模块一旦掉电备用模块在毫秒级时间内无缝接管输出。这里有个特别容易混淆的点热备份不等于负载均衡。真正的热备份冗余两个模块并不会严格平均承担电流而是由监控电路判断在线模块的掉电和故障状态再把输出总线切换给备用模块。负载均衡做的是平均分配电流的“均流”方案目的是减小单个模块热应力两者目标不一样但电路上经常是配合使用的。拿到维修图纸时先确认设计目标到底是哪一种这是看电路逻辑的第一步。1.2 几种常见冗余拓扑怎么选我自己做过不少机房的电源改造也拆过很多厂家的电源框不同场景下的冗余拓扑大概可以分成这几类拓扑类型冗余能力常见应用场景成本水平11单个模块故障不掉电普通双电源服务器中N1N个模块带载多留一个备用机架式服务器集群中高2N两路独立电源路径每路可独扛全部负载核心数据库、关键业务高2N12N的基础上再留一个备用模块金融、云计算核心节点很高选择哪种拓扑更多是成本与可用性的权衡而不是技术难度的区别。打开一台普通11冗余电源的服务器和打开一台2N高端存储的电源框核心控制思路并没有本质区别无非是监控逻辑复杂程度、器件的电流等级和散热余量不同。维修的时候不用被“2N”“高端”这种词吓住底层故障排查手段都是一样的。还有一个设计细节值得留意服务器正常是双模块并联工作但很多型号在单个模块故障时会允许故障模块先隔离剩余模块瞬间承担全部负载这时候单个模块必须有余量。图纸上如果标注了模块的最大输出电流和额定输出电流两个参数这中间留出的差额就是给故障冗余预留的裕度也是维修更换模块时不能随便降级选型的核心依据。1.3 一套冗余电源电路的整体结构冗余电源的电路按信号流向可以拆成五个部分EMI滤波与浪涌保护、整流与PFC功率因数校正、隔离DC-DC变换、输出整流与均流/ORing、监控与告警。这五块在维修图纸上是层层嵌套的看图的时候最重要的不是背元器件编号而是建立信号流向。我自己的方法很笨但很有效先找电源管理芯片或监控芯片再从监控芯片往外找它的采样点和驱动点整张图纸的脉络就能解开大半。芯片是电源板的大脑它会告诉我们哪个采样点是负责电压的、哪个是负责电流的、哪个引脚是控制MOS管驱动的顺着这些引脚去追外电路思路比从输入端一个一个电阻往后看要清晰得多。2. 核心电路与关键器件解析2.1 双路输入切换电路的原理与设计服务器冗余电源里面输入切换不是简单用继电器把两个插头并在一起。两路市电相位不同、电压幅值可能有偏差直接并联会出现环流轻则炸保险丝重则烧掉整流桥。常规做法是先用可控硅或继电器做互锁切换同一时刻只让一路输入接通到后级整流母线。图纸上会看到一个叫AC_OK的监控信号它由输入检测电路和监控芯片共同产生。检测电路用电阻分压配合比较器实时监控输入电压是否低于阈值一旦低于某个值比如AC 180V左右具体要看设计规格芯片就认为这一路输入失效先把对应开关断开再闭合另一路开关。断开到闭合之间要留几毫秒的死区时间这是为了防止两路输入在切换瞬间短路。判断切换电路好坏维修时最直接的办法就是用示波器同时抓两路输入的电压波形看切换瞬间是否有重叠尖峰。如果两路波形在切换时有瞬间同时导通的情况那基本能锁定互锁逻辑出了问题。还要注意一点很多服务器电源的输入切换是在整流桥之前完成也就是说切换的是交流侧这时还要考虑两路输入的零线火线相位差图纸上那些标注了“L1/N1”“L2/N2”的端子维修时千万别搞混我曾经见过有同事把两路的火线对调结果切换瞬间直接短路整块电源板烧得面目全非。2.2 输出ORing与热备份切换的核心这是冗余电源最核心的部分也是热备份电源设计中价值最高的电路节点。多个电源模块的输出最终都会汇集到服务器背板的12V母线上如果只是把正极直接并联一个模块故障短路时整个母线都会被拉死那冗余就白做了。所以主流设计会在每个模块输出串一个“隔离器”。早期用肖特基二极管压降0.3V到0.4V左右大电流时发热非常厉害一个500W的模块光这个二极管上的损耗就能有十几瓦。现在高端电源用的都是主动ORing用一个低导通电阻的MOSFET配合理想二极管控制器来替代二极管导通压降可以做到几十毫伏。图纸上如果看到输出正极串联一个MOS管栅极接到一个带“OR”字样的控制芯片这就是主动ORing电路。热备份切换逻辑说起来不复杂正常时主模块的ORing导通备用模块的ORing处于预导通状态但输出电压略低于主模块处于“等待”状态。当主模块输出跌落备用模块看到母线上的电压低于自身设定值才完全导通接管。这个过程要控制在几十微秒服务器主板上那么多电容的存电足够撑住这个切换时间不会引起复位。维修时要特别留意控制器的SOA工作区和MOSFET的双向导通问题。普通MOS管天然带反并联体二极管装进ORing电路后如果控制逻辑写反可能出现“关了等于没关”的现象也就是体二极管还在导通隔离失效。好的设计会在MOSFET输出侧加一个反向串联的二极管或者在控制器里做双向阻断这也就是为什么有些图纸上ORing输出那里会画两个背靠背的管子。看到这种结构不用奇怪那是为了在输出短路时双向都能断开。2.3 监控与告警电路的设计思路冗余电源的监控电路一般是一颗MCU或者专门的电源管理芯片干的事情无非三件采集各路电压电流温度判断状态控制风扇转速通过I2C总线把电源的健康信息报给服务器的主板BMC。维修图纸中这部分元件最密、丝印最多但排查时反而最简单因为所有信息都汇总到了芯片引脚上。看图纸时关注三类信号PGDPower Good、ALERT/PS_PRESENT、I2C的SDA和SCL。遇到整机点不亮先量PGD如果一直拉低说明电源模块认为自己输出不合规问题大概率在前级比如输入缺相、辅助电源坏了、某路输出短路如果PGD正常但系统报电源错误那多半是I2C通信或者BMC配置问题。监控电路还有一个不能忽略的细节是风扇控制。冗余电源对散热要求很高风扇转速通常不是恒定的而是跟着温度传感器走。图纸上风扇驱动电路一般放在监控芯片旁边通过PWM信号控制转速。如果风扇不转要分清是风扇本身损坏还是PWM信号丢失用示波器量一下信号线就能判断不要上来就换风扇。3. 维修中怎么读懂图纸并快速定位故障3.1 我的读图顺序与方法拿到一份冗余电源的维修图纸我不会从头到尾通读一遍太浪费时间。我的读法分四步。第一步看电源整体框图搞清楚模块内有哪些独立的功能块每个功能块大概的作用范围。第二步找到电源管理芯片和关键IC顺着芯片的引脚往外找外设电路确定采样点与驱动点等于把芯片当成地标往四周建立地图。第三步重点看输出ORing和均流部分因为这是冗余电源区别于普通电源的核心也是故障高发区域。第四步再回头去分析具体的故障点这时候带着需求看图效率会高很多。举个例子如果故障是“两块电源都装上去但有一块亮红灯”那我拿到图纸以后不会先去查高压主回路而是直接找监控芯片的电压采样输入引脚测量它检测到的那一路电压是不是真的异常。如果电压正常再查采样电阻是否漂移如果采样电阻正常再查芯片的采样引脚是否虚焊。这个排查路径就是完全跟着图纸上芯片的“感官”来走的。图纸上那些分散在角落的去耦电容、泄放电阻、RC缓冲电路我建议大家扫一眼就好通常不是故障高发点。维修中90%的故障都集中在功率器件、保险丝、电解电容、驱动芯片和连接器上把精力优先分配到这些区域绝不会错。3.2 常见故障点与排查流程速查冗余电源的故障看多了其实很有规律。我整理了一个速查表自己干活时候也会参照故障现象可能原因排查方向插入电源无待机电压输入保险丝烧断、整流桥短路、辅助电源损坏先用万用表二极管档测保险丝和整流桥再查辅助电源芯片供电双模块插入整机反复重启ORing控制异常、两模块输出电压差值过大分别单插测试测两路12V输出电压查ORing控制芯片能开机但电源告警灯亮温度采样偏差、风扇转速异常、OVP误触发查NTC温度采样电阻阻值量风扇PWM信号查过压保护阈值单插正常双插就保护均流总线接错、监控芯片配置冲突检查均流总线连接器核对监控芯片外围电阻配置市电切换时系统瞬间重启输入切换死区太长、电容容量衰退示波器抓切换波形测母线电容ESR输出正常但I2C读不到信息BMC侧配置错误、I2C地址冲突、隔离芯片损坏查I2C地址跳线、光耦/数字隔离器两边电平排查流程上我养成了一个固定习惯先看保险丝再量母线电容两端有没有高压接着看辅助电源有没有输出然后看监控芯片有没有起振最后才去碰输出部分。很多人一上来就量输出12V发现没有就慌了其实90%的电压输出异常根子都在前级或者辅助电源上。3.3 检修中的安全禁忌维修冗余电源最危险的不是大电流而是高压电容的残压。电源输入端整流以后母线电容上往往有三百多伏的直流电压而且断电后还能保持很长时间有的电容质量好的放一晚上电压都掉不下来。我见过不止一次有人拿万用表笔直接戳电容两端火花一冒手一抖工具就报废了。正确做法是断电后等五到十分钟再用放电电阻人为放电。放电电阻用几十到一百千欧、功率两三瓦的就行操作时表笔要先接电阻再接电容不要直接用镊子短路放电瞬间电流很大容易把焊盘打出一个坑。还有一个容易被忽略的禁忌示波器探头接地夹子不能随便夹。如果示波器本身没有做隔离探头地线是和大地点相连的一夹到热地电路上等于直接把市电短路到大地轻则跳闸重则炸探头。维修这类电源最好使用隔离变压器供电并且用差分探头或者隔离探头去测高压侧波形安全边际高很多。4. 实操案例一台双电源服务器电源板的维修全过程4.1 故障现象与初步判断前阵子机房同事送过来一台服务器现象是前面板电源指示灯亮的但系统死活起不来BMC后台报警“电源2输入断电”。现场查看电源2模块的指示灯不亮按道理这种冗余设计电源2坏了系统应该照样跑不至于开不了机但实际情况是电源1和电源2都装在同一个机箱里电源2故障后输出异常把母线电压拖得一塌糊涂导致整机无法正常上电。我的判断是先把电源2单独拆下来修。拆下来第一步先闻一下有没有烧焦味再用万用表电阻档测一下输入端的L和N之间阻值如果阻值接近零大概率是整流桥或者PFC开关管击穿短路了。实测结果输入阻值只有不到一欧姆基本坐实了输入侧有短路。4.2 按照图纸逐级定位故障打开机壳按图纸先查输入电路两点之间量保险丝已经开路再量整流桥输出端正向反向压降果然有异常整流桥内部有一个二极管已经击穿。继续往下查PFC部分的开关管G到SD到S三个极之间电阻全部接近零MOS管也烧了。这是比较典型的前级短路连锁故障保险丝、整流桥、PFC开关管经常是“一烧烧一串”。把这几颗坏件拆下来以后我没有急着装新件而是先查驱动电路和控制芯片有没有被连带打坏。用万用表量PFC控制芯片的供电引脚的VCC对地阻值以及驱动输出脚的对地阻值确认没有短路后才把新的保险丝、整流桥和MOS管装上去。这个步骤很关键如果控制芯片已经坏了换再多功率管上去一上电照样烧。装完前级我用电桥量了一下母线电容的容量和ESR两个大电解都有明显的容量衰减。这种老化电容在冗余电源里是隐患短期看不出问题但一旦遇到市电波动就可能导致PFC电压不稳后续设备跟着出问题索性一并换掉。4.3 更换元件、上电测试与老化更换元件之后上电测试不能直接插市电风险太大。我习惯用一个隔离变压器加交流调压器从低电压开始逐步攀升。先用调压器输出大概五十伏交流观察母线电容电压能不能跟着升到七十伏左右如果基本正常再慢慢调到一百八十伏、二百二十伏。整个过程盯着示波器和电流表一旦发现电流异常就立刻断电。实测这块板子从五十伏升到二百二十伏过程中母线电压稳定在三百九十伏左右PFC工作了辅助电源也给出了12V待机电压监控芯片的PGD信号正常拉高。随后接上电子负载测试12V输出从零逐步加流到满载输出电压波动在1%以内过流保护点也在标称范围内。之后把电源2装回服务器双模块同时上电。这一次系统能正常开机BMC也不报电源错误了。不过我多留了一个心眼让这台机器在机房跑了三天并且每天晚上去后台上看一次两个电源模块的状态确认风扇转速、温度、电压都在正常范围后才算真正收工。5. 经验总结与可复用的避坑清单5.1 维修中最容易翻车的几个细节冗余电源维修最怕的不是不会修而是修完以后装回去又坏。次数多了以后我总结出几个最容易翻车的细节每一个都是踩过坑才记住的。第一换功率管的时候不能只讲究型号一致还要看封装和热阻。有些型号看起来一样但实际散热焊盘面积不同装上去以后散热条件变了满负荷一跑就过热。第二MOS管的驱动波形检查不能省用示波器量一下栅极波形看上升沿附近有没有振铃如果有明显振铃说明驱动回路参数有问题长期运行会加剧管子发热。第三所有螺丝和绝缘垫片的位置必须复原。电源模块的原厂设计里散热片和功率管之间往往有绝缘垫和导热硅脂很多人拆完以后忘了装绝缘垫或者涂硅脂涂太薄结果一上电直接短路模块又烧了。第四修完以后一定要做至少两小时的老化测试但是很多维修点没有电子负载就用服务器自己当负载这样不是不行但要注意负载是否真的能达到满载如果测试期间负载只有百分之二三十一些薄弱点根本暴露不出来。5.2 工具与物料清单维修冗余电源我的工具清单常年是固定的分享出来给大家参考。首先是隔离变压器和调压器这两个是安全底线没有它们就不要碰这种高压电源。其次是数字示波器带宽一百兆以上带隔离探头的抓切换波形和驱动波形都靠它。再次是数字电桥用来测电容ESR和大电感的感量这个工具很多维修点没有但排查老电容老化时特别好用。万用表就不用说了建议人手一块带真有效值的测量待机电压和母线电压更准。焊接工具方面大功率烙铁和热风枪是必须的电源板的地层和功率管的焊盘散热都很快小瓦数烙铁根本不化锡。物料方面常备各种规格的低压电解电容、贴片电阻电容、共模电感、保险丝、整流桥、功率MOS管以及常用的ORing控制器和电源管理IC。这类物料价格不高关键是型号要对。我一般会做一个对应表把常见服务器电源模块的损坏元件型号记录下来下次修的时候直接看表备料不用每次都对着丝印查数据手册。5.3 自己设计热备份电源时的一些建议如果你不只是想修还想自己设计一套冗余热备份电源我也给几条过来人建议。第一选ORing控制器的时候不要只看它的导通电阻还要看它的故障保护逻辑是否支持双向阻断以及它的启动时序能不能配合你的监控芯片。第二均流不要做得太敏感两个模块之间只要把输出阻抗调到允许范围内大多数情况下不需要严格的均流协议很多服务器用的11冗余就是靠下垂法简单可靠。第三热备份切换的死区时间宁可长一点也不要追求极致的毫秒级切换。服务器对电源中断的容忍度通常在十毫秒以上你做到两三毫秒已经绰绰有余了死区太短反而容易因为两路输入相位差导致瞬间短路。第四监控报警的阈值不要设得太苛刻尤其温度保护冗余电源的散热环境受机柜气流影响很大阈值太紧容易误报警给运维人员添一堆不必要的麻烦。我自己在实际维修里的体会是冗余电源的设计和维护本质上都是在跟“不确定性”打交道。你没法保证硬件永不故障但可以通过合理的拓扑、可靠的ORing切换和细致的图纸分析把一次故障的影响范围控制到最小。掌握好这些底层逻辑修一块板子也好设计一套热备份电源也罢遇到那些千奇百怪的问题时心里就能始终有一条清晰的排查主线不会瞎忙活。
返回列表