ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

光网络保护APS详解:从1+1/1:1到50ms倒换的工程实践

光网络保护APS详解:从1+1/1:1到50ms倒换的工程实践 简介光网络保护APS技术是保障光通信网络稳定运行的关键机制。面向光网络运维、传输网规划与通信工程学习者的PPT学习教案系统梳理了APS自动保护切换的基本概念、保护与恢复的区别、光层保护趋势以及SDH/WDM网络中的典型保护结构并从保护倒换的必要性出发对比11、1:1、1:n等模式讲解复用段保护与通道保护原理还给出了倒换时间门限等关键指标适合作为课程讲解或自学入门资料。资源共1个pptx文件压缩包大小446KB内容组织为APS概述、基本原理与系统实现三大部分全篇58页图文结合便于教学演示。目前已有35人浏览学习对希望快速理解光网络生存性设计与APS应用场景的读者具有直接参考价值。学完后可掌握11并发优收、1:1收发倒换、m:n保护等核心机制了解OTU/ODU层保护差异及标准化协议要求为解决实际网络故障恢复策略打下基础。1. 光网络保护APS为什么一根光纤断了业务恢复却卡在50ms这条线上干线上一根光纤被施工挖断承载的上百个波长业务瞬间中断。如果没有保护机制人工找到断点、重新熔接、恢复业务至少以小时计而光网络保护APS要做的是在断纤发生的几十毫秒内把业务自动切换到备用通路。这份教学资源的价值不在于罗列概念而在于把APS的保护倒换机制完整拆开11并发优收、1:1收发倒换、m:n保护、G.841/G.842标准以及50ms/200ms/2s这几个关键倒换时间门限的工程含义。适合刚上手波分设备、需要理解保护组配置逻辑的维护人员也适合在做网络设计时估算保护资源和倒换性能的从业者。2. 保护与恢复的底层差异为什么光层比电层更适合承载关键业务2.1 网络生存性保护用预分配容量恢复用可用容量要理解APS首先要把“保护”和“恢复”两件事分开。这是两套完全不同的思路虽然最终目标都是让业务在故障后能继续跑。网络生存性的定义是网络设备发生故障时无需人为干预在极短时间内维持可容忍服务水平的能力。这个定义里“极短时间”是关键也是APS存在的理由。网络保护利用节点间预先分配的容量实施工作通道发生失效事件时通过设备倒换动作使信号从保护通路保持有效。它的特点是时间快、可靠性高但资源利用率低。网络恢复则相反它利用节点间任意可用的冗余容量重建业务资源利用率能大幅提高但速度明显慢。现场最常见的问题就是把这两个概念混在一起尤其是ASON网络里保护与重路由并存的时候故障瞬间可能出现“保护已把业务切到备用波长恢复机制又试图重新计算路由”的踩踏。我一般会在开局文档里明确区分保护是硬件级别的确定性动作恢复是软件级别的搜索计算过程。做设计时还要注意一个现实保护容量从规划阶段就预留下来不参与统计复用。比如你用11保护工作波道和保护波道各占一半而恢复方式只是在故障发生后动态找空闲波长平时可以把这部分容量拿去跑其它业务。这也是为什么很多网状网方案优先谈恢复而不是保护但恢复又很难满足50ms要求的原因。2.2 光层保护透明、快速、协议无关为什么光层保护逐渐成为主流先看传输侧的变化单通道速率从2.5Gbps到10Gbps再到40GbpsWDM波长数从8波到32波到80波再到160波单根光纤承载的业务量越来越大。电层设备要完成交换、选路与中继交叉容量和处理能力出现瓶颈。于是OADM、OXC、ASTN/ASON这类光层节点设备开始普及光层互联的OTN成为趋势。在这个背景下直接在光层做保护比在IP层、ATM层或SDH电层做保护有四个明显优势。光层设备最先检测到故障可以更大限度减小损失。光信号丢失瞬间就能感知不需要等上层协议超时检测时间短倒换就能更快完成。光层保护比高层保护需要更少的协调性因为波长级保护直接作用于光通道不需要跨层协商。光层可以更有效地利用网络资源因为光层为不同的服务层所共享一套保护机制同时保护了承载在波长上的以太网、SDH、IP等各种业务。最后波长或链路的路由保护技术独立于高层使用的协议客户侧业务无论是什么类型都不需要单独配置保护逻辑。这就是所谓的高速、简单、高效、透明。不过光层保护也有代价。保护粒度粗一个波长倒换会同时影响该波长上承载的所有客户业务所以对客户侧业务的优先级梳理必须提前做。否则就可能出现一个低优先级的测试电路和一个高优先级政企专线挤在同一个被保护的波长里一旦倒换两者一起动作客户体验完全拉不开差距。2.3 倒换时间门限50ms、200ms、2s分别意味着什么APS的关键性能指标是倒换时间。这个时间不是拍脑袋定的它直接影响上层业务的中断表现。业界把倒换时间的影响分成四档每一档都有明确的业务影响判断。倒换时间对业务的影响工程判断≤50ms几乎无感知中断是透明的APS设计目标门限≤200ms交换业务连接丢失概率5%不影响信令网已建立的呼叫可接受但不推荐≤2s数据通信会话不超时图像业务有丢帧可恢复门限2s所有电路交换业务丢失连接即CDT连接丢失门限不可接受50ms这个数字最早来自SDH同步数字体系的保护要求OTN和波分设备的APS也沿用了这个指标。200ms对语音交换类业务是临界点超过这个时间一部分已建立的呼叫就可能断开。2s是数据业务的容忍极限TCP会话只要不超时基本还能保持但从业务体验上讲已经明显感觉到中断。大于2s所有电路交换业务都会丢连接这就是工程上绝对要避免的场景。实际测试时要知道倒换时间由三部分叠加而成故障检测时间、APS协议处理时间、交叉矩阵或光开关完成切换的时间。前两项通常可以控制在几毫秒到十几毫秒最后一项取决于设备架构。验收时如果测出来的结果在50ms附近飘不要急着怀疑设备性能先按这三段拆开排查大多数问题出在检测周期配置或协议应答等待上。3. 11、1:1、m:n三种保护机制从并发优收到共享通道的取舍3.1 11并发优收收端独立判决让倒换做到无协议11保护的全称是并发优收也叫双发优收。发端把同一份业务同时送到工作通道和保护通道收端同时监视两个通道的信号质量择优选择一路输出给客户侧设备。整个过程只需要收端做判决不需要发端参与更不需要任何信令协商。这就是11保护最核心的特征仅目的端倒换。因为收端是独立决定选哪一路的所以11保护天然适合任意网络结构点对点、环、网格网都行。实现简单可靠性高。缺点是带宽利用率只有50%因为保护通道完全被业务占用没法加载其它业务。对于跨距长、中间站多的干线我一般优先推荐11尤其在两个站点之间没有网管互通条件时11几乎是唯一稳妥的选择。在设备实现上11又分成复用段保护和通道保护。11复用段保护在OTU层实现整段复用段一起切换保护的是该段内所有波长业务11通道保护在ODU层实现按单个光通道颗粒度做保护。通道保护还可以进一步分成设备11冗余保护和设备不冗余保护。设备冗余保护可以抵抗业务收发设备故障相当于用设备冗余的代价增强保护可靠性。现场做方案时如果只申请了线路侧的11通道保护没有对收端OTU板卡做冗余配置那就只能抗光纤故障板卡故障依然会全断。这个问题在项目验收时经常被忽略后面第5章专门展开。3.2 1:1收发倒换协议应答换一路额外业务1:1保护的结构是正常业务只走工作通道保护通道平时空闲可以加载一路“不受保护”的额外业务。工作通道故障时发端把业务倒换到保护通道同时通过APS协议通知收端让收端也把选择开关切到保护通道。这就是收发倒换的含义两端都要动而且需要协议应答。代价很清楚多了一个协议交互过程倒换时间会比11略长实现复杂度也更高。换来的是资源利用率提升保护通道空闲时可以跑额外业务带宽不再浪费。从结构上说1:1保护的保护通道/复用段是专用的只是允许加载优先级较低的额外业务。额外业务本质上是“可被挤占”的一旦工作通道故障额外业务马上被丢弃把通道让给被保护业务。这个属性必须在业务开通时跟客户书面讲清楚否则后续运维时会被投诉淹没。1:1保护是可回复性的保护故障解除、工作通道恢复正常后业务会倒换回工作通道。可回复机制能保证保护通道尽快恢复空闲状态为下一次故障做准备。但可回复也意味着要多一次倒换动作所以工程上通常配合WTR等待恢复计时器使用防止故障反复时来回抖动。11保护如果收端OTU做了冗余配置同样支持自动回复回复方式上两种结构差别不大。3.3 m:n保护共享保护通道与优先级抢占m:n保护是共享保护的一种用m条保护通道去保护n条工作通道。当n大于m时保护通道是共享的不能保证所有工作通道同时被保护。多个工作通道同时故障时系统按优先级从高到低选择业务进行保护低优先级业务只能等待。这种结构对资源利用率的提升最明显但代价是信令复杂度成倍上升。保护通道需要先建立与各工作通道的对应关系再根据APS协议动态协商倒换对象。PPT里也明确提到了1:n应用少m:n应用少。实际网络中1:n和m:n更多出现在网状网波长路由场景或者在客户对保护要求不高、但又希望节省波道资源的链路上。对于常规干线和城域波分11或1:1仍然是主流选择。做选型时可以参考下面这张表判断维度111:1m:n保护通道是否可承载额外业务否可可是否需要协议应答否是是适用网络结构链、环、网格环、网格环、网格典型带宽利用率50%较高高实现复杂度低中高倒换速度最快稍慢取决于协商4. APS标准与工程配置从G.841到G.gps的落地路径4.1 G.841、G.842与G.gps三层标准定位APS不是一个孤立技术它有明确的国际标准支撑。G.841协议描述了在SDH网络上实现各种可选保护结构时在设备级必须满足的说明它是设备实现层的标准。G.842协议则提供了网络保护结构互连的特性解决的是两个保护域对接时的互通问题。简单区分G.841管单设备内部怎么做保护G.842管保护结构之间怎么连起来。国内CAINONET高速信息示范网项目里的方案基本遵守G.841协议继承了原有SDH上的保护技术并根据光网络的特殊性对协议做了修改。这个思路到今天仍然适用SDH时代的保护逻辑依然是OTN设备APS的底子OTN只是在颗粒度和触发条件上做了扩展。ITU-T后来形成的光网络保护草案G.gps进一步把光层保护标准化但商用设备更多还是靠G.841的思路扩展ODUk保护逻辑。如果你要查具体设备支持哪些保护类型先在网管上看它是否完整实现了G.841定义的桥接和选择逻辑再对照G.842确认跨设备互连是否兼容。4.2 链型、环型、网状网保护方式的选型对应保护方式的选择与网络结构强相关。链型网络最简单常见做法是在链路的两个终端站点做11或1:1保护中间站点只做穿通不需要参与倒换判决。环型网络选择最多两纤单向通道保护环、两纤双向复用段保护环、四纤双向复用段保护环各自有典型的应用场景。网状网则以波长路由保护为主用OXC或ROADM节点配合波长级交叉保护资源可以跨多个站点动态调度。网络结构主流保护方式工程要点链型11/1:1复用段或通道保护中间站穿通端站判决环型-两纤单向通道保护环配置简单占用整个环容量环型-两纤双向复用段保护环1:1/11保护通道可跑额外业务环型-四纤双向复用段保护环11抗多次故障成本高网状网波长路由保护恢复需要信令与路由计算支持选型时有个经验法则业务分散、以点到点为主的小规模环网直接用两纤单向通道保护环配置工作量最小业务集中在几个大节点之间、需要复用保护容量省波道的上两纤双向复用段保护环对安全性要求极高的核心骨干用四纤双向复用段保护环或11通道保护叠加设备冗余。光层保护已经能覆盖大多数故障场景但跨环业务如果只有环内保护没有端到端的保护通道还是得靠网状网的恢复或额外配置波长级保护这点在规划阶段就要想清楚。4.3 工程参数SF/SD触发、WTR与恢复模式APS的工程配置参数虽然在不同厂商网管上名称有差异但核心参数项是通用的。下面这张表列出的是我在调测时一定会核对的项目参数常见取值作用保护类型11 / 1:1 / ODUk SNC决定倒换逻辑与协议复杂度触发条件SFLOS、OTUk_AIS、BER劣化强制倒换优先级最高触发条件SDBER ≥ 1×10⁻⁶信号劣化倒换门限恢复模式可回复 / 不可回复故障清除后业务是否自动回到工作通道WTR5~12分钟防抖避免故障反复时来回倒换额外业务使能 / 禁止仅1:1或m:n保护下有效业务优先级高 / 低共享保护时的抢占顺序触发条件是APS里最需要仔细核对的地方。SF信号失效指LOS、LOF这类明确表示通道不可用的事件一旦出现立即倒换。SD信号劣化指BER劣化到设定门限通常按1×10⁻⁶或1×10⁻⁵配置属于软故障需要持续一段时间确认不是瞬时抖动才触发倒换。两端站点的SF/SD门限必须保持完全一致否则可能出现一端判失效、另一端判劣化两边进入不同的倒换状态业务反而中断。WTR的作用也很关键故障恢复后业务不立即倒回而是等一个固定的等待时间我一般设5分钟既避免人为抖动也不至于让保护通道空闲太久。5. 避坑指南APS部署与调测中五个典型问题5.1 正常倒换却出现业务闪断现象断纤后APS告警正常上报倒换动作看起来也执行了但从分析仪看到的业务中断时间超过50ms或者出现零星CRC误码客户侧设备甚至检测到告警。原因最常见的是工作通道和保护通道的收端光功率差异过大收端优收电路在两个通道电平不一致的状态下切换判决不稳定产生瞬断。另一个原因是工作与保护路径的时延差很大切换瞬间收端选择逻辑出现短暂异步。解决先校准两端入收光功率用光衰耗器把工作与保护通道的光功率差值控制在3dB以内再复测。然后实测工作通道和保护通道的传输时延差如果差值特别大考虑在短路径侧加光纤时延补偿器或者调整收端设备的缓存配置。倒换时间异常不要一上来就怀疑设备硬件先从光功率和时延这两个物理量查起。5.2 1:1保护通道上的额外业务被抢占引发投诉现象1:1保护配置了额外业务工作通道断纤后保护逻辑正常倒换被保护业务没断但额外业务出现大面积丢包甚至全断客户立刻投诉。原因这是设计使然。额外业务本质上是“可被挤占”的保护通道一旦被倒换占用额外业务必须让路。问题出在开通阶段没有把额外业务的属性告诉客户或者客户以为额外业务也受到一定保护。解决凡是在1:1保护通道上开的额外业务都要在业务开通单里标注“可被挤占、不受保护”并让客户确认。有条件的话在网管里给额外业务单独打标签倒换发生时自动发送通知给对应维护人员。对价值较高的额外业务建议重新规划路由不要挂在保护通道上。5.3 设备不冗余的11通道保护在单板故障时失效现象11通道保护配置完成线路故障时倒换正常。但某天一块客户侧OTU单板故障业务直接全断保护通道没有接管。原因PPT里专门提到11通道保护分为设备11冗余保护和设备不冗余保护。如果只做了线路侧保护没有对发端或收端OTU做设备级冗余那么OTU单板故障不在保护范围内。11保护主要抗的是光纤和线路侧故障不抗设备故障。解决重要业务启用设备11冗余保护把收端OTU配置成冗余保护组正常时双发优收单板故障时由另一块板卡继续输出信号。如果设备不支持或不具备冗余条件只能降级接受故障风险或者在业务重要性评估阶段就不把该业务纳入纯线路保护保护范围。5.4 倒换时间超过50ms现象验收测试时从断纤到业务恢复的时间测出来在50ms以上甚至跑到80ms不达标。原因倒换时间由故障检测、协议处理和矩阵切换三段叠加。1:1保护需要收发端协议应答本身就比11慢。另一个常见原因是ODU层性能监视周期配置过长信号劣化检测要等好几个周期才确认。还有可能是保护通道上跑了额外业务倒换前需要先处理额外业务的拆除拖长了整体时间。解决先确认保护类型对倒换时间有硬性指标的路由尽量使用11省掉协议应答环节。然后把告警检测周期和SD触发周期配置到最小允许值保证劣化检测能快速收敛。实际测试里测到50ms边缘时再检查WTR等待时间如果故障恢复后很快就再次触发前后两次倒换叠加也会造成时间异常这时候把WTR适当调大。5.5 双端倒换状态不一致导致业务中断现象断纤后两端网管上显示的状态不一致一端显示业务在工作通道另一端显示业务在保护通道业务从一端到另一端是断的。原因两端检测到的失效条件不一致。比如一端检测到LOS信号失效另一端只检测到BER劣化两边的SF/SD判断不同步进入的倒换状态自然不同。也可能是APS协议帧在故障时被打断收端没有收到发端的倒换请求。解决核对两端SF/SD触发门限配置必须完整一致包括劣化持续时间设置。然后检查两端光功率余量正常情况下两端应该同时进入SF或SD状态而不是一端严重一端轻微。发生状态不一致且业务中断时立即在网管上人工强制倒换到保护通道恢复业务后再慢慢排查根因先把业务救回来永远是第一位的。6. 倒换验证用一次标准断纤测试校准APS的关键参数APS配置完成后验证不能只看网管状态。我习惯的做法是在发端OTU光口做激光器关断代替直接拔纤。拔纤不可控激光器关断可以重复操作而且不会损坏光接口。收端接OTN分析仪或SDH分析仪先记录测试前基线的误码情况确认无误码后才开始动作。测试步骤分四步第一在收端仪表上建立连续业务流并观察误码基线第二在发端执行激光器关断保持5秒后重新打开第三记录仪表上的业务中断开始和结束时间差值就是倒换时间第四同一方向重复测试三次取最大值为验收依据。测试完成后到网管上核对APS状态确认倒换原因、倒换方向和恢复模式是否与设计一致。如果测出来的倒换时间超过50ms先看告警顺序是否先出现LOS告警再出现APS动作中间有没有额外的检测延迟。再看两端倒换状态是否同步有没有一端先切一端后切的情况。按第5章的思路逐项排查而不是直接下结论说设备倒换性能不达标。我经历过一次验收客户用第三方仪表测到一个方向32ms、另一个方向54ms后来查出来是短方向的光功率差接近5dB优收判决不稳定。从那以后我每次做APS验证之前都强制先做一遍两端光功率对齐和SF/SD门限核对再谈倒换时间。这个习惯帮我省掉了大量返工也希望对你有用。本文还有配套的精品资源点击获取
返回列表