ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

112G/224G SerDes中CTLE为何不再需要背景自适应?

112G/224G SerDes中CTLE为何不再需要背景自适应? 如果你做过112G/224G SerDes接收链路的设计或调试多半会碰到一个很反直觉的现象老一代10G/25G串行链路里CTLE连续时间线性均衡器背后通常都会跟一个自适应环路实时调boost可到了56GBaud甚至112GBaud的PAM4时代大量商用方案却把CTLE做成“训练时扫档、跑起来固定”有些DSP甚至连后台自适应使能位都默认关掉。为什么速率越高越不需要CTLE做背景自适应这篇文章我就把背后的工程逻辑拆开讲清楚。我会先讲CTLE和背景自适应在低速链路上的经典实现再分析112G/224G系统中均衡任务的变化然后给出四个核心原因最后聊一聊实际项目中怎么评估“要不要给CTLE留后台更新”。如果你正在做高速互连、SerDes调测、DSP均衡策略选型或者只是对“固定CTLE”这种设计有疑问这篇应该能帮你省不少踩坑时间。1. 问题的本质为什么112G/224G系统提出“无背景自适应”1.1 从传统低速链路的习惯说起先回到低速时代。所谓背景自适应指的是接收机在正常传输数据的同时持续根据接收信号的特征去微调均衡器参数而不是只在初始阶段做一次校准。经典做法有两类一类是频谱能量检测把接收信号分成高频、低频两路分别积分比较能量比值之后反馈控制CTLE峰值增益另一类是基于判决误差的LMS类算法用数据判决结果和期望电平之间的误差量去迭代滤波器系数。在10G/25G NRZ时代这种后台追踪很有必要。电缆被拖拽、连接器氧化、机房温度昼夜波动都会让信道损耗实时变化个几dB而那时的接收机结构相对简单DFE抽头数量有限CTLE算得上均衡主力。如果CTLE不跟着信道状态走眼图裕量就会被吃掉一大块。低速时这个自适应环路的带宽能做到几十kHz量级模拟实现也不复杂一个比较器加一对电荷泵就能干活成本和可靠性都说得过去所以大家习惯了有自适应。1.2 高速系统的均衡任务被重新分配到了112G/224G时代情况完全不同。先明确一个基础概念112G PAM4对应的符号率是56GBaud224G PAM4是112GBaud换句话说信号带宽要覆盖到28~30GHz乃至55~60GHz。这个频率下即使是一段不到半米的PCB走线也能轻松吃掉20~30dB的高频分量长背板通道损耗到40dB以上并不稀奇。一台单独的CTLE就算在模拟域把高频提升拉满也不可能把这样深的信道坑填平否则噪声放大和群延时失真早就让电路崩掉了。所以高速接收链路的均衡必须分层拆解CTLE只负责大尺度的斜坡补偿ADC后面的DSP负责精确的波形重建DFE负责追踪残存ISIFEC再兜底。CTLE的目标不再是“精确贴合信道每一个变化”而是保证进入ADC/DSP的信号幅度和频谱落在理想区间。均衡角色变了后台连续自适应的必要性自然就没了。我用一个直白的类比低速系统里CTLE是主唱必须实时调话筒高速系统里它是贝斯手提供一个稳定基调真正精细的即兴处理全部交给后面的数字DSP。2. 深挖背后的四个核心原因2.1 PAM4的SNR预算经不起折腾怕的反而是“乱跟踪”PAM4调制的四个电平把发射摆幅分成三个眼相对于等幅NRZ每个电平间隔只剩原来的三分之一等价于有效SNR直接下降约9.5dB。这意味着接收机本身的裕量非常紧张任何均衡参数的过度波动都会直接影响误码率。如果CTLE在后台持续爬升或降低boost输出信号的高频分量会跟着起伏眼图的垂直方向和水平方向都会出现“呼吸感”。呼吸感还不是最致命的真正麻烦的是CTLE的高频提升在放大信号的同时也放大了噪声。低速系统里一两个dB的估计误差可能只是让BER从1e-15变到1e-14同样误差在PAM4系统里完全可能让纠前BER从1e-4变成1e-3直接击穿RS-FEC的纠错门限。所以很多芯片把CTLE设计成离散档位boost以0.5dB或1dB为步进就是为了让结果变得可预测、可重复。宁可让CTLE偶尔补偿不到位也不能让它“乱动”引入随时变化的噪声增量。2.2 模拟域自适应环路的固有代价面积、功耗和环路耦合要真正实现CTLE后台自适应必须把接收信号分出一路做频谱检测或者误差检测再把反馈结果送回CTLE的偏置电路或电容阵列。这套反馈链路在56GBaud符号率下需要有足够检测带宽检测器寄生电容、比较器延迟、控制环路相位裕度每一样都要重新设计。结果就是为了一个“可能用得到”的功能模拟前端要增加一堆晶体管和走线而这些额外结构会让最高频敏感路径的布线难度直线上升。更大的坑在于环路耦合。一个112G/224G接收链里通常已经有AGC增益环路、CDR相位环路、DFE自适应环路。如果再叠一个CTLE调节环路四个环路在有限的带宽内容易互相干扰出现低频振荡或更新不同步。我遇到过很典型的现场开了测试用的CTLE后台自适应后误码率呈现低频毛刺抓眼图又看不出明显塌陷最后定位到是自适应更新节拍和CDR环路形成了差拍。工业界逐步把CTLE后台环砍掉把面积和功耗留给数字域功能这个选择本质上是在规避多环耦合风险。2.3 高速系统的信道时变特性反而比想象中稳定背景自适应存在的意义是应对“信道时变”。低速链路常见的场景是长线缆被拖拽、连接器插拔、设备热插拔这些都会让信道响应发生突变。但在112G/224G系统里通道主要是板内PCB走线、背板、连接器或直接附着的电缆组件正常工作时几乎没有机械形态变化。温度变化是相对慢的过程时间常数通常达到分钟甚至小时级别而且往往是整板一起温漂不是某一个频点突然跳变几dB。对于这种慢漂移链路训练阶段完成一次校准之后靠DFE慢速更新和FEC兜底完全够用。即使温度让信道损耗偏了一两dBDFE有额外的系数余量去跟踪FEC还能容忍纠前误码率到1e-4左右。真的漂移到FEC都兜不住时也可以通过SER监制触发链路重新训练。对照下来CTLE后台自适应等于用一个高功耗、高耦合风险的机制去跟踪一个演化得很慢的问题性价比很低。2.4 链路训练已经替后台完成了“自适应”有一件事很多人容易忽略IEEE针对高速电气接口的规范普遍支持链路训练。802.3bs面向100GE/200GE/400GE802.3ck面向100G/200G/400G每lane 100G甚至200G链路训练期间接收端可以主动反馈系数调整建议发送端FFE和接收端均衡一起收敛到一组较优参数。训练完成后发送FFE、CTLE、VGA、DFE全部锁定在寄存器里。此时链路不是没有自适应而是把“自适应”从事中挪到了初始化和重训练阶段。这种前台校准模式还有额外的工程可测试性寄存器能直接读出每一档CTLE值软件可以手动改写工程师在一致性测试和互操作验证时能复现同一套配置。如果真采用全后台自适应每次测试时参数都不可控同样一条链路跑两遍可能得到两套结果这会严重妨碍故障定位和认证测试。所以“训练定档运行冻结”不是技术倒退而是通盘优化的结果。3. 工程上如何落地CTLE“训练定档”与其余均衡的配合3.1 典型112G/224G接收链架构我按常见DSP接收机架构列一下关键链路线性放大器、CTLE、VGA、高速ADC、数字FFE、DFE、CDR、FEC。CTLE位于ADC之前它的输出幅度直接决定ADC动态范围的使用效率。芯片寄存器里通常有类似CTLE_BOOST[3:0]、CTLE_POLE[2:0]之类的字段这就是设计留给训练算法的控制对象。这里还要提一个ADC量化位宽的问题。112G PAM4接收机的ADC分辨率往往只有6bit左右量化误差相当可观。如果CTLE没有把信号频谱修好ADC的有效位数会继续浪费后续DSP再强也弥补不了前端的量化损失。所以CTLE“定档训练”本质上是帮ADC确定一个最优工作区间让ADC的有限精度花在刀刃上。3.2 一次完整的“训练定档”流程怎么走具体到项目实现流程可以这样理解进入链路训练模式发送端发送训练序列接收端把CTLE放在一个默认中等档位。接收端统计信号功率和噪声基底估算当前信道在奈奎斯特频率附近的损耗快速粗选一个boost值。利用内置眼图监视器或者误码计数在粗选档位附近遍历两三个boost值找出眼高、眼宽最均衡且DFE系数不极端的组合。把CTLE档位、VGA增益、DFE初始系数一起锁定到寄存器。正常数据传输阶段只靠DFE做符号级后台更新FEC和SER监控作为慢速守门员。SER接近阈值时先尝试微调DFE无效则触发重新训练重走扫档流程。注意第5步里的DFE后台更新和传统CTLE背景自适应完全是两码事。DFE是数字实现更新环路简单可控功耗低而且只影响前馈波形重建的尾拖部分不会像CTLE那样大范围改变前端频响。3.3 DFE为什么更适合承担后台慢速更新DFE的自适应本质是数字误差驱动直接用判决误差做梯度下降。它可以做到逐符号更新也可以降速到几十kHz做慢循环实现代价是若干乘加器和状态寄存器。更重要的是DFE系数更新不会改变前端模拟滤波器的带宽和群延时不会给CDR带来额外相位干扰。所以在现代高速链路里时变残余主要由DFE接管不是由CTLE接管。实际调试时有一个很好用的判断信号如果DFE第一抽头系数常年贴着设定上限跑说明前端补偿明显不足CTLE档位偏低。这时候把CTLE提一档可能比继续抬DFE更合理。反过来说如果CTLE一调档DFE系数就大幅波动说明训练定档时没有给DFE留好配合空间。3.4 FEC、重训练和其它兜底手段400G/800G系统普遍配备RS-FEC比如RS(544,514)的KP4。以它能容忍的纠前BER约1e-4、纠后BER 1e-15为例链路均衡的目标从来就不是“零误码”而是“保证误码率低于FEC纠错门限”。这个余量设计恰好让CTLE不必紧盯着微小偏差因为残留的码间干扰可以交给FEC纠正。当链路真的因为温度冲击、器件老化跑偏太多接收机还会根据SER监测自动触发链路重训练。一次重训练也就是几十微秒到几百微秒的事走完“扫档—锁定—恢复”流程后链路性能就回来了。把这套组合拳打出来CTLE后台连续自适应在整体系统中几乎就是个多余件。4. 常见误区与排查技巧实录4.1 “不用自适应参数随便配”是错的先说一句容易被误解的话CTLE不做后台自适应绝不代表它不重要更不表示可以随便填一档就完事。CTLE档位直接决定ADC动态范围、噪声放大倍数和DFE初始收敛点。我在实际项目中见过CTLE从低boost档换到高boost档后DFE系数和误码率能差一个数量级的情况。它只是不需要在后台频繁更新但它必须是经过训练算法认真选出来的。4.2 判断CTLE档位是否合适的三个信号可以看三个指标。第一DFE第一抽头系数是否贴近极限。如果贴着最大值运行大概率意味着CTLE boost不够。第二SER或FEC统计是否随温度出现缓慢漂移。如果漂移趋势每次都能被某个CTLE档位改善说明训练目标函数可能没包含温度因素。第三PAM4三个眼的高度是否均衡。PAM4有上、中、下三个眼不同档位对高电平眼和低电平眼的影响不同需要找到三个眼都能接受的折中而不是只盯着中间那个眼。4.3 什么场景要警惕“自适应关闭”导致的隐患虽然我认为大多数场合不需要CTLE背景自适应但有两种场景需要额外关注。一是环境温度剧烈变化而链路无法重训练的场合比如工业温控异常二是运行中长距离电缆持续被弯折的场景比如仪器探头反复移动。遇到这两类问题排查顺序建议是先看DFE是否在正常更新再看FEC纠错统计是否暴涨最后确认CTLE定档是否有误。保存一套包含CTLE boost、VGA增益、DFE各抽头、FEC计数的寄存器快照对定位到底是哪个环节在漂移非常有用。4.4 一套比较完整的验证步骤如果需要最终拍板“CTLE要不要带后台更新”可以参考下面的验证流程建链成功后读取并保存CTLE、VGA、DFE、FEC相关寄存器快照当作基线。做温度循环老化测试每隔一段温度点记录SER和寄存器变化。观察DFE系数是否保持在非边界区域确认收缩余量。如果SER缓慢上升手动把CTLE加一档或减一档观察DFE系数和误码率的变化方向。确认变化方向后决定要么靠DFE慢更新吸收温度漂移要么在特定温度触发一次重训练。我和团队大多数项目的最终结论是训练定档加DFE慢更新已经能覆盖绝大多数场景。CTLE后台自适应不仅没帮上忙反而因为环路耦合引入了低频眼图呼吸问题属于吃力不讨好。5. 一个让我彻底转变思路的实战案例说一段自己的真实经历。几年前做一款56GBaud PAM4 retimerCTLE按8档粗调设计固件在上电训练时做一次冒泡扫描之后完全冻结。项目早期留了一个测试位叫“CTLE自适应使能”本来只是评估备用方案。结果在一次温度冲击测试中误码率周期性出现毛刺一开始我怀疑是CDR失锁连夜抓波形没有看到明显幅度塌陷只看到采样点有轻微低频漂移。排查到最后才发现CTLE自适应环路的更新节拍和CDR环路产生了差拍两个环路在温度和电压波动下互相拉扯损伤刚好落在FEC纠错能力边缘。把测试位关掉、改用DFE慢速更新之后毛刺消失链路在后续连续几个月的温循实验里都很稳定。从那以后我对高速串行链路的均衡分工有了更强的倾向性模拟域的CTLE负责“一次校准、长期粗补偿”数字域的DFE负责“实时细追”两者各守边界。回到标题的问题所谓“112G/224G系统中CTLE无需背景自适应”准确说并不是技术上完全无法实现而是整个系统在设计权衡之下选择了不做。高速链路要面对的是噪声、功耗、环路稳定性、可测试性等多重约束把自适应任务分层分配给数字域CTLE扮演好粗补偿者的角色才是更合理的工程解法。如果你正在纠结该不该给CTLE加后台更新我建议先打开寄存器看三组数CTLE档位、DFE收敛后的系数位置、FEC纠前BER趋势。数据会告诉你到底缺不缺这一个额外的模拟自适应环。
返回列表