ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

光模块带宽焦虑怎么破?从NRZ到PAM4的调制演进与技术代价

光模块带宽焦虑怎么破?从NRZ到PAM4的调制演进与技术代价 毫不夸张地说过去十年里数据中心光模块内部的“人口密度”一直在上升。同样是手掌大小的QSFP封装早年跑40G后来跑100G现在新一代的QSFP-DD直接干到800G模块尺寸几乎没怎么变速率却翻了二十倍。很多人觉得这是激光器功率变大了、探测器更灵敏了其实都不是。核心变化是信号调制方式从NRZ换成了PAM4——把原本“一个符号只能传1比特”的规矩改成了“一个符号传2比特”。这个改动听起来只是数学上翻了一倍但背后牵涉到光纤色散、信噪比预算、DSP补偿、前向纠错等一系列连锁反应。这篇文章我会从最基础的调制原理讲起把“光模块为什么越来越挤”“PAM4怎么把带宽挤出来”“挤出来的代价是什么”这几个问题一次讲透适合正在接触100G/400G光模块的网络工程师、数据中心运维以及对光通信底层原理感兴趣的硬件开发者。1. 端口速率“军备竞赛”背后的物理瓶颈信号到底怎么挤进一根光纤1.1 从25G到800G单通道速率才是关键变量先看一组实际的产品路径早期的10G光模块一根光纤里只跑一路信号速率就是10Gbps到了25G时代一根光纤里的单通道速率提升到25Gbps四路并行就成为100G4×25G也就是我们熟悉的QSFP28再往后400G模块普遍做成4×100G或者8×50G到了800G基本就是8×100G。仔细看这条演进路线你会发现一个规律光模块的总速率 并行通道数 × 单通道速率。通道数不可能无限增加因为光纤芯数、模块体积、散热和功耗都有上限所以单通道速率的提升就成了最核心的“军备竞赛”指标。单通道速率怎么提物理学上只有两条路提高波特率Baud Rate让信号每秒钟变化得更快单位时间内塞进更多符号。提高每个符号携带的信息量原来一个符号只代表0或1现在让一个符号代表00、01、10、11四种组合。NRZ走的是第一条路PAM4走的是第二条路。1.2 带宽焦虑不是凭空来的而是应用倒逼的为什么一定要提速率因为数据中心内部的东西向流量这几年的增长实在太猛了。AI训练集群的通信模式是典型的“All-to-All”几百张GPU卡同时互相交换数据传统的三层网络架构直接被这种流量模式冲垮于是有了大带宽的Leaf-Spine架构而Leaf-Spine架构里每条链路都要高带宽。更要命的是GPU的PCIe接口已经到PCIe 5.0单通道32GT/s甚至PCIe 6.064GT/s网卡从100G往200G、400G走光模块必须跟上。这不是“想不想要”的问题而是“不通就卡脖子”的问题。所以整个行业对单通道速率有一种近乎执着的追求25G→50G→100G→200G每代都在压缩信号在时间轴上的宽度。1.3 “挤”这个字形容得特别准确为什么说光模块越来越“挤”因为光纤本身是一种带宽资源极其丰富的介质单模光纤在1310nm窗口的可用带宽有几十个纳米对应到频率上有好几个THz理论上能跑几百Tbps。真正卡住速率的不是光纤而是光模块里的电学器件——驱动芯片、TIA、DSP这些电路能处理的信号速率有限。这就好比一条十车道的高速公路光纤非常宽但你收费站的闸机口电学芯片每秒钟只能抬那么多次杆。为了让更多车通过你只能让每辆车里坐更多人——这就是PAM4干的事让每个信号符号里“坐”进两位信息。2. NRZ的“天花板”为什么100G NRZ单通道“不划算”2.1 NRZ的原理一个符号只有两种状态NRZNon-Return-to-Zero非归零码是光通信里最经典的调制格式简单说就是高电平代表1低电平代表0不存在第三种状态。它的好处是天生抗噪声只要接收端能把高电平和低电平区分开误码率就非常低。信号电平之间的间隔足够大眼睛图Eye Diagram张开得很饱满接收机判决的容差范围也大。在NRZ体系下比特率就是波特率。25G NRZ的信号其符号速率就是25GBaud每个符号携带1比特。2.2 波特率一路涨上去为什么到了50G就卡住了如果NRZ这么好为什么不像早期10G→25G那样继续把波特率提到50GBaud、100GBaud做单通道50G或单通道100G呢答案很简单物理链路不给面子。波特率提高意味着信号的频谱展宽而在光纤传输中色散Chromatic Dispersion对不同频率分量的延迟不一样。信号频谱越宽各频率分量到达时间差就越大脉冲就被展得越平码间干扰ISI越严重。更现实的限制在电学部分。50GBaud的信号其基频到25GHz三次谐波到75GHz这对驱动芯片、TIA、封装基板、连接器都是很大的挑战。要在这些器件上同时做到高带宽、低损耗、低反射成本和功耗会急剧上升。行业里不是没试过50G NRZ但做出来的模块在灵敏度、功耗、成本上完全没有竞争力迅速被市场淘汰。2.3 100G时代的真实选择4×25G NRZ打天下100G以太网早期大规模部署的QSFP28模块就是选择了4路25G NRZ并行而不是做单通道100G NRZ。当时这个决策非常务实25G NRZ的技术已经成熟4路并行的成本、功耗、良率都可控唯一的问题是4根光纤占用的空间和连接器成本偏高。如果用一句话总结NRZ的处境它本身没有问题但它的调制效率上限锁死了单通道速率的“性价比拐点”。一旦你发现再往上提波特率每一分带宽都要付出比之前高得多的代价这时候换调制格式就成了必然选择。3. PAM4的“挤”法同样波特率信息量翻倍的数学逻辑3.1 PAM4的本质把电压轴切成四段PAM4Pulse Amplitude Modulation 4-Level四电平脉冲幅度调制的原理可以用一句话讲完在相同的符号速率下把信号的幅度轴从2段切成4段。NRZ只有两个电平比如0V和1VPAM4则有四个电平比如0V、0.33V、0.67V、1V分别对应两位二进制组合00、01、10、11。这样每个符号携带的信息量就从1比特变成了2比特。在符号速率波特率不变的情况下比特率直接翻倍。3.2 关键数学波特率没涨比特率翻倍设符号速率为R单位Baud调制阶数为MNRZ的M2PAM4的M4则比特率B R × log₂(M)。NRZlog₂(2) 1比特率 波特率PAM4log₂(4) 2比特率 2 × 波特率以50G PAM4为例它的符号速率只有26.5625GBaud这数字里还包含FEC开销后面细说而50G NRZ需要50GBaud的符号速率。前者对光电器件的带宽要求远低于后者这就是PAM4能用“接近25G NRZ的带宽器件”实现“50G甚至100G单通道速率”的原因。可以打一个比方NRZ像两层楼的房子每层住1人PAM4像四层楼的房子每层还是只有那么大的地基面积但能住2人。楼层变多了房子横向占地面积没变大代价是每层层高变矮了住起来“挤”一些。3.3 标准里的数字26.5625GBaud从哪来细心的读者会注意到50G PAM4和100G PAM4的符号速率都是26.5625GBaud100G单通道在400G DR4模块里也是这个符号速率。这个数字不是拍脑袋定的而是从IEEE 802.3bs/802.3cd标准里推出来的。以100G以太网为例原始数据速率是100Gbps经过64b/66b编码后变成约103.125Gbps再加上RS(544,514)前向纠错的额外开销线路速率变成106.25Gbps用PAM4调制后除2就是53.125GBaud。不过等等400G DR4的每通道符号速率是26.5625GBaud为什么不是53.125GBaud因为PAM4每个符号是2比特106.25Gbps / 2 53.125GBaud——这里有个细节IEEE 802.3bs-2017里的400G DR4接口4个通道每个通道是106.25Gbps的比特率但每个通道实际用PAM4调制后符号速率是53.125GBaud不是26.5625GBaud。但是很多资料里写的是26.5625GBaud这是怎么回事这里需要澄清26.5625GBaud对应的是50G以太网的PAM4实现802.3cd即单通道比特率53.125Gbps。而100G单通道PAM4的符号速率是53.125GBaud。之前的文章里如果说“100G PAM4单通道符号速率只要26.56GBaud”其实是记混了——26.56GBaud对应的是50G PAM4。所以准确的表述是从25G NRZ到50G PAM4比特率翻倍但符号速率几乎没涨25.78GBaud vs 26.56GBaud到100G PAM4时符号速率真正涨到了53.125GBaud。不过这个细节不影响核心结论在获得相同比特率的前提下PAM4所需的符号速率只有NRZ的一半。50G NRZ需要50GBaud而50G PAM4只要26.56GBaud100G NRZ需要100GBaud而100G PAM4只要53.13GBaud。3.4 电平数量的物理含义信号“挤”进了更小的电压空间PAM4的四个电平在发射端光功率不变的前提下是均匀分布在峰峰值电压范围内的。假设NRZ的峰值电压是Vpp相邻电平间距为VppPAM4的峰值电压还是Vpp但有四个电平相邻电平间距只有Vpp/3。这就是“挤”的直观含义同样大的电压舞台上原来只有两个人站现在四个人站每个人占据的横向空间从1/2变成了1/6外电平或1/3中间电平。接收机要在这四个电平之间做判决判决的容差范围大大缩小了。这笔账不能只看到好处还要看到代价。下面这一章就是PAM4真正“硬核”的地方。4. 带宽翻倍不是白拿信噪比、误码率、FEC三者如何做交易4.1 9.6dB的理论代价稍微算一下就知道了在接收端一个信号能否被正确判决取决于信号电平间距与噪声幅度的比值。NRZ信号相邻电平间距为V峰峰值PAM4信号在同样的峰峰值下相邻电平间距为V/3。如果接收机的噪声功率不变那么PAM4的信噪比就比NRZ低了[ 20 \times log_{10}(3) ≈ 9.54dB ]这个9.6dB的“税收”是PAM4必须交的——因为电平被切成四份每个判决点的电压间距只有原来的1/3抵抗噪声的能力自然就下降了。在光通信里接收灵敏度的典型预算大概在20dB左右PAM4一上来就先扣掉9.6dB剩下给链路损耗、色散、连接器污染的余量就非常紧了。这就是为什么PAM4光模块里的DSP和FEC不是“可选项”而是“必选项”。对比维度NRZ25GPAM450G说明符号速率25.78GBaud26.56GBaud比特率翻倍符号速率基本不变电平数24每符号比特数从1到2相邻电平间距VV/3抗噪声能力下降理论SNR代价0dB约9.6dB后续需DSPFEC补偿前向纠错FEC可选RS-FEC强制RS 544/514802.3标准要求4.2 DSP如何“把眼睛睁开”PAM4接收机里如果没有DSP数字信号处理器在长距离传输或劣化信道下基本没法工作。DSP在里面做了这几件关键的事均衡Equalization发射端做FFE前馈均衡预加重接收端做CTLE连续时间线性均衡和DFE判决反馈均衡补偿色散和带宽限制带来的码间干扰。时钟恢复CDR从PAM4信号里提取时钟边沿保证采样时刻准确。PAM4信号因为电平多过零点不像NRZ那么“干净”CDR的锁定难度更大。噪声抑制与发射端整形对发射波形做预补偿让接收端的眼图尽量张开。很多人对DSP有个误解以为它是“魔法”能把坏信号变好。实际上DSP能做的只是把确定性的损伤色散、带宽受限、反射补偿掉对随机噪声光放大器ASE噪声、热噪声、散粒噪声是无能为力的。所以PAM4系统的信噪比预算依然要比NRZ紧得多。4.3 KP4 FEC的登场用纠错换灵敏度IEEE针对PAM4链路专门定义了KP4 FEC即RS(544,514)码属于里德-所罗门码家族。它的意思是每544个符号里有514个是有效数据30个是校验符号冗余率约为5.8%。KP4能纠正最多15个错误符号在业界标准下输入误码率pre-FEC BER只要低于2.4×10⁻⁴纠错后就能达到1×10⁻¹⁵以下的极低误码率。这意味着接收机可以接受一个“比较烂”的信号只要误码率还没超过这个阈值FEC就能把它救回来。换句话说FEC大幅度降低了系统对接收灵敏度的要求让PAM4的9.6dB代价不再那么致命。但FEC不是免费的午餐增加了线路速率开销所以你在标准里看到的线路速率都高于纯数据速率。增加了延迟每个光模块里的FEC编解码会引入几十到上百纳秒的时延这对低延迟场景是个隐患。增加了DSP的功耗和芯片面积模块的散热要求跟着提高。4.4 系统设计的视角SNR预算怎么分从系统设计的角度看一个400G DR4模块的PAM4链路预算可以这么粗略估算发射端DSP整形、TOSA电光转换损失一部分SNR。光纤色散和插损在2km以内单模光纤的1310nm窗口色散损失不算大但连接器回损和插损要预留1-2dB。接收端TIA跨阻放大、ROSA光电转换贡献一部分噪声。模组内DSP均衡之后留给FEC判决的pre-FEC BER必须低于2.4×10⁻⁴。每一个环节的余量都很紧这就是为什么PAM4光模块在出厂前必须做严格的眼图测试和BER测试而NRZ时代的模块相对“皮实”得多。5. 模块内部与测试层面的真实工程挑战眼图变成“毛毛虫”之后5.1 光模块内部的样子已经完全不同早期的10G/25G光模块结构非常简单驱动芯片直接调激光器接收端TIA直接出信号几乎没有数字处理的环节。而现在的400G PAM4光模块内部多了一个庞大的DSP芯片它占据模块内部相当大的面积和功耗发热量也大得多。模块内部大致的工作流程是发射路径主机侧的电信号送到DSPDSP完成FEC编码、均衡预加重、数模转换DAC输出PAM4电信号驱动激光器光信号经过光纤传到对端。接收路径光电探测器把光信号转成微弱电流TIA跨阻放大成电压信号ADC采样后进入DSP经过均衡、FEC解码还原成原始数据。这个架构带来的直接后果是功耗上了一个台阶一个400G DR4模块的典型功耗在10-14W左右而100G QSFP28模块只有3.5-5W。如果你的数据中心机柜散热不够好大量部署PAM4模块后设备温度会明显上升风扇转速和噪音也会跟着上去。5.2 测试的眼图从“眼睛”到“毛毛虫”NRZ信号在示波器上的眼图非常直观一个明亮的菱形“眼睛”上下两个电平。PAM4就不一样了四个电平会形成上下叠着的三只“眼睛”如果重叠在一起看就像一条毛茸茸的毛毛虫。行业里引入了TDECQ发射色散眼图闭合四相这个指标来量化PAM4发端信号质量。TDECQ的值越大说明发射信号质量越差眼图闭合越厉害。400G DR4模块的TDECQ规范一般在3.5dB以内优秀的模块能做到2dB以下。这里有个容易踩坑的地方TDECQ看起来只是一个数值但它和测试仪的参考滤波器设置、示波器带宽有很大关系。不同型号的测试仪测量同一只模块TDECQ读数可能差0.5dB以上。所以做模块来料检验或者故障排查时一定要固定测试设备和参数不要交叉混用测试结果。5.3 我调试50G PAM4模块时遇到的真实问题去年我在实验室用50G PAM4光模块做误码率测试第一次遇到“FEC告警但业务没断”的现象时差点被误导。最终排查下来是三个问题的叠加第一个是连接器污染。PAM4比NRZ对连接器端面清洁度敏感得多一个微小的灰尘颗粒就能让光回损变大在TDECQ曲线上表现为低频段隆起。用光纤显微镜检查后发现端面确实有污渍清洁后TDECQ从3.2dB降到2.1dB。第二个是DSP均衡参数的配置问题。PAM4模块的DSP有个自适应均衡的过程在链路刚建立时或者温度突变时均衡器可能需要一段时间重新收敛。如果此时业务侧有抢占式的测试流量进来可能导致收敛过程中误码率短暂上升触发FEC告警。这个问题不是硬件故障但很容易让人误判。第三个是测试仪的表笔和线缆。PAM4的幅度余量本来就不如NRZ即使遵循“测试设备额外3dB带宽余量”的经验法则配线过长或接头次数过多也足以明显压低头部余量。后来我把测试线缆长度从1m缩短到30cm误码清零的速度明显变快。5.4 实际部署中的环境敏感性PAM4模块对链路环境要求之高让很多从NRZ时代过来的运维同事非常不适应。光纤弯曲半径PAM4系统的功率预算紧张弯曲损耗在NRZ时代可能只是让光功率掉个零点几dB到了PAM4可能就是误码告警。连接器插拔次数多次插拔会磨损端面导致IL插入损耗和RL回波损耗劣化。NRZ系统往往还能容忍PAM4系统就可能触到FEC纠错上限。温度漂移激光器波长随温度漂移在WDM系统里如果波长漂出通道带宽信号受损的概率远高于NRZ。所以我一直建议做PAM4光模块部署时至少做三件事链路光功率测试、连接器端面显微镜检查、以及模块实测的pre-FEC BER基线记录。别嫌麻烦这顶得上你事后排查三天问题。6. 为什么不停在PAM4PAM8和相干方案的边界与选择6.1 为什么不搞PAM8“多挤一倍”看到PAM4能在一个符号里塞2比特你可能自然会问那PAM88个电平不就能塞3比特了吗再来一次“带宽翻倍”不香吗想法没错但物理规律不允许。PAM8在相同峰峰值电压下相邻电平间距是V/7相比NRZ的V来说理论信噪比代价是20×log₁₀(7)≈16.9dB。这比PAM4的9.6dB多了7.3dB。在光通信链路的实际链路预算里这个代价几乎不可能靠DSP和FEC补回来。你可以调大功率硬怼但高功率会带来非线性效应同时功耗、散热、安全规范全都跟着亮红灯。还有一个工程层面的现实PAM4已经有相对成熟的DSP和标准生态而PAM8的非线性补偿、高精度ADC模数转换器、时钟恢复复杂度都还停留在实验室阶段工业量产的成本高得离谱。简单说PAM4是当前技术约束下“调制效率”与“信噪比代价”的平衡点。再往上加电平收益的速度赶不上信噪比恶化的速度性价比直接崩盘。6.2 相干方案另一个维度的“翻倍”数据中心内部用PAM4解决短距500m-2km的带宽问题而长距离的DCI数据中心互联场景走的是另一条路线相干光通信。相干方案用光载波的振幅、相位、偏振多个维度携带信息搭配数字信号处理可以做极高阶的调制。比如400G ZR相干光模块通过DP-16QAM调制单波长能跑400G甚至更多。但相干方案代价也很明显需要本振激光器、90度混频器、高速ADC/DAC、复杂DSP模块成本是PAM4的几倍功耗也高得多。在数据中心机柜内部这种距离短、成本敏感、功耗预算紧张的环境里用相干方案纯粹是杀鸡用牛刀。所以当前行业的分工很清晰机柜内和机柜间短距互联用PAM4跨数据中心的长距互联用相干。两条技术路线各管各的边界。6.3 单波长200GPAM4这条路的未来走向PAM4这条路并没有走到尽头。800G时代已经有厂商演示单波长200G PAM4技术相当于把符号速率推到106.25GBaud左右。这时候用到的光电器件带宽要求已经非常高光模块内部开始集成更先进的驱动器、更高速的DSP同时用上薄膜铌酸锂调制器等新材料。从趋势上看单波200G之后PAM4的物理上限会越来越明显行业可能转而引入更先进的调制方式或者通过多芯光纤、空分复用等技术继续挖掘容量。但对于绝大多数读者来说当下和未来几年需要面对的仍然是以PAM4为核心的100G/400G/800G光模块生态。7. 给正在部署PAM4系统的你几点实操建议前面把原理和工程挑战铺开了最后结合我自己调试和部署PAM4模块的经验分享几条最实在的建议。第一部署前一定要做pre-FEC BER基线测试。很多人只是看光功率和收发光正常就觉得链路没问题但PAM4系统真正要监控的是DSP上报的pre-FEC BER。安装完模块后记录下每个端口的pre-FEC BER正常应该在1×10⁻⁶以下。如果某个端口pre-FEC BER在1×10⁻⁵以上即使当前没有误码告警也说明链路余量已经很低天气热点或者连接器再脏一点就可能出问题。第二PAM4模块对电源质量更敏感。由于模块功耗大幅上升电源纹波对DSP和激光器驱动的影响会被放大。我遇到过一次某批次模块频繁误码排查到最后是交换机端口供电的电源模块老化输出电压纹波偏大。所以批量部署PAM4模块时建议用功率分析仪看一下输入电源的纹波尤其在老设备上升级光模块的场景。第三FEC告警不等于模块坏了。PAM4链路的FEC本来就是设计用来“吃错误”的偶尔出现几个可纠正的错误符号FEC告警会短暂闪烁这不一定代表硬件故障。但如果FEC错误数持续增长、或者pre-FEC BER趋势一路走高那就要认真查链路了。我习惯给FEC告警配上主动通知而不是等用户报障。第四测试测试设备再测模块。PAM4的测试对设备和线缆本身的要求极高如果你用示波器和误码仪测一只新模块测出来结果不好先在相同条件下测一只参考模块对比一下。排除测试设备自身的问题再去找模块的麻烦。这条经验帮我避免过好几次“被模块坑了”的误判。最后PAM4本质上是一个系统级的工程不是单换一个模块就能跑好的。链路里每一处连接器、每一段光纤、每一分功耗都在吃掉原本就不宽裕的信噪比预算。理解了NRZ到PAM4背后的物理权衡再看那些“为什么换了个新模块还是不达标”的问题思路会清晰很多。
返回列表