【论文解读】系数能量引导的快速变换算法:Beyond VVC 编码器优化新思路

【论文解读】系数能量引导的快速变换算法:Beyond VVC 编码器优化新思路
论文Coefficients Energy Guided Fast Transform Algorithm in Beyond VVC作者Minzhe Chen, Yiming Wang, Junyan Huo, Fuzheng Yang西安电子科技大学发表会议IEEE Data Compression Conference (DCC) 2026实验平台ECM 17.0一、引言为什么 Beyond VVC 需要快速变换算法H.266/VVCVersatile Video Coding作为最新一代国际视频编码标准于 2020 年正式定稿相比上一代 HEVC 可节省约 50% 的码率。然而这种压缩效率的大幅提升是以编码复杂度的急剧增长为代价的——VVC 编码器的计算复杂度约为 HEVC 的 10 倍以上。在 VVC 标准定稿之后JVET联合视频专家组并未停下脚步而是启动了Beyond VVC探索计划以ECMEnhanced Compression Model作为软件参考平台持续探索下一代视频编码技术。ECM 在 VVC 基础上引入了更多编码工具和更精细的决策机制使得编码复杂度进一步攀升至极高水平。在众多编码模块中变换编码是消除空间冗余和残差相关性的核心环节。VVC 在变换模块中引入了多项创新——多变换选择MTS、低频不可分离变换LFNST、子块变换SBT等——这些技术在提升压缩效率的同时也带来了显著的计算开销。在 Beyond VVC/ECM 中不可分离变换Non-Separable Transform, NST作为 LFNST 的扩展形式其变换核选择过程尤为耗时编码器需要对每个预测模式的变换集中的多个候选变换核逐一进行完整的率失真优化RDO计算。本文解读的论文正是瞄准这一痛点提出了一种基于系数能量引导的快速变换核选择框架通过自适应重排序和三层快速剪枝策略在不损失编码效率的前提下显著降低 NST 变换核选择的计算复杂度。二、VVC 变换编码技术背景2.1 变换编码的基本原理变换编码是现代视频压缩中消除空间冗余的关键步骤。在混合编码框架中其位于预测之后、量化之前原始像素 → 预测帧内/帧间 → 残差 → 变换 → 量化 → 熵编码 → 码流变换的核心目标有两个能量集中Energy Compaction将空间域中分散的能量集中到少数低频系数上使大部分高频系数量化后趋于零。去相关性Decorrelation消除残差块中相邻像素间的统计相关性使变换后的系数更加独立便于熵编码。离散余弦变换DCT因其良好的能量集中特性、可分离性和快速算法自 JPEG、H.261 以来一直是视频编码的核心变换。VVC 在此基础上进行了重大扩展。2.2 VVC 变换编码的核心工具多变换选择MTSVVC 在传统的 DCT-II 之外引入了 DST-VII 和 DCT-VIII 两种新变换核共 5 种变换组合水平方向垂直方向适用场景DCT-IIDCT-II默认变换平滑区域DST-VIIDST-VII帧内预测残差边缘区域DST-VIIDCT-VIII混合方向纹理DCT-VIIIDST-VII混合方向纹理DCT-VIIIDCT-VIII纹理丰富区域不同的残差分布特性对应不同的最优变换核。编码器通过 RDO 遍历候选变换核选择率失真代价最小的组合。MTS 仅对亮度分量生效且在 SPS 和 CU 级别均可控制开关。低频不可分离变换LFNSTLFNST 是 VVC 引入的一种二次变换技术在主变换Primary Transform如 DCT-II之后、量化之前对低频系数进行进一步处理残差 → 主变换(DCT-II/MTS) → LFNST(仅低频) → 量化 → 熵编码LFNST 的核心思想帧内预测的残差经过主变换后部分低频系数仍可能保留预测方向的信息LFNST 通过不可分离变换进一步去除这种低频冗余。不可分离变换意味着将二维系数块展平为一维向量后进行矩阵乘法而非分别在行、列方向进行一维变换。这虽然计算复杂度更高但能捕捉二维空间中的全部相关性。为控制复杂度VVC 中的 LFNST 采用缩减的不可分离变换RST将 N 维向量映射到 R 维空间R N缩减因子为 N/R。LFNST 仅处理 4x4 或 8x8 的低频区域支持两种变换尺寸由 TU 大小隐式决定。每个预测模式对应一个包含多个候选变换核的变换集Transform Set编码器需要通过 RDO 从中选择最优变换核。大尺寸变换高频置零VVC 支持最大 64x64 的变换块。对于宽或高为 64 的变换块仅保留左上角 32x32 的低频系数高频部分直接置零。这一技术在 DST-VII 和 DCT-VIII 中扩展为保留 16x16 的低频区域有效降低大尺寸变换的计算复杂度。2.3 从 VVC 到 Beyond VVCECM 中的变换编码ECM 作为 Beyond VVC 的探索平台在 VVC 变换编码基础上进一步扩展NST 扩展不可分离变换NST在 ECM 中作为 LFNST 的增强形式每个预测模式的变换集包含 3 个候选变换核编码器需要逐一评估。更多预测模式ECM 增加了帧内预测方向和模式数量进一步增加了变换核选择的候选空间。更精细的 RDOECM 在更多决策点上引入了率失真优化导致编码器复杂度急剧增加。在 ECM 17.0 中NST 变换核选择的流程可以概括为对于每个 CU 对于每个候选预测模式 对于该模式变换集中的 3 个 NST 变换核 1. 执行主变换得到一次变换系数 2. 执行 NST 得到二次变换系数 3. 执行量化 4. 执行反量化 反变换得到重建残差 5. 计算失真D 6. 估计码率R 7. 计算 RD 代价 D λ·R 选择 RD 代价最小的变换核对于每个 CU上述流程需要重复执行多次3 个变换核 x 多个预测模式每次都涉及完整的变换-量化-熵编码计算。这正是论文要解决的核心问题如何在不遍历所有变换核的情况下快速找到最优或近似最优的 NST 变换核三、核心思想用系数能量替代完整 RDO3.1 关键洞察CoefAbsSum 与 RD 性能的相关性论文的核心洞察在于变换的根本目标是能量集中而前向变换系数的绝对值之和CoefAbsSum可以直接反映变换核的能量集中能力。具体来说CoefAbsSum∑i∣Ci∣\text{CoefAbsSum} \sum_{i} |C_i|CoefAbsSumi∑​∣Ci​∣其中CiC_iCi​是前向变换后的第iii个变换系数。CoefAbsSum 越小意味着变换后能量越集中——大部分系数趋近于零仅有少数系数承载了主要的信号能量。这与率失优化的目标高度一致能量越集中量化后非零系数越少编码所需比特数越低RD 代价越小。这一洞察的关键优势在于计算 CoefAbsSum 只需要前向变换一步无需量化、反变换、熵编码和完整 RD 代价计算。前向变换本身就是变换核选择流程的第一步因此 CoefAbsSum 可以免费获取作为变换核好坏的快速预判指标。3.2 从遍历全部到智能跳过传统方法对每个变换核都执行完整的 RDO 流程计算量巨大。论文的思路是先排序用 CoefAbsSum 对 3 个变换核排序优先处理潜力最大的。再剪枝对排序后的变换核用三种策略逐步剪枝跳过明显不佳的候选。这样在很多情况下编码器只需完整评估 1-2 个变换核甚至 0 个而非全部 3 个从而节省计算时间。四、技术方案详解论文提出的框架包含两大技术模块自适应重排序策略和三层快速剪枝算法。4.1 自适应重排序策略问题描述在 ECM 中每个帧内预测模式的 NST 变换集包含 3 个候选变换核。传统方法按固定顺序依次评估这 3 个变换核没有考虑它们之间的相对优劣。解决方案论文提出根据 CoefAbsSum 对 3 个变换核进行自适应排序对于当前预测模式的变换集 {K1, K2, K3} 对每个变换核 Ki 执行前向变换计算 CoefAbsSum_i 按 CoefAbsSum 从小到大排序得到排序后的变换核序列 {K(1), K(2), K(3)} 其中 CoefAbsSum(1) ≤ CoefAbsSum(2) ≤ CoefAbsSum(3)排序后CoefAbsSum 最小潜力最大的变换核排在最前面编码器优先对其进行完整 RDO 评估。这一重排带来两个好处提高早期终止概率如果第一个评估的变换核 RD 性能就很好后续变换核更容易被剪枝跳过。为后续剪枝提供基准排序靠前的变换核的 RD 代价可作为后续变换核的阈值参考。计算开销分析计算 CoefAbsSum 的额外开销极小——前向变换本就是 RDO 流程的第一步排序仅需在已计算的变换系数上求绝对值之和。对于 3 个变换核排序的时间复杂度为 O(3N)N 为系数个数相对于完整 RDO 的计算量可以忽略不计。4.2 三层快速剪枝算法在重排序基础上论文设计了三个递进式的快速剪枝策略依次应用于排序后的变换核序列。策略一调整的 RD 代价阈值剪枝核心思想利用已评估变换核的 RD 代价作为阈值快速跳过后续表现不佳的变换核。对排序后的变换核 {K(1), K(2), K(3)} 评估 K(1) 的完整 RD 代价 → 得到 best_cost 对于 K(2) 如果 best_cost 已经足够低低于调整阈值 跳过 K(2) 和 K(3) 的完整评估 否则 评估 K(2) 的完整 RD 代价 如果 K(2) 的 RD 代价 best_cost 更新 best_cost 对于 K(3) 如果 best_cost 低于更严格的阈值 跳过 K(3) 的完整评估 否则 评估 K(3)这里的调整阈值是论文的关键设计对于排序靠后的变换核CoefAbsSum 更大使用更严格的 RD 代价阈值。这是因为 CoefAbsSum 更大意味着变换核的潜力更低除非其 RD 代价显著优于当前最优否则不值得完整评估。阈值调整公式根据论文思路推断Thresholdibest_cost×(1αi)\text{Threshold}_i \text{best\_cost} \times (1 \alpha_i)Thresholdi​best_cost×(1αi​)其中αi\alpha_iαi​随变换核排序位置iii的增大而减小即阈值更严格αi0\alpha_i 0αi​0是可调参数。当排序靠后的变换核 RD 代价超过该阈值时直接跳过。策略二基于 CoefAbsSum 的预筛选核心思想在执行完整 RDO 之前直接用 CoefAbsSum 值判断是否值得进一步评估。对于变换核 K(i) 如果 CoefAbsSum(i) threshold_coef 直接跳过该变换核的完整 RDO 评估这里threshold_coef可以是一个绝对阈值也可以是相对于 CoefAbsSum(1) 的比例阈值。例如如果CoefAbsSumiCoefAbsSum(1)×β则跳过\text{如果} \quad \text{CoefAbsSum}_i \text{CoefAbsSum}_{(1)} \times \beta \quad \text{则跳过}如果CoefAbsSumi​CoefAbsSum(1)​×β则跳过其中β1\beta 1β1是比例因子。这一策略直接利用了CoefAbsSum 越小变换越好的原理——如果某个变换核的 CoefAbsSum 远大于最优变换核其 RD 性能几乎不可能更优可以安全跳过。策略三历史 RD 性能比较核心思想利用编码过程中积累的历史信息跳过在相似条件下表现持续不佳的变换核。维护历史统计表 对每个预测模式 → 每个 NST 变换核 → 历史选择频率/平均 RD 代价 对于当前 CU 的预测模式 m 和变换核 K(i) 如果 K(i) 在模式 m 的历史选择频率极低或历史平均 RD 代价极高 跳过 K(i) 的完整 RDO 评估这一策略的合理性在于相似内容和预测模式下最优变换核的选择具有一定的时序一致性。如果某个变换核在大量历史编码中几乎从未被选中那么在当前 CU 中它被选中的概率也很低。三个策略的关系是递进式的——先通过 CoefAbsSum 预筛排除明显不佳的候选再用历史统计进一步过滤最后对剩余候选使用 RD 代价阈值剪枝。这样只有极少数变换核需要经过完整的 RDO 评估。4.3 整体算法流程将以上各部分整合完整的快速变换核选择算法流程如下输入当前 CU、预测模式 m、变换集 T_m {K1, K2, K3} 输出最优变换核 K* 及其 RD 代价 步骤 1计算 CoefAbsSum 对每个 Ki ∈ T_m 执行前向主变换 NST 计算 CoefAbsSum_i 步骤 2自适应重排序 按 CoefAbsSum 升序排列得到 {K(1), K(2), K(3)} 步骤 3CoefAbsSum 预筛选策略二 对 K(2), K(3) 如果 CoefAbsSum(i) / CoefAbsSum(1) β 标记为预筛跳过 步骤 4历史性能筛选策略三 对未被预筛跳过的 K(i) 查询历史统计 如果历史选择频率 f_min 标记为历史跳过 步骤 5完整 RDO 评估 RD 代价阈值剪枝策略一 best_cost ∞ 对 K(1), K(2), K(3)跳过已标记的 如果 best_cost threshold_i 跳过 否则 执行完整 RDO → 得到 RD_cost 如果 RD_cost best_cost best_cost RD_cost, K* K(i) 步骤 6更新历史统计 更新模式 m 下 K* 的历史选择频率五、实验结果分析5.1 实验设置平台ECM 17.0Beyond VVC 探索模型测试配置All-IntraAI、Random-AccessRA、Low-DelayLD测试序列JVET 通用测试条件CTC标准序列集评估指标BD-rate编码效率变化、编码时间比ETR, Encoding Time Ratio5.2 主要结果指标数值含义编码时间比ETR98.7%编码时间减少1.3%Y 分量 BD-rate0.00%亮度编码效率零损失Cb 分量 BD-rate0.03%色度编码效率几乎无损Cr 分量 BD-rate0.01%色度编码效率几乎无损结果解读编码效率方面Y 分量 BD-rate 为 0.00%意味着该算法在亮度分量上完全没有引入编码效率损失。Cb 和 Cr 分量分别仅有 0.03% 和 0.01% 的微小变化在实际应用中可以忽略不计。这证明了该框架是一种近乎无损的编码加速方法。编码时间方面1.3% 的时间节省看似不大但需要结合 Beyond VVC/ECM 的背景来理解。ECM 17.0 是一个具有极高编码复杂度的探索平台其中 NST 变换核选择只是众多耗时模块之一。在如此庞大的编码器中仅通过优化变换核选择就实现 1.3% 的整体时间节省说明该模块在编码器中占有可观的计算比重。更重要的是这 1.3% 的时间节省是在几乎零编码损失的前提下实现的——传统的编码加速方法通常会以牺牲编码效率为代价如 BD-rate 增加 0.5%-2%而本文方法在效率和时间两方面都取得了优异表现。5.3 结果的深层意义与 VVC 快速算法的对比在 VVCVTM平台上类似 LFNST 快速选择算法通常能实现更大的时间节省5%-15%。这并非本文方法效果不佳而是因为 ECM 相比 VTM 引入了更多编码工具和更复杂的决策流程NST 变换核选择在整体编码时间中的占比相对下降。1.3% 的整体时间节省换算到 NST 模块本身实际上代表了更大幅度的模块级加速。近零损失的实现难度在 Beyond VVC 这样复杂的编码框架中保持 0.00% 的 Y 分量 BD-rate 并非易事。任何剪枝策略都有误剪风险——即跳过了实际上最优的变换核。本文通过 CoefAbsSum 这一高度可靠的预判指标结合三层渐进式剪枝有效控制了误剪率实现了近零损失。六、技术亮点与创新分析6.1 CoefAbsSum从变换本质出发的快速指标论文最大的创新在于选取了 CoefAbsSum 作为变换核评估的快速指标。这一选择并非随意理论根基扎实变换的核心目标是能量集中CoefAbsSum 直接度量了能量集中程度。计算几乎免费前向变换是 RDO 流程的必经步骤CoefAbsSum 只需在已有结果上求和。与 RD 性能高度相关能量越集中量化后非零系数越少码率越低RD 代价越小。无需训练不像基于机器学习的方法需要大量训练数据和模型推理CoefAbsSum 是纯数学计算适用于任何视频内容。6.2 自适应重排序化被动为主动传统编码器对变换核的评估顺序是固定的重排序策略将被动遍历变为主动优先优先评估潜力最大的变换核使后续剪枝更有效。排序本身开销极小但为后续剪枝策略提供了高质量的基准。这种先排序、再剪枝的思路具有通用性可推广到其他编码决策场景。6.3 三层渐进式剪枝多维度信息融合三个剪枝策略分别利用了不同维度的信息策略利用的信息判断维度计算开销CoefAbsSum 预筛选当前 CU 的变换系数变换能量极低求和历史性能比较历史编码统计时序一致性极低查表RD 代价阈值当前 CU 的 RD 代价率失真性能中等需部分 RDO三个策略从粗到细、从免费到有代价形成了高效的漏斗式过滤——大部分变换核在低开销阶段就被跳过只有少数需要经过完整 RDO 评估。七、在 Beyond VVC 标准演进中的定位与意义7.1 Beyond VVC 的复杂度挑战Beyond VVC/ECM 的设计哲学是不计复杂度地追求压缩效率——通过引入更多编码工具、更精细的决策机制来探索压缩性能的上限。这使得 ECM 的编码复杂度远超 VVC在实际部署中面临严峻挑战。论文开篇即指出“Beyond VVC 是一个具有极高编码复杂度的探索平台”。这意味着如果在 ECM 中引入的新技术不能有效控制复杂度它们在下一代标准中落地的可能性就会降低。7.2 快速算法对标准化的价值在视频编码标准的制定过程中编码工具的压缩效率和计算复杂度是两个核心评估维度。一个编码工具即使能带来显著的码率节省如果其复杂度过高也可能在标准化讨论中被否决或简化。本文提出的快速变换框架为 Beyond VVC 中 NST 技术的实用化提供了重要支撑降低部署门槛1.3% 的整体编码时间减少使得 ECM 在实际测试和评估中更加可行。保持编码效率近零的 BD-rate 变化证明该优化不会影响编码性能评估的准确性。框架通用性CoefAbsSum 引导的快速选择思路不仅适用于 NST也可推广到 MTS、预测模式选择等其他编码决策中。7.3 对未来研究的启发本文的工作为 Beyond VVC 快速编码研究提供了几个有价值的方向能量准则的推广CoefAbsSum 的成功表明基于变换系数统计特性的快速指标具有很大潜力。未来可以探索更多此类指标如系数方差、熵、稀疏度等在快速编码中的应用。历史信息的利用历史 RD 性能比较策略展示了时序信息在编码优化中的价值。在视频编码中相邻帧和相邻块之间的高度相关性使得历史信息具有很高的参考价值。渐进式剪枝范式三层递进式剪枝的框架设计——从免费指标到低开销查表再到部分 RDO——是一种通用的快速决策范式可以应用于编码器中其他多候选选择场景。与 AI 技术的结合论文的 CoefAbsSum 是一种基于信号特性的传统方法。在 Beyond VVC 中JVET 也在探索神经网络编码NNVC和 ECM 的混合方案。将传统快速指标与轻量级神经网络预测相结合可能进一步提升剪枝的准确性。八、总结本文解读的论文针对 Beyond VVC/ECM 中 NST 变换核选择的计算复杂度问题提出了一种基于系数能量引导的快速变换算法。该算法的核心贡献可以概括为一个关键指标CoefAbsSum——前向变换系数绝对值之和作为变换核好坏的快速预判指标理论基础扎实、计算开销极低、与 RD 性能高度相关。一项排序策略自适应重排序——将固定顺序遍历变为潜力优先评估为后续剪枝创造有利条件。三层剪枝机制CoefAbsSum 预筛选、历史 RD 性能比较、调整的 RD 代价阈值剪枝——从粗到细的漏斗式过滤最大化跳过率的同时最小化误剪风险。实验结果表明该框架在 ECM 17.0 上实现了 1.3% 的整体编码时间节省同时 Y 分量 BD-rate 为 0.00%、Cb 和 Cr 分量仅分别变化 0.03% 和 0.01%证明了其近乎无损的特性。在 Beyond VVC 探索阶段编码复杂度的控制是新技术走向标准化的关键瓶颈之一。本文的工作不仅为 NST 的快速实现提供了有效方案其系数能量引导 渐进式剪枝的技术思路也为更广泛的 Beyond VVC 快速编码研究提供了有价值的参考。参考文献[1] Minzhe Chen, Yiming Wang, Junyan Huo, Fuzheng Yang. “Coefficients Energy Guided Fast Transform Algorithm in Beyond VVC.” IEEE DCC 2026.[2] B. Bross et al., “An Overview of the Versatile Video Coding (VVC) Standard,” IEEE TCSVT, 2021.[3] “Analysis of the Transform Coding Module in the Post-VVC Standard,” IEEE, 2024.[4] JVET, “Algorithm Description for Enhanced Compression Model (ECM),” JVET-Y0022.