
1. 从“慢工出细活”到“一步到位”扩散模型采样加速的痛点与机遇如果你玩过Stable Diffusion这类AI绘画工具或者关注过DALL-E、Midjourney的生成过程大概率会对那个“等待进度条”的环节印象深刻。从一片模糊的噪声开始模型需要迭代几十步甚至上百步才能“雕琢”出一张清晰的图像。这个“雕琢”的过程就是扩散模型的采样Sampling。它本质上是求解一个反向的随机微分方程每一步都试图从当前噪声更接近真实数据分布。这个过程计算密集、耗时漫长是阻碍扩散模型实时应用的最大瓶颈。尤其是在视频生成、3D内容创建、实时交互设计等场景下对采样速度的要求近乎苛刻。传统的加速思路大致可以分为两类。一类是“训练时优化”比如设计更高效的采样器如DDIM、DPM-Solver它们通过更聪明的数学近似用更少的步数达到相近的质量。另一类是“推理时蒸馏”训练一个更小的学生网络去模仿大模型多步采样的行为。然而前者往往在步数减少到一定程度后遭遇质量悬崖后者则需要额外的、成本不菲的蒸馏训练。有没有一种方法能在不重新训练模型、不依赖复杂数学推导的前提下实现更高效的采样这正是CVPR 2026这篇关于“几何感知扩散Transformer采样加速”的工作试图回答的问题。它没有去改动模型本身而是像一个经验丰富的“导航员”在模型执行采样这个既定路线的过程中动态地调整“步伐”识别出哪些步骤可以“大踏步前进”哪些需要“精雕细琢”。其核心洞察非常直观在扩散采样的漫长旅途中并非每一步都同等重要。早期的步骤图像还是一片混沌模型主要在捕捉全局结构和轮廓后期的步骤图像细节逐渐浮现模型在进行局部的微调和精修。如果我们能感知到当前生成状态所处的“几何阶段”就能动态地分配计算资源。这篇工作将这种感知能力与当前如日中天的Diffusion TransformerDiT架构相结合提出了一种免训练的采样加速器。这里的“几何感知”并非指三维空间的几何而是指数据在高维特征空间中的流形几何结构。理解数据在这个抽象空间中的“地形”是决定采样步长和方向的关键。2. 拆解核心何为“几何感知”与Diffusion Transformer的采样瓶颈要理解这项工作的精妙之处我们需要先拆解两个核心概念“几何感知”在扩散模型上下文中的具体含义以及为什么标准的Diffusion Transformer采样过程存在可以被优化的“冗余”。2.1 扩散过程的数据流形与“几何”直觉想象一下所有可能的猫的图片构成一个高维空间中的复杂曲面流形。一张清晰的猫图位于这个曲面上。扩散模型的正向过程是不断地向这张猫图添加噪声让它逐渐偏离这个曲面最终变成一片纯粹的高斯噪声可以想象成把这个点从曲面上“吹”到了广阔无垠的噪声空间中。反向采样过程则是从这片噪声中一步步找回这个曲面并最终落在曲面上那个代表猫图的位置。这个“曲面”的弯曲程度在不同区域是不同的。在靠近清晰数据曲面本身的地方曲面可能非常“陡峭”或“复杂”微小的移动就会导致图像语义的剧变比如从猫变成狗。而在远离曲面的噪声区域空间可能相对“平坦”朝着曲面方向移动一大步图像内容也不会发生本质改变只是变得更不随机了一些。“几何感知”的目标就是实时估计当前采样点所处位置的“地形平坦度”。如果地形平坦说明我们可以安全地采用更大的步长跳过一些中间计算快速向数据流形靠近如果地形陡峭我们就必须用小步长谨慎前进以免“滑倒”或“走错路”。在数学上这种“地形”的度量往往与数据分布的概率密度函数的梯度即得分函数score function的局部变化率有关或者说与Fisher信息矩阵等二阶统计量相关。传统方法精确计算这些量极其昂贵。而这篇工作的巧妙之处在于它利用DiT模型内部的前向传播过程中自然产生的中间特征来间接地、低成本地感知这种几何特性。2.2 Diffusion Transformer的标准采样与计算冗余Diffusion Transformer是当前扩散模型的主流架构它用Transformer块替代了传统的U-Net中的CNN层在处理大规模数据和捕捉长程依赖上表现出色。其标准采样流程是一个串行过程输入当前时间步t的带噪图像x_t和时间步嵌入。经过多个DiT块每个块包含自注意力层、MLP层等进行特征变换。输出对噪声的预测用于计算下一步的图像x_{t-1}。重复步骤1-3直到t0。这里的计算冗余主要体现在两个方面时间维度上的冗余和空间维度上的冗余。时间冗余正如前文所述在采样轨迹的不同阶段模型对输入的“敏感度”不同。在噪声较多的早期阶段连续几步的更新方向可能高度一致。连续计算多个小步等效于计算了一个大步但后者计算量更小。标准采样器没有利用这种一致性每一步都“重新计算”。空间冗余在一张图像内部不同区域在同一个采样步的“进化速度”也不同。例如在生成一幅风景画时天空部分可能很快趋于平滑而树叶的细节则需要更多步来细化。标准的DiT对图像所有patch进行全局均匀计算没有对已趋“稳定”的区域减少关注。现有的免训练加速方法如“跳过某些层”或“提前退出”大多基于简单的启发式规则如固定间隔跳过缺乏对当前生成状态的适应性。而“几何感知”正是为了动态地、自适应地识别并利用上述两种冗余。3. 方法深潜如何实现动态的、免训练的采样加速这篇工作的核心框架是一个轻量级的、并行的“几何评估器”与一个“自适应调度器”它们像插件一样嵌入到标准的DiT采样循环中不改变主模型参数实现免训练加速。3.1 几何评估器从中间特征提取“平坦度”信号评估器的设计遵循高效和低开销的原则。它不引入额外的可学习参数而是利用DiT主干网络在前向传播中已经计算出的中间特征图。具体来说在每一个采样时间步t当带噪图像x_t通过第l个DiT块时我们会提取该块输出的特征图F_t^l。这个特征图包含了当前图像在某个抽象层次上的表示。评估器计算该特征图在空间维度上的统计量变化率。一个关键的操作是对比当前步特征F_t^l与缓存中前一步t1对应层的特征F_{t1}^l之间的差异。他们提出了一个简洁而有效的几何感知指标——特征波动率Feature VolatilityV_t^l ||Norm(F_t^l) - Norm(F_{t1}^l)||_F / (ε Std(F_t^l))其中Norm表示层归一化||·||_F是Frobenius范数Std是空间维度上的标准差ε是一个防止除零的小常数。这个指标的意义在于分子||Norm(F_t^l) - Norm(F_{t1}^l)||_F度量了特征从t1步到t步的变化幅度。变化小说明该层特征在连续时间步间稳定可能处于“平坦”区域。分母Std(F_t^l)度量了当前特征图自身的活跃度。如果特征图本身非常均匀标准差小即使绝对变化不大其相对变化也可能很显著。因此V_t^l值较低表明在该层特征视角下数据流形相对平坦采样过程可以更“激进”值较高则提示地形复杂需谨慎。注意这里选择Frobenius范数和标准差是为了获得一个全局的、标量的度量便于后续调度。实验表明这种基于特征差异的简单度量与更复杂的基于梯度范数或Hessian特征值的度量高度相关但计算成本低数个数量级。3.2 自适应调度器将感知转化为加速动作调度器接收来自不同层l的几何感知指标{V_t^l}并做出两个层面的决策1. 时间步调度何时跳步这是针对时间冗余的优化。调度器维护一个“可信度累积器”。在每一步它根据当前层的V_t^l计算一个“步长推荐因子”。如果多个连续步骤的推荐因子都表明地形平坦累积器值增加。当累积器超过一个阈值时调度器就触发一次“跳步”操作即不执行下一个时间步t-1的完整计算而是基于当前状态x_t和模型预测直接估算x_{t-2}或更远的目标。这本质上是一种自适应步长的多步外推。其算法逻辑如下初始化可信度 C 0 对于采样步 t T to 1: 计算当前步的几何指标 V_t 计算推荐因子 α_t sigmoid(β * (τ - V_t)) # β是缩放因子τ是基准阈值 C C α_t 如果 C Threshold_skip: 执行跳步更新x_{t-k} Update_with_larger_step(x_t, model) C max(0, C - Penalty) # 执行跳步后重置部分可信度避免连续激进 t t - k # 更新时间步 否则 执行标准单步更新x_{t-1} Update_standard(x_t, model) C max(0, C - Decay) # 正常步进可信度缓慢衰减这个过程使得模型在平坦区域“加速跑”在复杂区域“慢慢走”。2. 空间粒度调度何处简算这是针对空间冗余的优化。对于图像中不同的patch它们的“进化”速度不同。调度器利用特征图F_t^l的空间方差图识别出哪些空间位置的特征已经高度一致例如大块的纯色背景。对于这些“稳定区域”在后续的DiT块计算中可以采用近似计算。一种实现的策略是动态令牌剪枝Dynamic Token Pruning。在自注意力层之前根据每个patch对应特征向量的变化率可通过与上一步该patch特征的余弦相似度衡量对变化率低于阈值的patch将其在注意力计算中的价值Value向量用其均值替代或者直接跳过其对于其他patch的注意力贡献计算。这显著降低了注意力矩阵的计算复杂度从 O(N^2) 向 O(NM) 降低M是活跃patch数。另一种更轻量的策略是自适应计算深度Adaptive Computation Depth。对于被判定为“稳定”的patch序列在后续的Transformer块中可以绕过一部分MLP层或使用更窄的中间维度进行计算类似于针对不同输入难度的条件计算。3.3 整体工作流程与开销分析将评估器和调度器嵌入标准DiT采样循环流程变为开始采样初始化缓存存储上一步特征。对于当前时间步t输入x_t到DiT。在前向传播过程中于指定层如每隔2-3层截取特征与缓存中的旧特征计算几何感知指标V_t^l。所有层的指标汇总到调度器。调度器决策若触发时间跳步则计算跳步更新更新图像和缓存并跳过后续若干步的循环。若不跳步则在当前步的剩余DiT块计算中根据空间调度决策对稳定区域进行简化计算。更新缓存当前特征存入进入下一个时间步或跳过后的时间步。开销分析几何评估器的计算主要是特征减法和范数计算相比DiT巨大的矩阵乘法和注意力计算开销几乎可以忽略论文中报告1%的额外开销。调度逻辑是简单的标量比较和条件判断开销极低。因此整个加速框架的额外开销控制得非常好主要的收益来自于节省掉的完整DiT前向传播次数时间跳步和简化计算空间调度。4. 实验验证效果、效率与泛化性任何加速方法的有效性都需要在速度-质量的权衡曲线上进行严格检验。这篇工作进行了大量实验其设置和结论对我们理解其能力边界至关重要。4.1 实验设置与基线对比他们在标准的图像生成基准上进行了测试包括ImageNet 256x256和512x512分辨率下的无条件生成和条件生成基于类别。使用的DiT主干是公开的预训练模型如DiT-XL/2。对比的基线非常全面标准采样器DDPM1000步、DDIM50步、250步、DPM-Solver20步、40步。免训练加速方法包括固定步长跳过的Naive Skip、基于注意力熵提前退出的方法等。训练时加速方法知识蒸馏得到的快速采样模型作为性能上限参考。评估指标采用生成质量FIDFréchet Inception Distance、sFID空间FID、ISInception Score。FID是核心指标越低越好。生成速度采样步数Steps、实际 wall-clock 时间Time、吞吐量Images/sec。计算量FLOPs浮点运算次数。4.2 核心结果质量与速度的卓越权衡实验结果清晰地展示了“几何感知”方法的优势。下表概括了在ImageNet 256x256上使用DiT-XL/2模型的关键数据方法采样步数FID (↓)相对耗时关键观察DDPM (基准)10003.6100%质量最优但极慢DDIM2504.125%质量接近速度提升DPM-Solver403.910%优秀的速度-质量平衡Naive Skip (每2步跳1步)~5005.8~50%质量下降明显几何感知加速 (本文)~150 (自适应)3.8~15%质量媲美DPM-Solver速度更快从数据可以看出质量保持在将采样步数从250DDIM大幅减少到平均150步左右的情况下本文方法将FID从4.1优化到了3.8甚至略微优于40步的DPM-Solver3.9。这说明其自适应跳步策略有效地避免了在关键复杂区域的跳跃保住了生成质量。速度优势相比需要40步的DPM-Solver本文方法平均步数更少且由于引入了空间粒度调度每一步的实际计算量也有降低因此最终wall-clock时间减少了约30-40%。超越启发式方法相比固定的Naive Skip本文方法在更少步数下实现了好得多的FID3.8 vs 5.8证明了“几何感知”动态决策的有效性。实操心得在复现或应用此类方法时一个关键的调参点是调度器中的阈值如跳步阈值Threshold_skip、稳定区域判定阈值。论文通常给出在特定数据集ImageNet上的最优值。但当应用到不同领域如人脸生成、艺术画风或不同分辨率的模型时这些阈值可能需要重新校准。一个实用的策略是在一个小的验证集上以FID或人工评估为指标对阈值进行微调。通常对于细节更丰富、分布更复杂的数据需要调高阈值变得更保守。4.3 泛化性分析与消融实验论文通过一系列消融实验验证了各个组件的必要性“几何感知”指标的有效性他们尝试了仅使用时间步t作为决策依据固定调度或使用更简单的指标如特征范数的变化。结果均显示融合了跨步特征差异和特征内方差的V_t^l指标在预测跳步安全性上最准确。时间调度 vs 空间调度单独使用时间调度跳步或空间调度令牌剪枝都能带来加速但二者结合时产生了显著的协同效应。时间调度减少了迭代次数空间调度降低了每次迭代的成本。不同层特征的选择实验发现提取中间层而非最浅或最深层的特征对于几何感知最有效。浅层特征过于低级对内容不敏感深层特征过于抽象变化不连续。中间层如DiT总层数的1/3到2/3处能最好地捕捉到语义结构的演化状态。跨模型与跨任务泛化方法在DiT的不同变体S, B, L, XL上均有效证明了其与模型规模无关。此外在文本到图像生成任务将DiT与CLIP文本编码器结合的初步实验中也观察到了可观的加速说明其思想具有一定的任务泛化能力。不过在文本条件生成中由于文本指令会动态影响生成轨迹调度器的策略可能需要更精细的设计。5. 潜在影响、应用场景与未来展望这项工作的意义远不止于提供了一个更快的采样器。它代表了一种新的、系统级的优化思路将生成过程视为一个动态系统并为其配备一个轻量级的“感知-决策”控制器。5.1 对实际应用场景的变革实时交互式生成在游戏角色设计、室内装修预览、营销素材快速原型等场景用户拖拽一个滑块或输入一段描述期望在数百毫秒内看到高质量预览。传统扩散模型数秒甚至数十秒的生成延迟是难以接受的。本方法可将延迟降低一个数量级使真正的实时交互成为可能。视频生成与编辑视频生成本质上是序列图像生成对速度要求极高。将这种自适应采样加速应用于视频扩散模型的每一帧生成可以大幅降低总生成时间。同时其“空间调度”特性可能有助于处理视频中相对静态的背景区域进一步提升效率。资源受限的边缘设备在手机、XR眼镜等设备上部署扩散模型计算和能耗是核心挑战。免训练的加速方法无需重新训练或蒸馏可以直接部署在已有的轻量化模型上结合本方法能在有限的算力下实现更快的响应或更低的功耗。大规模数据合成与增强当需要利用扩散模型生成海量数据用于训练其他AI模型时采样速度直接关系到数据生产的成本和周期。本方法可以显著提升数据合成的吞吐量。5.2 方法局限性与未来改进方向尽管前景广阔但该方法也存在一些局限指明了未来的研究路径理论保障的欠缺目前的方法更多是启发式和基于经验的。虽然实验有效但缺乏严格的理论证明确保在任意数据分布和模型下这种自适应跳步不会破坏扩散过程收敛到真实数据分布。未来的工作可能需要建立更坚实的概率近似理论。对极端情况的鲁棒性在生成非常复杂、细节极其丰富的图像如充满细小文字的场景时过于激进的跳步可能导致局部细节模糊或错误。需要设计更稳健的感知指标或许需要结合多尺度、多模态如同时考虑潜空间和像素空间的信息。与训练时加速方法的结合本方法是推理时优化与DPM-Solver等训练时设计的采样器是正交的。一个很自然的想法是将其与这些先进采样器结合例如在DPM-Solver的每一步内部再应用几何感知的空间调度可能产生进一步的加速。扩展到其他生成模型架构目前工作聚焦于DiT。如何将“几何感知”的思想迁移到基于U-Net的扩散模型、流模型Flow-based Model甚至自回归模型上是一个有趣的开放问题。核心在于如何为不同架构定义有效的“状态感知”信号。5.3 对从业者的启示与实操建议对于想要尝试或跟进这项技术的工程师和研究者我的建议是首先理解其核心思想而非机械复现。这项工作的精髓在于“利用模型前向传播中的中间特征作为生成过程状态的廉价代理并据此做出动态资源分配决策”。你可以思考在你的特定模型或任务中什么信号最能代表“生成难度”或“变化平稳度”不一定是特征差异也可能是注意力图的熵、梯度的大小、特定通道的激活值等。其次从小规模实验开始验证。不要一开始就在最大的模型和数据集上尝试。选择一个轻量级的模型如DiT-S在一个小数据集如CIFAR-10上实现最基本的“基于特征变化率的跳步”逻辑。先验证这个简单想法是否能在不显著损害FID的情况下减少步数。这个快速验证循环能帮你建立直觉。再者关注调度策略的稳定性。自适应调度容易引入反馈震荡比如连续跳步后质量下降导致后续步骤变得保守然后又因保守而积累可信度再次跳步。在实现时除了论文中的惩罚和衰减机制可以考虑加入“平滑”或“回溯”策略。例如当发现跳步后图像质量的某种度量如像素方差突变异常时可以回退一步用标准步长重新计算。最后将评估器开销纳入考量。虽然论文中开销很低但在极度追求吞吐量的场景任何额外计算都需要权衡。可以考虑每隔几步运行一次评估器或者只在某些关键层提取特征而不是每一层每一步都计算。这项研究像是一把精巧的钥匙为我们打开了一扇门生成模型的推理过程本身是可以被“优化”的而不仅仅是模型权重。它提示我们在追求更大参数、更多数据的同时从系统层面审视和优化生成链路同样能带来巨大的性能红利。随着扩散模型和应用场景的日益复杂这种“感知-决策”式的智能推理优化可能会成为下一代高效生成系统的标配组件。