腾讯:自适应剪枝优化高并发推理

腾讯:自适应剪枝优化高并发推理
标题D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding来源arXiv, 2607.14647v1️文章简介研究问题在高并发场景下长草稿的投机解码因验证大量被拒令牌导致计算浪费甚至性能低于自回归解码如何解决这一验证成本爆炸问题主要贡献论文提出D-cut一种基于草稿置信度和运行时成本模型的自适应跨请求剪枝策略显著提升了高并发下的推理加速比。重点思路跨请求动态剪枝打破每个请求固定验证深度的限制将批次内所有草稿令牌视为共享一个验证预算。利用草稿模型生成的令牌级置信度对所有候选令牌进行全局排序保留高置信度前缀剪除低置信度后缀从而将计算资源集中在更可能被接受的令牌上。运行时自适应预算分配认识到验证成本高度依赖硬件环境如GPU类型、并行策略D-cut在启动阶段对系统进行 profiling构建不同批量大小和保留比例下的延迟成本表。运行时结合预估的算法收益基于置信度和实测的硬件成本动态选择能最大化整体加速比的全局验证预算比例。无损输出分布通过仅修剪低效用后缀并保持目标模型的接受/拒绝逻辑不变确保最终输出分布与原始目标模型完全一致实现无损加速。分析总结高并发性能显著提升在密集模型和MoE模型上的实验显示D-cut将平均加速比从1.26倍提升至1.65倍。特别是在高并发下它恢复了那些因长草稿导致验证开销过大而性能低于自回归基线的配置的性能。硬件适应性强在计算受限的H20 GPU上D-cut倾向于激进剪枝以降低验证延迟在计算丰富的H800 GPU上则保守剪枝以利用多余算力。这种自适应能力使其在不同硬件上均能接近最优固定比例的performance无需人工调优。MoE模型加速明显在MoE架构模型上D-cut相比自回归解码最高可实现3.0倍的加速证明了其在处理复杂模型结构时的高效性。个人观点论文将投机解码的优化视角从单请求的草稿生成质量转移到了批处理层面的验证资源分配效率利用 draft 生成时的置信度来估计每个 draft token 的验证价值。