ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

面试-Packing 和 Padding 收益问题

面试-Packing 和 Padding 收益问题 FlashAttention Padding vs Varlen‑Packing 完整对比笔记前提条件Br = 128(Q分块大小,每块128 token)注意力头数n_head = 2Padding模式:flash_attn_func,输入shape[B, L, H, D]Varlen‑Packing模式:flash_attn_varlen_func,一维拼接输入,用cu_seqlens标记样本边界核心公式Padding总Block数:n b l o c k = n h e a d × ∑ ⌈ l e n i B r ⌉ \boldsymbol{n_{block}=n_{head}\times\sum{\lceil \frac{len_i}{B_r} \rceil}}nblock​=nhead​×∑⌈Br​leni​​⌉(求和,每条样本需要多少Q块就算多少)Varlen‑Packing总Block数:n b l o c k = n h e a d × ⌈ max ⁡ ( l e n i ) B r ⌉ × s e q _ c o u n t \boldsymbol{n_{block}=n_{head}\times\lceil \frac{\max(len_i)}{B_r} \rceil \times seq\_count}nblock​=nhead​×⌈Br​max(leni​)​⌉×seq_count(乘法:最长Q块数 × 样本数量,不是总token除以Br)背景mamba:
返回列表