ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

端侧大模型推理笔记

端侧大模型推理笔记 大语言模型的推理过程包含两个截然不同的阶段:预填充(Prefill)和解码(Decode)。其中,预填充阶段属于计算密集型任务,负责处理整个输入序列;而解码阶段属于访存密集型任务,需管理 token 生成过程中所需的键值(KV)缓存。想要将大模型部署到端侧,下面是其常见操作学习笔记:一、模型推理大模型生成文本的过程本质上是一个自回归(autoregressive)过程。整个流程可以清晰地划分为两个边界明确的阶段;》 Prefill(预填充)阶段 输入:用户的完整提示(prompt),长度为 n。 目标: 一次性处理整个输入序列。 执行前向计算,生成第一个输出 token。 计算并缓存所有 Transformer 层的 Key (K) 和 Value (V) 向量(统称 KV Cache)。为后续解 码阶段准备 KV Cache,避免重复计算。 性能指标:决定 TTFT(Time
返回列表