ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

26年奇点智能大会分享Mooncake Store 多层存储演进:分层 KV Cache 与万亿参数权重管理

26年奇点智能大会分享Mooncake Store 多层存储演进:分层 KV Cache 与万亿参数权重管理 演讲嘉宾许文杰Mooncake 核心开发者、Mooncake Store Maintainer演讲主题Mooncake Store 的多层存储演进分层 KV Cache 与大模型权重管理大会2026 C 及系统软件技术大会 · 北京参会报名https://boolan.com/enroll/c1051/event/1162?channelseo一、引言从分离式缓存到统一存储层Mooncake 在大模型推理领域以分离式 KV Cache 架构闻名其核心创新在于把 KV Cache 从 GPU 显存中抽离出来交给独立的分布式存储层管理。而这一次许文杰带来的主题是 Mooncake 的进一步演进——Mooncake Store 从单一的分布式 DRAM扩展为跨越 DRAM、SSD、NVMe-oF 与远端 DFS 的多层存储并以统一 Store 同时支撑 KV 数据分层与大规模权重流转。二、分层 KV Cache用存储层级换命中率大模型推理中KV Cache 的规模与成本是核心矛盾缓存越大命中率越高但显存与 DRAM 成本也越高。Mooncake 的解法是引入存储层级让热与冷的 KV 数据各得其所。存储层级角色时延特征成本DRAM热数据低时延访问微秒级高本地 NVMe扩大 KV 工作集百微秒级中NVMe KV / NVMe-oF共享容量层亚毫秒级中低远端 DFS冷数据、权重持久化毫秒级低核心逻辑是用 SSD 的低成本换取更大的可保留 KV 工作集减少数据淘汰从而提升多轮对话与长上下文场景下的缓存命中率。KV Cache 数据在不同存储层级间的流动 ┌─────────┐ 命中回迁 ┌─────────┐ │ DRAM │ ◄───────── │ NVMe │ │ (热数据) │ ────────► │ (工作集) │ └─────────┘ 异步下刷 └─────────┘ │ │ │ 逐出落盘 │ 批量 I/O ▼ ▼ ┌─────────────────────────────────┐ │ NVMe-oF / 远端 DFS冷数据 │ └─────────────────────────────────┘2.1 关键机制对象副本管理为 KV 对象维护多副本兼顾可靠性与读带宽异步下刷DRAM 中的数据异步持久化到 SSD不阻塞请求路径逐出落盘被淘汰的热数据不直接丢弃而是下刷到 SSD 层提升未来命中SSD 命中回迁命中 SSD 层的 KV 数据回迁到 DRAM 供低时延访问批量 I/O聚合小对象读写摊薄 SSD 的随机 I/O 开销三、万亿参数权重管理checkpoint 的工程挑战当模型参数规模达到Kimi K3 等万亿参数级别时权重本身的管理就成为一个巨大的存储与传输工程问题。3.1 TB 级 checkpoint 导入万亿参数模型的 checkpoint 动辄 TB 级其导入面临三个难题重复读盘、中间副本、跨节点分发。Mooncake 通过以下手段解决权重加载优化路径 Manifest 清单 ──► 分块对象 ──► 范围读取 ──► 多缓冲区传输 避免全量扫描 按需加载 按需切片 流水线并行Manifest维护权重对象的元数据清单避免全量扫描存储分块对象权重按块组织支持按需加载而非全量读入范围读取只读取所需的字节范围减少无效 I/O多缓冲区传输用流水线并行传输隐藏网络与磁盘延迟3.2 并行布局转换Reshard万亿参数模型在不同并行策略TP 张量并行、PP 流水并行、EP 专家并行、DP 数据并行下权重的物理分布完全不同。切换并行布局时需要做Reshard重分片。# Reshard 传输计划生成的核心思路伪代码defplan_reshard(src_layout,dst_layout,weights):# N 维重叠规划让跨节点的传输尽量与计算重叠planNDimOverlapPlanner(src_layout,dst_layout).plan(weights)# 运行时绑定把传输任务绑定到具体的节点与通道returnRuntimeBinder().bind(plan)Mooncake 通过N 维重叠规划与运行时绑定生成 Reshard 传输计划让权重在不同并行布局间的流转尽可能高效、无重复副本。四、统一 Store 的设计哲学Mooncake Store 演进背后的设计哲学可以归纳为一句话以统一的存储抽象同时支撑缓存型的 KV 数据与持久型的权重数据。数据类型访问模式存储诉求Store 支撑KV Cache高频读写、逐出频繁低时延、分层多层缓存模型权重大块读、布局变换高吞吐、切片分块范围读取这两类看似不同的数据在统一 Store 中被同一套对象、副本、传输机制管理避免了一套 KV 存储 一套权重存储的重复建设。五、对推理系统工程师的启示许文杰的分享为推理基础设施团队带来三点启示存储分层是性价比的杠杆不必把所有数据都放在 DRAM用 SSD 扩大工作集往往更划算权重管理是万亿模型的隐形瓶颈checkpoint 导入与 Reshard 的工程开销可能比推理本身更棘手统一抽象优于专用系统KV 与权重共享存储层能显著降低系统复杂度六、分层存储的一致性保障多层存储引入了一个新的工程难题数据在多层级间流动时如何保证一致性与正确性机制解决的问题关键设计对象副本管理多副本数据一致版本/租约控制异步下刷DRAM 崩溃丢数据崩溃一致性协议逐出落盘淘汰数据不丢失原子下刷命中回迁SSD 命中回 DRAM正确性校验以 KV Cache 为例一个关键约束是从 DRAM 异步下刷到 SSD 的数据在回迁时必须是完整、一致的。若下刷中途发生崩溃必须保证回迁的数据要么完整可用要么被正确判定为失效绝不能出现半份 KV被误用的情况。许文杰强调Mooncake Store 的一致性设计是它能在生产环境支撑 Kimi K3 强化学习训练的基础——分层存储的价值建立在每一层数据都可信赖的前提之上。七、总结从分离式 KV Cache 到多层存储 StoreMooncake 正在把推理系统的存储从辅助角色推向核心基础设施。分层 KV Cache 用存储层级换取命中率统一 Store 则让万亿参数模型的权重流转有了工程化的答案。2026 年 C 及系统软件技术大会上许文杰将完整呈现这套统一 Store 支撑 KV 数据分层与大规模权重流转的技术细节。大会信息2026 奇点智能技术大会 C 及系统软件技术大会时间2026 年 11 月 20-21 日地点中国·北京万达文华酒店参会报名https://boolan.com/enroll/c1051/event/1162?channelseo立即报名与 Mooncake 核心开发者面对面交流
返回列表