ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

梁文锋署名,DeepSeek最新公开Agent训练的真正底座:一天撑300万沙箱

梁文锋署名,DeepSeek最新公开Agent训练的真正底座:一天撑300万沙箱 「已支撑V3.2到V4.1训练」目录01 Agent沙箱 workload 的7个现实硬约束02 整体架构集群管控 节点本地运行时03 三大核心系统机制解决生产痛点3.1 可组合分层环境干掉单体镜像维护噩梦3.2 高密度资源管理内存复用 QoS CPU调度3.3 基于3FS的按需镜像加载04 和RL训练框架协同设计面向Agent训练的独特能力05 实验结果怎么看待这些数字06 写在最后9月23日DeepSeek创始人梁文锋署名的最新论文公开首次系统披露了其Agent训练沙箱平台DSecDeepSeek Elastic Compute的技术细节。DSec不是一个沙箱runtime也不是Docker外面套的一层壳而是一个完整的集群级弹性执行平台。一个生产级规模单元约由160个CPU节点、3万核CPU和250TB内存构成托管PB级镜像。能力上它单日服务约300万个沙箱实例峰值并发超过38万个创建速率超过每秒5000个单个训练任务最多可一次性拉起3.2万个沙箱。这些沙箱已经在支撑DeepSeek从V3.2到V4.1的Agent强化学习训练。论文明确写道所有RL训练与评测的沙箱负载都运行在DSec上。但在实现这一规模之前DeepSeek首先发现了一个更棘手的问题Agent会作弊。在训练中DeepSeek发现Agent可能没有按照预期方式解决任务而是寻找意外的信息通道获取答案。有的Agent会扫描沙箱能触达的网络端口和服务寻找参考实现有的直接通过Go module proxy从GitHub拉代码有的甚至安装更新版本的软件包来获取现成解法。这些行为通过单纯检查最终输出根本发现不了——Agent确实“做对了题”只是手段不正当。一个专门为Agent训练准备的平台把“防作弊”写进了基础设施。01 Agent沙箱 workload 的7个现实硬约束很多人会把Agent沙箱等同于普通容器或者serverless函数但Agent训练场景下负载特征完全不一样这也是DSec设计全部出发点。1.请求爆发式一次RL任务一次性会发起最高32K个沙箱实例短时间集中创建调度和镜像分发不能成为瓶颈。2.高密度部署Agent大段时间在等待大模型输出下一步动作CPU大多处于空闲。线上单节点可以跑800个microVM或者3200个容器依赖安全的资源超配。3.有状态长生命周期沙箱内部会修改文件、安装依赖、启动服务状态需要跨多轮LLM交互保留容器中位数存活17.4分钟microVM中位数15.5分钟99分位生命周期超过3小时。大量空闲实例会持续占用内存。图每个任务创建沙箱数量分布4.工作负载高度异构从简单OJ代码执行、软件工程任务、安全攻防、计算机GUI操作到Android移动环境。轻量任务适合函数调用安全场景选microVM需要完整商业操作系统只能上Full‑VM单一隔离技术无法覆盖全部场景。图典型沙箱执行周期setup、工具调用、测试阶段5.镜像环境极度多样、复用率低。生产一周统计容器后端有11266个基础镜像102171个工作区大部分镜像只会被少量沙箱使用。如果每次完整拉取镜像会带来巨大IO压力论文 ablation 显示直接预拉取镜像会把任务总耗时拉长1.7倍。表一周生产活跃环境制品统计表6.Agent执行行为不可信智能体可能篡改文件、耗尽资源、尝试绕过沙箱边界出现奖励劫持reward hacking需要访问控制与异常行为检测。7.任务可被中断GPU训练集群经常会抢占任务沙箱状态不能随着GPU Pod销毁丢失需要支持暂停、保存状态、后续恢复rollout流程。市面上传统serverless、代码解释器沙箱大多面向短生命周期、无状态场景LLM代码解释器产品侧重推理侧少量并发。而DSec面向RL训练核心矛盾变成大规模有状态沙箱、资源超配、镜像分发、和训练框架协同调度。02 整体架构集群管控 节点本地运行时整套架构分为集群级服务和单节点沙箱运行时两大块。 集群服务包含IAM身份权限管理、API Server网关、Placement Engine放置调度器、Watcher监控采集组件。IAM做鉴权支持多级项目嵌套做配额和权限委派Agent与人类共用同一套权限模型。API Server作为唯一网络出入口把不可信沙箱网络与可信GPU训练集群隔离开本身不保存沙箱状态支持水平扩容。Placement Engine使用power‑of‑k‑choices幂选择算法随机采样部分健康节点选出负载最低节点。Watcher持续收集各节点运行状态。Placement Engine和Watcher不需要持久化状态重启之后重新轮询节点即可恢复视图。真正的准入校验放在每台机器的Edge组件哪怕调度器选好了节点如果本机资源已经打满Edge会直接拒绝新建沙箱规避调度器状态滞后带来的过载风险。图DSec架构图节点侧运行时由 Edge、Aether、Chronus组成Edge处理本节点沙箱生命周期管理存储、eBPF网络策略处理暂停/恢复快照FnCall和容器运行在一层QEMU虚拟机内给裸金属再加一层内核隔离边界。Aether沙箱内部代理进程负责和Edge通信管理会话。Chronus沙箱内部的shell会话抽象提供命令执行、文件读写、HTTP调用、流式IO。图生产节点CPU内存使用率分布已申请资源的占比镜像全部依托3FSFire‑Flyer File System分布式文件系统存储。容器镜像离线转为EROFS格式microVM磁盘使用OverlayBD。元数据可以预取到本地磁盘数据块按需远程读取不需要完整下载镜像。补充云突发扩容机制当本地集群利用率超过80%调度器会把部分沙箱请求卸载到云虚拟机。同步一份精简常用EROFS镜像集合到云端存储满足条件的任务跑在云上单规模单元200台云虚拟机可以承接约30%峰值溢出流量避免本地集群过度超配。03 三大核心系统机制解决生产痛点3.1 可组合分层环境干掉单体镜像维护噩梦传统做法是把操作系统基础镜像、项目工作区、工具包打包成一个完整OCI镜像。一旦工具包版本更新所有组合出来的镜像全部需要重建复杂度维护成本爆炸。DSec把基础镜像、workspace工作区、toolkit工具包拆成互相独立、版本独立的只读层依靠overlayfs做分层合并。运行时动态堆叠多层EROFS只读层最上层提供可读写层。更新工具包只需要重建工具包这一层复杂度降低到。对于microVM场景同样把EROFS作为外部只读块设备挂载进虚拟机内部guest内部再用overlayfs完成层合并。图整体镜像升级对比单体镜像 vs 可组合分层环境EROFS本身是只读压缩文件系统支持按需读取块不需要解压整个镜像。对比启动时解压tar.gz包的方案论文测试8192个容器并发启动场景EROFS方案任务完成速度提升1.76倍磁盘写流量下降5.5倍。3.2 高密度资源管理内存复用 QoS CPU调度Agent沙箱普遍CPU利用率很低但内存开销是高密度部署最大阻碍。microVM存在双重page cache问题host主机缓存一次客户机操作系统再缓存一次内存浪费同时guest内部空闲内存不会主动还给宿主机。DSec采用两套互补机制1.内存优化virtio‑pmemDAX只读EROFS层直接映射主机内存消除guest‑host重复页缓存峰值内存占用下降40.2%。DAMON virtio‑balloon空闲页上报DAMON扫描识别冷内存页触发guest回收再通过balloon把空闲大页还给主机。该机制降低21.2%综合内存消耗适合可读写磁盘。2.CPU QoS调度 沙箱区分延迟敏感LS和尽力服务BE两类任务。BE任务设置SCHED_IDLE调度策略同时开启Linux core scheduling核心调度避免低优先级任务跑在同一个物理核的SMT超线程兄弟线程上互相抢占。 在50%后台负载压力下无保护基线会带来45.2%延迟膨胀SCHED_IDLE加上core scheduling之后延迟膨胀被压制到17.3%。图单生产节点一天内沙箱数量变化曲线客观看待该指标core scheduling无法解决内存带宽、LLC缓存争抢所以依然存在一部分性能损耗只是把SMT超线程带来的干扰大幅缓解。图沙箱生命周期分布3.3 基于3FS的按需镜像加载论文统计不同编程语言镜像运行时只会访问全部镜像4.2%‑13.3%的数据。完整拉取镜像属于大量无效IO。3FS大顺序读写吞吐很强但小随机IO性能差。DSec据此定下三条原则写全部本地沙箱可写层放在节点本地磁盘避开3FS小写入开销读按需大块只读镜像数据只有访问的时候才从3FS拉取内核预读合并成大块IO元数据本地缓存文件系统元数据预先下载到本地路径查找不需要远程IO。容器使用多设备EROFS元数据本地存放数据块留在3FSmicroVM采用OverlayBDublk用户态块设备256KiB粒度拉取数据额外增加本地二级缓存。测试8192容器爆发启动场景冷docker完整拉取耗时60分钟磁盘写入总量1600GBDSec按需EROFS35分钟完成全部任务磁盘总写700GB磁盘写总量减少57%性能接近本地全缓存基线。图核心系统机制总览图04 和RL训练框架协同设计面向Agent训练的独特能力很多沙箱只做隔离执行DSec深度和RL Agent训练流水线协同这是区别普通沙箱系统的关键点。1.Agent自构建环境pack_diff不需要人工镜像流水线。Agent在沙箱交互完成后可以打增量快照pack_diff快照直接恢复成新沙箱。Agent自己生成训练需要的环境。内部做约束校验同时构建账号和运行账号隔离清理可写层残留避免参考答案泄露进训练镜像。2.rollout推演与GPU训练解耦旧架构Agent循环跑在可被抢占的GPU训练Pod内。一旦GPU任务被抢占Agent循环进程直接被杀掉只能靠命令日志重放恢复状态。DSec把agent推演逻辑迁移到沙箱侧GPU训练任务只负责跑模型更新。Worker容器Agent沙箱保存完整rollout状态。GPU抢占重启之后直接重新连接不需要重放历史命令降低系统复杂度。3.沙箱暂停/恢复适配抢占式GPU训练当GPU任务被抢占RL框架下发pause指令容器docker pause冻结进程树开启swap主动内存回收恢复时内存预取unpausemicroVM把完整内存、执行状态做快照销毁Firecracker进程释放内存恢复时重建进程加载快照继续运行。通过暂停机制大量空闲沙箱可以释放内存资源但完整任务状态保留GPU任务恢复之后可以继续交互。图按需EROFS对比Docker拉取冷/缓存并发容器数量与磁盘IO指标4.Agent异常行为治理与访问控制论文记录大量真实生产Agent攻击、奖励劫持案例读取内部socket日志窃取答案修改/bin/bash劫持shell利用ioctl系统调用篡改文件疯狂yes命令打满磁盘IO等。DSec使用两层管控AppArmor管控沙箱内文件读写、Unix域socket访问哪怕沙箱内部以root运行也会生效eBPF每沙箱粒度网络策略按域名、IP、端口做访问白名单不同任务阶段可以动态切换网络规则。05 实验结果怎么看待这些数字实验在独立10节点测试集群开展主要验证三层核心机制。1.按需镜像加载爆发8192容器任务。eager拉取镜像耗时拉长1.71倍磁盘写翻倍按需加载磁盘写减少57%总耗时接近本地全缓存。注意该收益来自于“只访问镜像一小部分数据”如果任务会完整遍历镜像全部文件按需加载收益会消失甚至会放大延迟。2.可组合EROFS分层 vs tar解压tar方案每个沙箱都解压压缩包CPU、磁盘IO压力巨大总耗时79分钟EROFS直接挂载耗时45分钟。这里性能优势来自规避每个实例重复解压如果环境变更频繁、层数量过多多层挂载本身会带来少量额外开销工程上会把小尺寸连续层做离线合并。图tar解压方案对比EROFS分层CPU利用率、磁盘写吞吐3.内存超配实验virtio‑pmem消除重复page cache峰值内存下降40.2%但是冷访问会带来一定CPU开销DAMONballoon FPR不降低峰值内存但是积分总内存消耗下降21.2% 两者组合得到最优内存表现。工程上可以根据集群CPU‑内存资源配比选择是否全部开启。图内存优化实验主机内存占用与CPU利用率4.CPU QoS实验在大量后台best‑effort任务混杂的高密度场景core scheduling有效抑制SMT超线程带来的抢占。但对于LLC缓存、内存带宽竞争这类问题无能为力残留一部分延迟上涨属于正常现象。图CPU QoS对比基线、SCHED_IDLE、SCHED_IDLEcore scheduling敏感任务单步耗时06 写在最后Agent训练真正的瓶颈很多时候不在大模型本身而在底层执行环境。要让百万级Agent同时做工具调用、修改文件、运行软件传统容器平台直接上会遭遇镜像爆炸、内存浪费、调度卡顿、GPU抢占之后状态丢失、Agent奖励劫持一堆现实工程障碍。DSec给出一套已经跑在DeepSeek生产环境的完整答案统一SDK屏蔽多种隔离后端可组合镜像分层降低维护成本依托3FS按需镜像削减IO压力内存CPU的QoS策略实现高密度超配最重要是和RL训练深度协同解决rollout推演状态保存、抢占恢复、Agent行为管控。这篇论文的价值不在于某个惊艳的算法创新而是完整披露大规模Agent RL训练背后的基础设施实现细节。随着Agent训练规模持续扩大类似沙箱基础设施会变成大模型Agent能力演进的关键底座。Ref论文标题DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale论文链接https://arxiv.org/pdf/2609.22978
返回列表