DeepSeek DSec如何重构智能体训练基础设施
智能体技术的快速发展,正推动AI从被动应答走向自主行动阶段。让AI学会写代码、操作软件、处理系统任务,不能只靠书本式的知识点投喂,必须让它在真实的执行环境里反复动手试错,这正是智能体强化学习的核心逻辑。而承载这些试错过程的“隔离训练场”沙箱,是决定训练规模与效率的关键基础设施。
近期,DeepSeek发布的《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》论文,就针对智能体训练的专属工作负载特征,给出了一套成体系的生产级沙箱平台方案,系统性地回应了规模化训练下的效率、成本与安全治理难题。
破解规模化训练效率与成本难题
Agent训练的沙箱负载,与传统云计算、Serverless场景有本质区别。这些负载的主体不是短生命周期的无状态函数调用,而是有状态、长交互、突发创建、环境高度异构的工作负载。单个训练任务可一次性发起数万沙箱实例的突发请求;沙箱在等待大模型生成动作时CPU大量闲置,约90%的沙箱平均CPU使用率不到申请量的5%,但文件修改、依赖安装等状态会全程保留,长生命周期下内存驻留持续消耗资源;任务类型从简单代码执行、软件工程开发,到安全类任务、GUI操作,跨度极大,隔离等级与系统功能需求各不相同。再加上环境镜像复用率低、智能体执行不可信、GPU训练抢占带来的中断恢复需求,通用容器平台无法直接适配规模化Agent训练,必须专门设计基础设施。
DSec的思路是用分层架构匹配差异化场景,拒绝“一刀切”。平台构建了从轻量到重量级的分层沙箱矩阵,通过统一的Python SDK libdsec对外提供接口,由调用方按需选择最匹配的后端。最轻量的FnCall面向OJ判题、代码编译等无状态任务,复用预创建容器消除启动开销;容器后端作为主力,适配大部分软件工程类工具调用任务,兼顾速度与密度;Firecracker微虚拟机提供更强的隔离边界,适配安全敏感任务;传统虚拟机则支持Android环境、GUI应用等需要完整系统的场景。这种务实的工程思路,本质上是用最合适的隔离级别匹配任务,在安全、性能与成本之间取得平衡。
为支撑大规模并发下的性能与成本,DSec设计了三套机制,分别应对环境构建、资源超售、镜像分发三大痛点。
第一是可组合的环境分层机制。传统单体镜像将系统依赖、代码仓库、工具链打包为一体,任何组件升级都要重制所有组合镜像,维护成本随组件数与工作区数相乘上升。DSec将环境拆分为基础镜像、工作区、工具包三个独立版本化的层级,基于overlayfs的合并语义,在沙箱启动时动态堆叠成完整运行环境。配合只读压缩的EROFS文件系统,不仅降低了组件升级的维护成本,还避免每个沙箱重复解压工作区。实验数据显示,相比传统tar包部署方式,可组合分层设计把任务完成时间从79分钟压到45分钟,而tar方式的总磁盘写入量约为EROFS的5.5倍、峰值写入吞吐约为3.4倍。
第二是高密度资源超售与QoS保障机制。Agent交互的间歇性使沙箱CPU平均使用率不足5%,天然适合资源超售,但长生命周期的内存驻留与延迟敏感任务的性能要求,让无节制超售极易引发性能雪崩。DSec在内存侧做了两件事:用virtio-pmem将镜像数据直接映射到主机页缓存,消除虚拟机内外重复缓存,峰值内存占用降低40.2%,代价是瞬时CPU峰值从26.5%抬到41.4%,生产上只对只读的基础镜像与工具包层启用;再通过DAMON内存监控加virtio-balloon空闲页上报,回收冷页与空闲内存,让一段时间内的内存占用总量减少21.2%。CPU侧则构建两级QoS:把任务分为延迟敏感与尽力而为两类,靠调度优先级让后者主动让步,但只调优先级,延迟最多只能改善3.4%,因为两类任务仍在同一物理核心的SMT线程上抢资源;再加上核心调度,把高负载下的延迟膨胀从45.2%压制到17.3%,在高密度部署的同时守住关键任务的性能底线。
第三是按需镜像加载。Agent训练镜像总量超百TB且单镜像复用率极低,全量预拉取既耗时间又占存储。DSec依托DeepSeek自研的3FS分布式文件系统,配合EROFS的元数据与数据分离设计,实现镜像数据按需读取:元数据预取到本地节点保证路径查询性能,文件数据则在沙箱实际访问时才从3FS批量拉取。相比全量镜像拉取模式,按需加载约35分钟即可跑完全部任务,接近全量本地缓存水平,而全量拉取需要60分钟以上,是它的1.7倍,累计磁盘写入减少57%,既规避镜像仓库的带宽瓶颈,也降低节点本地存储压力。
从运行容器到Agent训练专属基础设施
更值得关注的是,与强化学习训练框架的深度协同,是DSec区别于通用沙箱平台的优势。普通沙箱只提供运行环境,而DSec从训练全流程视角重构了沙箱生命周期:它支持智能体在沙箱中交互式构建环境、打快照复用,解决大规模环境构建的人力瓶颈;将Agent执行循环从可抢占的GPU训练池中剥离,独立运行在沙箱集群,被抢占后无须重放日志即可直接恢复;针对抢占场景,沙箱支持暂停—恢复机制,暂停时回收内存资源,恢复时快速还原并保留执行状态,兼顾资源利用率与训练连续性。针对智能体的“奖励黑客”行为,DSec还通过AppArmor控制文件与套接字权限,通过eBPF实现任务级网络白名单,降低智能体钻漏洞取巧的风险。
目前DSec的单生产单元已部署约160个CPU节点,每日承载约300万个沙箱实例,峰值并发超过38万个,每秒可创建超过5000个沙箱,支撑从DeepSeek V3.2到V4.1全系列智能体模型的训练与评估。
写在最后
总体来看,DSec是一套完全围绕Agent训练工作负载打造的专用基础设施,而非对通用容器技术的简单封装:它用分层沙箱矩阵覆盖异构任务场景,靠三大机制应对环境构建、资源调度、镜像分发的效率痛点,更凭借与训练框架的全链路协同,补齐了状态留存、抢占恢复、行为治理等训练专属需求。
从行业视角看,这套生产实践标志着大模型算力基础设施的竞争进入新阶段:当AI的能力从文本生成转向环境交互,支撑智能体训练的沙箱基础设施会成为和GPU集群同等重要的产能底座。DSec既提供了可复用的生产级参考架构,也指明了Agent时代算力基础设施的演进方向,从通用算力资源池,升级为面向智能体训练的全链路、场景化弹性计算体系。
X
-
微博认证登录
-
QQ账号登录
-
微信账号登录
企业俱乐部
Copyright (C) 1997-2026 Chinabyte.com, All Rights Reserved
