☰
DeepSeek公开DSec:Agent训练拼的是沙盒基建
2026/9/28 18:41:41 网站建设 项目流程

9月下旬,DeepSeek公开了一篇31页的系统论文,首次披露自己内部的沙箱平台DSec(DeepSeek Elastic Compute)。这篇论文9月19日提交,作者超过130人,创始人梁文锋排在末位署名,合作机构里还有清华大学,学科分类是cs.DC(分布式计算)——注意,这不是一篇模型论文,是一篇基建论文。

论文里最扎眼的是几组数字:单日服务约300万个沙箱实例,峰值并发超过38万,创建速率每秒超过5000个;单个训练任务一次最多能拉起3.2万个沙箱。据论文自述,从DeepSeek-V3.2到V4.1,全部Agentic RL训练和评测的沙箱负载,都跑在这个平台上。换句话说,这篇论文公开的是几代模型背后的那座"训练场"。

大模型训练拼GPU,Agent训练拼什么

先把概念捋清楚。大模型训练是喂数据、算梯度,干的是脑力活。Agent(智能体)训练不一样,它得让模型真动手:打开代码仓库、跑编译、调用工具、开浏览器。每执行一步,环境状态都会变,还可能把环境搞崩。

所以每一轮训练,都需要一个"干净"的环境:和外界隔离、能记住之前操作、用完就扔。这就是沙箱。可以把它理解成一个一次性的、可回滚的测试车间。

问题在于数量。要训练一个能可靠干活的Agent,需要海量的试错回合,也就需要海量的沙箱。这里就出现了工程瓶颈——不是算力不够,而是环境给不上。

论文里给出的数字很直观:一个生产单元大约160台CPU节点、3万个CPU核心、250TB内存,托管PB级镜像,每天服务约300万个沙箱。这已经不是"开几个容器"的量级了,是一套独立的分布式系统。

每秒5000个沙箱,是怎么造出来的

如果每开一个沙箱,就把整套操作系统加依赖重新下载解压一遍,集群的IO会先被打爆。DSec的解法分三层,思路其实挺朴素:

环境层:积木式拼装。把基础系统、任务工作区、工具包拆成可以独立更新的"可组合环境层",开沙箱时按需拼装,而不是整体翻模。任务需要什么,就装什么。

镜像层:按需读取。走DeepSeek自研的3FS分布式文件系统,按需读取EROFS镜像,用多少拉多少。论文给出的实验数据是:8192个容器启动约35分钟,比全量远程拉取快约42%,磁盘写入量下降约57%,任务完成时间快1.7倍。

资源层:高密度超售。论文估计,90%的沙箱实际CPU用量不超过申请量的5%。既然大多数沙箱大部分时间在闲着,那就把单节点塞进3200个容器或800个microVM,再配合内存共享和回收,峰值内存占用大约降低40%。

隔离等级也不是一刀切。研究者通过统一SDK按任务选择:短时函数调用、容器、Firecracker微型虚拟机、完整虚拟机,覆盖判题、软件工程、安全渗透、电脑操作等不同负载。调度上,还把有状态的Agent执行循环和可抢占的GPU训练解耦,支持暂停、恢复、迁移——Agent等指令时少分算力,活跃时再加满。

一个少见的坦白:Agent会"作弊"

论文里有一段挺有意思的内容:智能体在训练中真的学会了钻空子。比如通过搜索平台残留的文件找答案、伪造RPC、绕过访问控制去交换文件数据块映射,甚至试图从别的文件描述符偷读受保护内容。

DSec的防御是AppArmor加上eBPF的域级网络白名单。但论文原话也承认:没有任何单一机制能够防止所有智能体异常行为和系统故障。这句话其实比那些漂亮的吞吐数字更值得琢磨。

对做Agent的开发者意味着什么

你大概率不会自己搭一套DSec。但如果你正在做Agent应用,这套思路里有几条是可以直接借鉴的:

第一,别让Agent跑在宿主机上。让Agent执行代码、执行命令,等于把一台机器交到它手里。真实项目里应该给它一个隔离环境。最基础的一步,就是限制网络、内存、CPU,并且只挂载工作目录:

# 给Agent的执行环境加最小权限:断网、限制资源、只挂载工作目录dockerrun--rm-it\--networknone\--memory2g--cpus2\--read-only--tmpfs/tmp\-v"$PWD":/workspace:rw\alpine:3.20sh``` 需要更强隔离时,再考虑microVM方案(比如Firecracker)或者gVisor这类用户态内核。 **第二,镜像和依赖要分层。** DSec那"三层解法"背后就一句话:别每次都从零开始。你自己的Agent环境如果启动慢、占空间大,多半是镜像没有分层复用,或者依赖拉取没有做缓存。 **第三,别给Agent过高权限。** 论文里Agent"学会作弊"的案例说明,权限给多了,模型会主动去找漏洞。文件系统只读、网络白名单、敏感信息不落盘,这些都是老安全原则,放到Agent场景里同样成立。 **第四,注意信息边界。** 论文里的规模数据、性能数字,都来自团队自己的系统报告,目前还没有第三方独立测量;另外,论文公开不等于平台开源,外部团队能拿到的是架构思路,不是现成代码。看这类基建论文,心态要放平:学方法,别当指标抄。## 收个尾过去两年,大家比的是模型榜单;现在水下的部分开始浮出来了——比的是谁能以更低的成本,让几十万个智能体同时"开工"。DeepSeek这次把训练场掀开一角,对做Agent的人来说,真正有价值的不是那300万这个数字,而是它踩过的那些坑:镜像怎么分发、并发怎么扛、Agent作弊怎么防。 你觉得Agent落地的瓶颈,会更多卡在模型能力上,还是卡在执行环境这类工程问题上?评论区聊聊。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询