国产大模型公司 DeepSeek(深度求索)披露最新智能体(Agent)训练基础设施论文。

论文首页截图
近日,DeepSeek 在预印本平台 arXiv 公布论文《DeepSeek 弹性计算(DSec):面向大规模 Agent 训练的沙盒基础设施》,首次系统披露 DeepSeek 用于大规模 Agent 强化学习(RL)与评测的生产级沙盒基础设施 DSec:随着 AI 从“生成 Token”走向“执行任务”,大模型公司除 GPU、数据之外,开始大规模建设可交互、可验证、可隔离的训练环境。
这篇论文提交日期是 9 月 19 日,作者名单超过 130 人,DeepSeek 创始人梁文锋位列最后一位。
论文详细介绍了 DeepSeek Elastic Compute(DSec)。这是一套为大规模 Agent 训练和评测设计的生产级沙盒平台,可以在集群中统一调度和管理大量沙盒,并根据不同任务快速组合所需的软件、数据和运行环境,同时通过镜像共享、内存回收和 CPU 调度等方式提高资源利用效率。DSec 还与 DeepSeek 强化学习(RL)框架协同设计,将 Agent 有状态的任务执行与可抢占的 GPU 训练解耦。也就是说,即使 GPU 训练任务被暂停或重新调度,Agent 已经执行到一半的任务状态仍然可以保留下来,待 GPU 资源恢复后继续执行。
通俗而言,可以把 DSec 理解为一个专门给 AI 智能体训练用的“超大共享教室调度系统”:它能同时开几十万个隔离的小房间给 AI 跑代码,用乐高积木的方式快速搭环境,用共享书架的方式省存储空间,还能在 GPU 被抢的时候把教室打包封存、等 GPU 回来了再接着用,同时防止 AI 在教室里搞破坏。
据了解,单个生产级 DSec 规模单元约由 160 个节点组成,拥有约 3 万个 CPU 核心和 250TB 内存,生产环境中每天服务约 300 万个沙盒,峰值支持同时运行超 38 万个沙盒,并维持每秒超过 5000 个沙盒的创建速率。论文并未披露具体 DSec 的数量。
论文介绍,传统大模型训练主要围绕数据、GPU 计算和 Token 生成展开,而 Agent(智能体)训练则需要模型持续与真实执行环境交互。
以 Coding Agent(编程智能体)为例,它可能需要读取代码库、修改文件、安装依赖、执行 Shell 命令、运行测试、读取报错,再继续决策。
随着训练规模的不断扩大,单靠人工很难构建大量训练环境。根据论文介绍,DeepSeek 正在建立内部流程,让 Agent 自动构建的环境,并进行检查,再投入 RL 和评测。由此形成“Agent 构建环境--新 Agent 在环境中训练--更强 Agent 继续构建更多环境”的生产闭环。
值得一提的是,论文中还提到如今 Agent 会主动寻找漏洞和“作弊”。在训练中,DeepSeek 发现 Agent 可能没有按照预期方式解决任务,而是寻找意外的信息通道获取答案;另一些行为则会直接破坏运行环境。随着 Agent 能力增强,“防作弊”和行为约束本身正在成为 Agent 训练基础设施的一部分。大规模 Agent 训练不仅需要隔离恶意或投机行为,还要处理模型普通操作错误可能造成的系统级故障。
在这篇最新技术论文中,DSec 展示了一套面向大规模 Agent 训练的基础设施方案。从沙盒创建、环境复用,到 rollout 调度、状态保存和安全隔离,Agent 训练正在形成一套独立的基础设施需求。随着 Agent 任务持续变长、交互过程不断增加,执行环境的规模也会进一步扩大。如何让数十万个甚至更多沙盒稳定运行,同时控制资源成本和安全风险,将成为 Agent 训练继续扩展需要解决的问题。
