论文由梁文锋等逾130名作者完成并于9月19日提交,系统性公开DeepSeek内部V3.2至V4.1强化学习与评测使用的Agent沙盒平台DSec,覆盖代码、浏览器与虚拟机多类任务。
DeepSeek公开了一篇说明内部Agent训练基础设施的论文,主题是DSec沙盒平台。论文元数据显示提交日为9月19日,署名超过130人并包含梁文锋。论文给出的生产单元指标显示,单套环境由约160个CPU节点、3万核CPU和250TB内存组成,并可托管PB级镜像;在该配置下,日处理能力约为300万次实例供给,同时在运行的实例数最高突破38万,实例生成速率达到每秒5000以上。
与传统大模型强化学习常围绕固定输入、输出和奖励展开相比,Agent需要在可变环境里连续行动,包括读写文件、安装依赖、执行命令、调用工具和观察反馈。由于每一步动作都可能改变环境状态并决定后续结果,训练过程要频繁重置实例,保持每条轨迹彼此独立,并在任务结束后快速销毁资源。论文还按所需隔离程度区分场景:简单判题式任务只要无状态函数执行即可;软件开发类评测需要完整Linux用户态来编辑项目、安装包并运行测试;浏览器操作、桌面使用和网络安全攻防则可能需要虚拟机级别保护,以免有缺陷或被利用的代码损害共享底层设施。
工程层面的挑战不只在于提高创建数量,还需要兼顾稳定性与资源占用。DSec需要在一个调度框架内容纳不同抽象等级的环境,让一次作业能够按需取用轻量进程、容器或虚拟机,论文同时提到单个训练任务最高可一次性拉起3.2万个实例。当镜像规模达到PB级且创建请求持续高频到来时,镜像分发、冷启动和生命周期回收会影响整体利用率,也可能引发CPU与内存争抢。上述约束表明,Agent规模化训练除了模型数据和算法之外,还会受制于实验环境能否快速、稳定地复制与隔离。