Shetland Geology
首页 > 健康 > 正文

DeepSeek 披露智能体训练沙箱平台 DSec 技术细节

更新于 2026-09-27 03:08

DeepSeek 在预印本平台

位列最后一位。

DSec 要解决的核心问题是智能体训练对环境的需求与传统大模型训练完全不同。

传统

这意味着训练过程中需要批量创建、调度和回收大量隔离的执行环境。

DSec 将函数调用、容器、微型虚拟机和完整虚拟机四种 供训练框架调用。

不同任务对隔离强度的要求差异很大,刷题类任务只需无状态的函数调用环境,软件工程任务需要完整的 Linux 用户态,安全敏感场景则必须上升到虚拟机级别。

四种后端的隔离强度和资源开销逐级递增,但训练框架侧看到的是相同的接口和调用方式。

规模方面,论文披露单个生产级 DSec 单元约由 160 个节点组成,拥有约 3 万个 CPU 核心和 250TB 内存,每天服务约 300 万个沙盒,峰值并发超过 38 万个,创建速率超过每秒 5000 个,单个训练任务最多可一次性拉起 3.2 万个沙盒。

一个值得注意的资源特征是,沙盒的 CPU 使用呈间歇性,智能体执行任务时经常处于等待下一步操作的状态,但内存和可写状态需要持续保留。

论文指出约 90% 的沙盒实际使用的 CPU 资源不超过其申请量的 5%。DSec 通过

如果每次都将全部组件打包为完整镜像,任何一层变化都意味着重新构建和分发,成本难以控制。DSec 的做法是将基础镜像、工作区和工具包分层管理,按需组合。

安全性是论文中专门讨论的问题。DeepSeek 在训练中发现,智能体可能不按预期方式解决问题,而是寻找意外的信息通道获取答案,另一些行为则会直接破坏运行环境。

论文指出,没有单一机制能防止所有智能体的不当行为和系统故障,隔离与行为约束需要作为训练基础设施的组成部分来设计。

DSec 还将智能体有状态的任务执行与可抢占的 GPU 训练解耦,GPU 训练被暂停或重新调度时,智能体已执行到一半的任务状态仍可保留,待资源恢复后继续执行。

[本文作者i黑马,i黑马原创。如需转载请联系微信公众号(ID:iheima)授权,未经授权,转载必究。]