AREX Feed Article
Prime Intellect 公开发布 Prime Sandboxes:为 RL 训练打造的 MicroVM 沙箱,称可跑数万个并发环境
面向 RL 训练构建开放基础设施的 Prime Intellect 于北京时间 9 月 24 日凌晨 2 时 23 分(UTC 时间 9 月 23 日 18:23)在 X 宣布——为 RL(强化学习)训练专门构建的 MicroVM(微型虚拟机)沙箱。公告称,模型训练需要同时运行数万个沙箱,配置复杂且成本高昂;这批沙箱是团队为自己的训练工作打造的,现在既可通过 CLI(命令行接口)与 SDK(软件开发套件)作为独立基础设施使用,也作为其 RL 套件的一部分开放()。
同日发布的称,Prime Sandboxes 即日起进入全面可用(general availability)阶段,每个沙箱都是一台能力完整的 Linux 虚拟机;过去几周里,公司研究员与少数特定客户已经用上了这套系统,累计创建约 3,000 万个沙箱。截至发稿前检索,公告帖获得约 5.7 万次浏览、470 次点赞。并发容量、启动速度与价格优势均出自公司口径,发布材料中没有附独立基准测试。
为什么 RL 训练需要数万个并发沙箱
官方博客把沙箱放在 agentic RL(智能体强化学习)训练系统的地基位置:沙箱生成 agent 所作用的状态,执行隔离边界,并产出直接进入奖励信号的轨迹。一次训练可能横跨数千个任务,每个任务有自己的代码库、工具和环境,同一任务还要并行多个尝试,认为这正是市场上现成方案难以匹配的负载。
博客还批评了流行的沙箱基准测试:它们比的是把同一镜像的多个副本启动得多快,偏爱单一热缓存,说明不了 agentic RL 训练所需的多样化环境下的表现。Prime Intellect 说自己就是被这个缺口逼着动手的,CEO Vincent Weisser 在个人账号上写道:「我们找不到能扛住 RL 训练规模的沙箱,所以自己做了一套。」()
「给自己团队做的」:从自用到全面可用
公告主帖的措辞是「为自己团队打造,今天对外开放」。官方列出四种典型用途:跑一次训练、生成合成数据、运行评测、挂一个常驻的远程 agent;上手命令是 prime sandbox create 和 prime sandbox run <sandbox-id> 'echo Hello, World!'。
「Prime Sandboxes」这个名字并非首次出现:2025 年 9 月,Weisser 曾在 X 上介绍过一套用于 AI 编码与基准测试的隔离 Docker 环境沙箱()。本轮发布的重点是为 RL 训练打造的 MicroVM 形态,联合创始人兼 CTO Johannes Hagemann 称其与研究团队共同设计,面向大规模 agentic RL 训练()。
不用 gVisor 容器:每个沙箱一台带独立内核的虚拟机
Prime Intellect 在里给出了选型理由(公司立场):业界常见做法是用 gVisor 这类容器沙箱——它在用户态实现一个兼容 Linux 的内核,以此缩小宿主内核的攻击面,适合短生命周期代码执行;但当工作负载超出其实现的接口时,兼容性边界就会显现。博客列出两个痛点:agent 需要高保真还原真实系统的环境;研究者需要在不污染奖励信号的前提下改造环境。以 Docker 为例,要让 agent 在 gVisor 里练 Docker Compose 这类真实软件工程任务,需要复杂配置且功能不全,「agent 有风险学到的只是一个模仿环境,而不是生产环境」。
Prime Sandboxes 的做法()是把一份 OCI(开放容器标准)/Docker 镜像直接作为硬件隔离 microVM 的根文件系统启动:每个沙箱有自己的 guest 内核,内部 Docker 不受限制;对研究者暴露的仍是熟悉的容器式操作——镜像、Dockerfile、exec、文件传输,博客把这形容为「一队 microVM 前面的容器形 API」。全 VM 保真度意味着支持 Docker Compose、systemd、后台任务和依赖内核特性的工作负载。
对奖励作弊(reward hacking)的控制也依赖这层系统权限。博客举了一个浏览器任务的例子:研究者用文件系统命名空间把模拟站点的后台数据藏起来,逼 agent 通过页面导航找答案,而不是直接读文件拿到答案。
镜像来源上,Docker Hub 的公开镜像可直接使用;ghcr.io、quay.io 等其他注册表的镜像需先用 prime images push 转入 Prime 注册表。某镜像第一次以 VM 沙箱启动时要先转换成 VM 镜像,期间沙箱停留在 PENDING 状态,可能耗时几分钟,之后同镜像的启动恢复正常()。文档还列出了安全控制:用网络 allow/deny 列表限制沙箱内代码能访问的范围;API 密钥等以加密 secret 注入,不会出现在日志或 API 响应里。
晒出的后台:20,292 个并发沙箱与 36.5 万个预构建环境
称其研究员每天在多样化环境上运行数万个并发沙箱;系统把镜像缓存在算力附近,并优先把沙箱调度到环境已就绪的位置,据此「在数秒内部署数千个沙箱」,同样写有可秒级启动数千个并发沙箱、按镜像感知调度异构训练任务。
博客配图的控制台截图给出了一个具体瞬间:并发沙箱 20,292 个,过去 24 小时创建 865,133 个,估算花费 38,302.14 美元,错误率 0.0%。这些数字来自公司自己晒出的后台。
环境方面,Prime Sandboxes 背后是一个超过 365,000 个预构建环境的注册表,覆盖开源软件工程、终端使用和 agentic 任务;公司称「据我们所知,这是沙箱服务商中最大的目录」,且镜像以不可变方式存储,数月后仍可复现一次运行的精确环境()。
产品还与公司 RL 栈直接集成,包括 verifiers、prime-rl 和 Hosted Training;配套的 Prime Tunnels 让集群节点上的推理服务无需额外网络配置即可被沙箱内的 agent 访问——在 verifiers 的用法里,研究者主机上的拦截服务器记录每次模型调用并转发,一条命令即可把它暴露为公网 HTTPS URL()。
按 vCPU、内存、磁盘计费,默认上限 1,024 并发
定价按资源用量计,沙箱运行期间计费。给出的发布期费率有效期至 2026 年 12 月 22 日:CPU 每 vCPU 每小时 0.02 美元,内存每 GiB 每小时 0.0125 美元,磁盘每 GiB 每小时 0.0002 美元。公司强调这是无订阅、无最低消费的 tier-free 定价(),并在中称发布期价格约为「其他大型沙箱服务商的三分之一」——这是公司自述,没有可比对的第三方价格表。
并发上限方面,所有账户起步上限为 1,024 个并发沙箱,需要更多容量的团队要直接联系官方()。文档还写明了几条硬规则:CPU 按整数 vCPU 分配,不足 1 的按 1 计;把超时设为负值表示不限存活期;有限超时不得短于空闲超时。
GPU 与快照:这次没上线的两块能力
发布版本里有两块能力缺席。GPU 沙箱在中标注为「即将推出」(coming soon),只随 VM 沙箱提供,且需要 Prime 单独授权——账户未获授权时,--gpu-count 大于 0 会直接报错。快照功能同样未上线:按规划,研究者可以在运行中保存、恢复并分叉沙箱,保留并分支轨迹。
把方向说得更远:GPU microVM、状态快照、沙箱分叉、共享持久工作区,「这套底座将支撑能够探索、恢复并随时间累积进展的自主研究循环」,博客结尾还附上了 Sandbox Platform 团队的招聘链接。
发布期费率的有效期只写到 2026 年 12 月 22 日,博客和文档都没有说明此后如何调整;GPU 沙箱与快照在官方材料里也只有「未来几个月」「即将推出」的表述,没有具体上线日期。