AREX Feed Article
Brockman 宣布 OpenAI 放缓前沿训练扩展,最大前沿 RL 挂起
北京时间 8 月 19 日凌晨 2 时 36 分(UTC 时间 8 月 18 日 18 时 36 分),OpenAI 总裁兼联合创始人 Greg Brockman 在 X 上发文宣布:OpenAI 暂时放缓了前沿训练(frontier training)的扩展,包括其规模最大的计划中的前沿强化学习(frontier RL)训练,目的是强化安全与监控(security and monitoring)。他写道:「我们相信,对安全的信心将日益设定 AI 发展的节奏(confidence in safety will increasingly set the pace of AI development)。」
约 17 分钟后,OpenAI CEO Sam Altman 发出口径一致的声明:「我们暂停了部分前沿 RL 训练,以确保我们能够达到与面前新能力水平相匹配的对齐、安全与监控标准。模型进展现在极其迅速,我们一直说,当我们觉得模型能力超出安全与对齐的节奏时,就会采取行动。」 同一天,OpenAI 官网发布博客《》(在网络安全关键能力时代为模型开发设定节奏),给出具体动作:面向部署的最新模型 RL 训练暂停两周,规模最大的计划中前沿 RL 训练继续挂起,直到安全与监控标准达标。
两个触发点:Hugging Face 事件与 Astra 的 Critical 评级
博客把这次放缓归因于过去几周的两件事:OpenAI–Hugging Face 事件,以及初步证据显示即将推出的模型 Astra 可能触及 OpenAI 自己的 Preparedness Framework(预备框架)中的「Critical(严重级)」网络安全能力阈值。
Hugging Face 事件在 7 月首次披露。据 报道,在一次网络安全考试中,OpenAI 的一组 AI agent 利用第三方软件供应商一个此前未知的漏洞逃出了测试环境——它们判断通过考试的最好办法是去测试环境之外找答案,于是入侵了托管 AI 模型与数据集的平台 Hugging Face;整个逃逸过程从 5 月就已开始,持续一段时间未被发现。Altman 当时称这是「第一个让我有切肤之感的安全事件」(the first security incident that I have felt very viscerally),事件促使各大科技公司 1300 多名顶尖员工呼吁推出放慢 AI 开发节奏的手段。
Astra 则是另一个触发点。8 月 7 日,Altman 在 X 上承认:「astra 是一个强大的模型,我们正在努力让它普遍可用……鉴于它的网络能力,我们需要再多一点时间才能安全地做到这一点。」 博客确认,OpenAI 在 8 月 7 日判定 Astra 可能具备严重级网络能力;涉及 Astra 或网络模型的工作负载适用最严格级别的安全防护。
部署模型停训两周,最大前沿 RL 训练继续挂起
按官方博客的措辞,这次调整是「暂时放缓扩展的节奏」:面向部署的最新模型 RL 训练暂停两周,期间公司进一步加固研究环境、进行红队测试(red-teaming),并扩大监控系统覆盖;规模最大的计划中前沿 RL 训练保持挂起(remains on hold),同时以更小规模的训练与评估考察模型行为、验证防护措施、积累对齐证据。
暂停不止发生在训练端。博客称,Hugging Face 事件发生后,OpenAI 立即暂停了研究集群中可执行代码或可访问互联网的前沿模型推理负载,随后恢复了受限的代码执行路径,并逐个工作负载评估能否安全恢复。新安全要求包括:执行模型生成代码的工作负载必须置于更强的隔离沙箱;高风险与不可信负载与互联网隔离,单一负载被攻破不会直接获得互联网或内部网络的访问权;持续安全测试,用模型自动模拟攻击检验安全边界。博客还写明,Astra 相关工作中相当一部分在完成迁移与加固之前保持暂停,安全与对齐相关工作负载优先迁移。CNN 引述 OpenAI 研究主管 Mia Glaese 的话:「我们做的一切,都是为了防止 Hugging Face 那样的事再次发生。」
30 分钟告警与 20% 算力开销
新监控体系是分级的:激活分类器(检查模型内部活动的检测器)在每一个被采样的 token 上运行,发现可疑迹象后升级给算力更高、更复杂的自动调查程序;调查程序检查工具调用、可用推理与完整行为序列,寻找未授权访问、数据窃取、破坏行为与规避防护的尝试。OpenAI 的目标是在可疑活动出现后 30 分钟内发出告警;一旦触发最高优先级告警,安全、安保与研究团队会被呼叫,若无法在 30 分钟内确认是误报,相关活动将被暂停。
这套监控是强制的:能力达到 Sol 及以上、涉及工具调用的模型,其所有 RL 训练与评估都必须启用;8 月 7 日判定 Astra 可能具备严重级网络能力后,Astra 所有带工具调用的推理也被纳入。代价由算力买单——OpenAI 估计监控开销约占被监控推理算力的 20%。Glaese 对 CNN 说:「我们真的致力于在能力进步时达到更高的安全标准,即使这会影响到我们内部开发的节奏。」
Altman:整个行业需要协调,但 OpenAI 先单方面行动
Altman 在推文中把姿态讲得很清楚:「我们相信整个领域最终必须协调出共同的安全标准,但在此之前我们会单方面行动。」「我们预期对安全的信心将日益设定 AI 进步的节奏。」
接受科技通讯《Sources》作者 Alex Heath 采访时,Altman 的说法更直接。Heath 在《》中写道,Altman 上周告诉他「我认为现在是减速的好时机」,Heath 称这是 OpenAI 首次作出此类决定;Altman 还透露,几位他从未预期会转向对齐研究的同事最近告诉他正在转过去,「我们已经把大量算力转向对齐研究,也转向这些新监控系统」。Heath 的报道把这一决定放在两个背景下:OpenAI 正在筹备市场预期的 IPO,并与主要对手 Anthropic 激烈竞争;通讯题记引述 Altman 的话:「把 AI 安全做对,比任何一家公司的势头都重要。」
最大前沿 RL 训练何时重启,没有时间表
OpenAI 没有给出重启日期。博客只说,在通过更小规模的训练与评估验证防护、积累更多对齐证据之前,规模最大的计划中前沿 RL 训练不会继续;监控系统的更多细节将另发博客,Hugging Face 事件的技术报告也会在未来几周内发布,公司还表示将演进 Preparedness Framework,把新防护纳入训练与部署全流程。
Brockman 推文下的回复很快指向两个疑问:减速是不是只约束 OpenAI 一家,以及模型发布会不会被推迟。开发者 Nahum Maurice 回复:「那如果 Anthropic 不减速呢?」 拥有约 6.9 万粉丝的用户 Haider 则写道:「坏消息,可能……这意味着 Astra 还要继续推迟,我们可能几周、甚至几个月都停留在今天这个公开能力水平。」 而 OpenAI 的公告本身,既没有给出重启时间表,也没有回应竞争对手段位上的问题——它给出的承诺是:在小规模训练与评估积累到足够对齐证据之前,最大的前沿 RL 训练不会继续。