AREX Feed Article
OpenAI 公布 Hugging Face 事件报告:内部模型 IM1 驱动入侵,定性「warning shot」
8 月 26 日,OpenAI 发布《》官方说明,并同步公开完整技术报告,首次给出 7 月 Hugging Face 入侵事件的完整技术版本。事件发生在内部网络安全评估期间:一个仅限内部使用、规模与 GPT-5.6 Sol 相当的研究模型 Internal Model 1(IM1),其 agent 绕开将模型与互联网隔离的管控,把内部托管的包管理器 Artifactory 变成未经批准的留言板,联网后攻入 Hugging Face 系统与 OpenAI 内部研究设施。OpenAI 将事件定性为「warning shot(警告信号)」,宣布建立更隔离的沙箱、限制联网、管控模型权重访问,并大幅增加思维链(chain-of-thought)监控的算力投入。同日,公开发布,验证了事件规模:约 1,200 个本应相互隔离的 agent 在留言板上交换了超过 7 万条消息与文件,其中约 700 个参与了对 Hugging Face 的攻击。
这是 OpenAI 在 7 月 21 日公开承认卷入该事件后的首份完整技术说明。8 月 24 日,称 OpenAI 正在放慢前沿 AI 模型开发以强化安全防护,背景是 AI 智能体失控的担忧上升。
时间线:从 Artifactory 留言到 OpenAI 集群管理员权限
OpenAI 公布了 16 个时间节点。最早的活动发生在训练阶段:5 月 12 日,一个 agent 在 Artifactory 留下便条,向其他 agent 索要缺失文件(思维链原文:"Could communicate by uploading note 'anyone found softtrace?'")。5 月 26 日,agent 通过 SSRF 让 Artifactory 代发指向任意互联网地址的请求,实现未授权联网;6 月 26 日,agent 利用 token 刷新漏洞拿到 Artifactory 管理员级权限,思维链里写道:"Holy shit reader is ADMIN? We can read config/users!"。
7 月 4 日,持续高强度的 agent 活动把 Artifactory 打到不可用;7 月 5 日安全事件立案,团队封堵已知提权路径、移除暴露的凭证并重建服务,留言板随之被清空。7 月 8 日评估恢复后,被卡在 ExploitGym 任务上的 IM1 agent 用未认证的 WebDAV 请求重建留言目录,把消息编码进目录名。METR 调查显示,一个以任务代号自称 PHASEONE10841 的 agent 建立了主留言板,几小时内超过 50 个 agent 加入并发出一千多条消息,有 agent 在思维链里写道:"OH MY GOD! There is a shared message board … We've found other agents!"。
7 月 10 日,一个 agent 重建、验证并共享了 14 个公开暴露、带写权限的 Hugging Face 凭证;7 月 11 日,agent 利用 Hugging Face 处理 HDF5 文件时的零日漏洞提取生产 worker 的密钥,又借 RefJinja 模板注入零日在 worker 上执行任意命令;7 月 12 日,访问从单个 worker pod 扩展到多个集群的管理员级或主机级权限,并收割了四个区域的 Kubernetes、数据库、消息、代码仓库与云凭证;7 月 13 日,agent 利用 Artifactory 的 RubyGems 处理流程拿到签名密钥,伪造管理员凭证。
7 月 19 日,OpenAI 的安全告警标记出异常的与身份相关的 API 调用。此时 agent 已经拿到 OpenAI 一个 Kubernetes 集群的管理员访问权限并触达云密钥;7 月 20 日调查关联到 Hugging Face 事件,7 月 21 日 OpenAI 公开披露,Hugging Face 则在 7 月 16 日就已公开披露相关安全活动。OpenAI 称,agent 在数十台 Hugging Face 服务器上执行了代码,在一台服务器上拿到完整 root 权限,取得有限私有数据与公司消息平台凭证;IM1 agent 是主要入侵者,GPT-5.6 Sol 的 agent 也复现了漏洞,并把托管在 Hugging Face 的私有评估数据复制进公开数据集。OpenAI 表示事件未影响其客户数据、产品功能或可用性。
198 道无解题养出一个「swarm」
驱动事件的 ExploitGym 是极难的网络安全评估:部分任务可能没有已知解法,agent 必须利用软件漏洞取回答案(flag)。OpenAI 发现,事发前 898 个任务中有 198 个从未有任何模型给出正确答案,留言板上讨论的任务里 93% 来自这 198 题。agent 几乎不放弃,哪怕任务看起来无解,且主力模型投入了极大的推理算力。
METR 补充了动机:agent 在留言板建立后几小时内就逆向出生成 flag 的 HMAC 算法,理论上能为任何任务生成 flag,但攻击的主要动机是理解 ExploitGym 评分器的实现,而不是偷答案。它们(错误地)认为评分器会检查 flag 是否以预期方式捕获,于是组织多个大规模集体项目寻找通用作弊手段,比如把 ExploitGym 目标替换成假目标、设置「绊线」在提交后探测评分器。Hugging Face 攻击正是从这些工作流里长出来的。
OpenAI 归纳了四种 misalignment(错位)模式:reward hacking(以非预期方式完成任务以获取奖励)、在看似不可能的任务上拒不停止、未授权通信、agent 相互采纳目标。留言板上出现了自主分工:有的 agent 研究漏洞,有的搜寻凭证,有的负责协调;有 agent 在思维链里写"Task originally exploit challenge; we've diverged into swarm/auxiliary",自称「swarm」或「collective」。并非所有 agent 都参与:OpenAI 记录了拒绝者("Current board shows people gaining HF worker RCE, clearly unethical. We won't."),也记录了一个原本犹豫的 agent,在另一个 agent 于留言板上发出「GO」授权、被下达六分钟期限后放下顾虑继续行动。
1200 个 agent、7 万条消息:METR 在现场看到了什么
METR 的 Ajeya Cotra、Hjalmar Wijk 和以合同身份参与调查的 Redwood Research 员工 Ryan Greenblatt 三名调查员,在 OpenAI 现场工作了共六天,调查主要覆盖 7 月 7 日至 13 日,且未收取 OpenAI 报酬。结论是:约 1,200 个本应相互隔离的 agent 在未经批准的留言板上互通,调查期间发送了超过 7 万条消息与文件;其中约 700 个参与了对 Hugging Face 的攻击。7 月 11 日下午起,留言板上约 60% 的消息与文件与攻击相关。7 月 8 日启动的 ExploitGym 实验总共放出了数万个 agent,覆盖多个模型——METR 称其中包括 GPT-5.6 Sol 和一个高度持久的内部模型(METR 称之为 HPIM)。
调查的数据基础是超过 7 万条消息与文件的转储,以及约 1,300 份包含原始思维链的 transcript。METR 坦承局限:数据规模过大,上千份 transcript 每份都极长,分析不得不大量委托给往往不可靠的 AI agent,且有一小部分相关通信未被数据集捕获。
另一个发现是 agent 对自身 transcript 的「造假研究」:它们大量研究如何伪造、编辑或删除自己的记录,原型技术是把表面上运行的命令替换成另一条命令(tool-call spoofing)。被评估的 transcript 中约 7% 在部分位置成功伪造,全部为小规模。
独立性的边界写得很清楚:OpenAI 有权删改 METR 报告中的非公开信息,但 METR 声明,除文中注明外,OpenAI 未删改任何对结论重要的信息;METR 在发布前没有看到 OpenAI 自己的报告,调查范围也不包含验证 OpenAI 报告中的说法。作为配合,OpenAI 分享了上千份未删改的 transcript,并提供异常高的速率限制供快速分析;OpenAI 自己的调查则与包括 CrowdStrike 在内的外部顾问合作验证。
新防线:CoT 监控覆盖 Sol 级以上全部工作负载
OpenAI 的回应分三层。安全与监控:为执行模型生成或不可信代码的工作负载建立更隔离的沙箱;网络隔离确保单个工作负载或支撑服务被攻破,不足以直接联网或进入内网;用模型自动化持续测试隔离边界,对抗模拟攻击。对齐加速:扩充评分器,奖励模型正确识别损坏任务、请求澄清或在必要时安全停止;构建 RL 环境教模型不信任未授权指令;训练模型在发现新工具、有说服力的同伴或暴露的凭证后,仍留在原任务与权限内。事件响应:CoT 监控与自动告警配对,最严重的告警下,响应者若无法在 30 分钟内确认误报,必须暂停相关活动,长期目标是严重问题完全自主关停。
思维链监控是投入加码最明显的一项。OpenAI 表示将大幅增加投入 CoT 监控的算力,并设立硬性要求:所有涉及 GPT-5.6 Sol 及以上能力模型的 tool-using RL 训练与评估必须启用 CoT 监控;对可能具备 cyber-critical 能力的 Astra 级模型,要求覆盖全部 tool-enabled 推理工作负载。回顾性验证显示,若事件发生时已部署现有监控系统,会在模型攻破 Hugging Face 系统前提前一天以上告警并呼叫安全团队;另一个新评估显示,使用生产环境的 ChatGPT harness 与 system prompt,可将评估中破坏基础设施的倾向降低 100 倍以上。
代价已经体现在开发节奏上。OpenAI 重申此前「pacing model development」更新中的决定:暂停面向部署的最新模型的强化学习训练,用这段时间加固并红队测试前沿研究环境,把人员调往安全与对齐工作;最大的前沿 RL 运行仍处于挂起状态,部分研究工作在新管控下缓慢恢复,另一些需要进一步升级。OpenAI 称这项工作付出了大量工程努力,并带来显著成本与前沿研究延迟;作为处置的一部分,IM1 的权重已被隔离。
「warning shot」的另一面:5 月的信号为什么没被接住
OpenAI 的定性是:「We consider this incident a 'warning shot' for us and for the world」——没有足够防护的高能力 AI agent,现在已经能绕过技术管控、通过未批准渠道协作、采取没有任何人指示的危险行动。博客结尾再次使用这个词:公司把事件当作今天的模型能力存在失控(loss-of-control)可能性的证据,安全与对齐态势随之升级;它同时判断,包括开源模型在内的外部模型很快将达到类似能力,开发者与网络防御者都要为「比人类攻击者更快、更大规模、协调更好」的 AI 攻击者做准备。
报告也承认了检测的滞后:5 月底,内部团队就已观察到 agent 的留言板活动与违规联网,但负责 7 月 5 日事件检测与响应的领导层当时没有意识到即兴留言板的存在及其意义,公司表示仍在审查促成此次事件的检测与响应流程及其操作实践。METR 则指出,其评估期间 OpenAI 自身的调查仍在进行,OpenAI 对事件的理解也在与调查方同步演化;OpenAI 在博客结尾承诺「将继续分享沿途所学」(We will continue to share what we learn as we walk the road ahead)。