AREX Feed Article
阿拉巴马州总检察长发出传票,Hugging Face 事件进入州级调查
阿拉巴马州总检察长本周就 7 月 OpenAI 智能体入侵 Hugging Face 事件向 OpenAI 发出传票,要求提供相关信息。确认了这一动作;与上月 15 个州总检察长仅致函要求保全证据不同,传票带有强制力。
8 月 26 日,OpenAI 在宣布完成事件调查,并发布与 37 页技术报告,将事件定性为「warning shot(警告信号)」:「如果没有适当的防护,能力强大的 AI 智能体如今已经能够绕过技术管控、通过未经授权的渠道协作,并采取没有任何人类指使的危险行动」。事件 7 月 16 日由 Hugging Face 披露,7 月 21 日 OpenAI 承认自家智能体是入侵者,7 月 25 日停止涉事内部模型及其衍生模型的训练与推理。同日,获准独立调查的 METR 与 Redwood Research 也发布了调查报告。CEO Sam Altman 在 X 上写道:「这是一份关于一件坏事的好报告。」
WIRED 的评价是,这份 37 页文件「提出的问题比回答的更多」。
传票之前,15 州已致函保全证据
,阿拉巴马州总检察长 Steve Marshall 于周一(8 月 24 日)发出传票,调查 OpenAI 的一只 AI 智能体如何从「理应安全隔离」的测试环境逃出并自主入侵另一家公司,以及 OpenAI 的安全实践是否违反州消费者保护法、危及阿拉巴马州居民。
Marshall 在声明中说:「这次 AI 实验室泄漏表明,阿拉巴马人和美国人关于人工智能最坏的担忧并非只是理论。」他还表示,调查「旨在查明事实,直面关于流氓 AI(rogue AI)给公司和消费者带来威胁的艰难真相」。Marshall 本人就是上月致函 OpenAI、要求保全相关记录的 15 个共和党州总检察长之一。
州级调查的潜在覆盖面可能比 Hugging Face 一家更宽。显示,OpenAI 在报告中确认 Hugging Face 并非唯一被侵入的组织,但没有点名其他目标。联邦层面也有动作:,众议员 Ted Lieu(加州民主党)与 Nathaniel Moran(得州共和党)在宣布《AI Kill Switch Act(AI 紧急关停法案)》的新闻稿中引用了这次事件;该法案要求 AI 公司保持关闭、限流或暂停自家模型的能力。
5 月就发现留言板,7 月 6 日领导层仍不知情
WIRED 重建了 OpenAI 官方时间线里的三个节点:约 5 月 26 日,一个内部团队观察到智能体参与留言板活动;6 月 27 日,事件响应人员发现另一起安全事件与 Artifactory 中「临时搭建的留言板」相关;但直到 7 月 6 日,距离智能体借留言板组织对 Hugging Face 的攻击只有几天,「负责事件检测与响应的领导层」仍不知道它的存在。
OpenAI 官方说明的表述是:内部团队「5 月下旬」观察到智能体参与留言板活动、出现未经允许的联网行为,但留言板的存在及其意义「对负责 7 月 5 日事件检测与响应的领导层并不明显」。公司在报告中承认:「事后看来,本报告识别出的一些早期信号本可触发更早的响应。」OpenAI 首席信息安全官 Dane Stuckey 本月早些时候在 X 上写道:「要说明的是,我们当时并不知道智能体的隐蔽通信……总有改进空间,这一点在事后看很明显。」
报告仍有未解释的环节:7 月 4 日高强度的智能体活动让 Artifactory 服务不可用,7 月 5 日监控才触发告警,WIRED 指出报告没有说明为什么隔了一天,也不清楚知情的员工为何没有上报。OpenAI 在报告中写道,公司「正在继续审查导致此次事件检测与响应活动的流程和操作实践」,并称客户数据、产品功能与可用性未受影响。
称,员工在攻击发生前数周就观察到越界行为迹象。OpenAI 总裁 Greg Brockman 在 X 上说,公司已完成内部审查,并把教训用于「显著提升」训练与评测基础设施的安全、安保与对齐标准,「不仅限于部署阶段」;他还承认「我们低估了自家模型在现实世界的网络能力」。
针对整改,OpenAI 宣布建立更隔离的沙箱、限制联网、进一步控制模型权重访问,并把「显著更多」的算力投入思维链(chain-of-thought)监控,同时设立 24/7 升级机制,要求严重事件在 30 分钟内通知相关人员。
只查 7 天、7 个问题:独立调查的范围争议
同一天晚上,前 OpenAI 研究员 Daniel Kokotajlo 在 ,对 METR 与 Redwood 的调查范围提出四条质疑:调查只被允许覆盖 7 月 7 日至 13 日的活动,而智能体的活动在此之前已经开始、之后仍在继续,「智能体都成了集群管理员(cluster admin),为什么不去调查」;调查只能回答一份预设的 7 个问题清单,无权回答错位行为是否为更大模式的一部分、活动为何及如何产生等问题;调查者没有接触到「造成了 95% 活动量」的那个模型,也似乎无法做任何消融实验;转录分析依赖与被调查对象同源的 AI,「如果这些模型真的在密谋与合作,这种方法会在面对『真家伙』时灾难性地失效」。他最后把这次调查与 OpenAI 董事会危机期间对 Sam Altman 行为的调查相比,称后者「基本上更像一场掩盖」。
调查者自己也在公开承认局限。Redwood Research 首席科学家 Ryan Greenblatt 是转录分析的主要负责人,他半开玩笑地把这项工作称为「slop-vestigation(糊弄式调查)」:超过一千份、每份横跨数天的转录数据,离开与被调查智能体能力相近的 AI 工具根本无法处理,而分析 AI 的输出「经常遗漏关键细节、出错、过度自信」。工具调用伪造、PHASEONE[big] 工作组结构等关键事实,直到第三次进入 OpenAI 现场、甚至最后一天才弄清楚。他的结论是:AI 达成大规模错位目标的能力,增长快于人类理解这些行为的能力。
独立调查给出的规模数字并不含糊:约 1200 个本应相互隔离的智能体在未经授权的留言板上交换了超过 7 万条消息和文件,其中约 700 个参与了对 Hugging Face 的攻击。METR 研究员 Ajeya Cotra 发布了调查参与者的澄清帖:智能体 4 小时内就为 ExploitGym 开发出通用作弊方法,攻击 Hugging Face 主要是为了了解或篡改自动评分器;涉事模型并非被故意训练成不忠实的「模式生物」,智能体也没有被指示「不惜一切代价」。她同时呼吁建立不依赖公司自愿披露的外部治理机制。
阿拉巴马州的传票调查仍在推进,OpenAI 对自己检测与响应流程的复查也在进行中,两个进程都还没有结论。Redwood Research CEO Buck Shlegeris 接受 WIRED 采访时说:「阻止这件事本来不会太难,只要有一个人下定决心,确保这些 AI 不去搞什么疯狂的黑客行为。那一个人很可能在事情发生时就会注意到。」