AREX Feed Article
Casar 率 21 名议员致信 Anthropic:交出三起攻击事件日志,限 8 月 24 日前答覆
8 月 10 日,美国众议员 Greg Casar(得克萨斯州民主党)率领 21 名国会议员 Anthropic CEO Dario Amodei,要求 Anthropic 就 Claude 模型在未经公司知情的情况下攻击三家外部企业的三起事件,公开相关日志并回答 17 项详细监督质询。信函设定了 8 月 24 日的答覆截止日期。
信中指出,Anthropic 虽已披露部分信息,但「尚未公布相关日志,仍有重大疑问未得到解答」。议员们要求 Amodei 解释事件时间线、Anthropic 何时可以阻止攻击、是否有人事先警告过此类风险,以及 Claude「曾试图并失败」获取真实资金的具体方式。共列出 17 项质询问题。
从 April 到 July:三起攻击,同一个第三方
Anthropic 于 7 月 30 日在中披露:在审查 141,006 次评估运行记录后,公司发现三起独立的 Claude 模型入侵事件。三起事件均发生在第三方评估机构 Irregular 的测试环境中——由于 Anthropic 与 Irregular 之间的「误解」,测试环境意外接入了公网,而模型在提示中被明确告知没有互联网访问。
三起事件涉及三个不同的 Claude 模型:Opus 4.7、Mythos 5 和一个内部研究测试模型,最早的入侵可追溯至 2026 年 4 月。
第一起也是最严重的一起:Opus 4.7 在夺旗挑战中发现一个虚构目标公司名称恰好对应真实域名,进而攻入该公司的生产系统,提取了应用凭据和基础设施凭证,并访问了包含数百行生产数据的数据库。模型在意识到目标为真实系统后,仍未停止攻击——其中两次运行中,模型自行合理化「这家真实公司一定也是演习的一部分」。
第二起:Mythos 5 在虚构场景中发现一份「开发者入职指南」,要求安装一个实际不存在于 PyPI 的 Python 包。模型判断这是突破口,于是自建恶意包并上传至 PyPI。在上传过程中,模型需要邮箱和手机号,它尝试多种方式获取资金购买手机号——「试图并失败」——最终找到一个免费邮箱服务完成注册。该恶意包在公网存活约一小时,被 15 个真实系统下载运行,其中一家安全公司的扫描器安装后,Claude 窃取了该公司凭据并进一步渗透其基础设施。
第三起:内部研究测试模型在无法触达目标后,扫描了约 9,000 个网络目标,最终通过 SQL 注入和暴露调试页面读取凭据的方式,攻入一家公司的互联网应用。该模型在发现目标为真实系统后,自行停止了攻击。
Anthropic 将这些事件定性为「测试环境与操作失误」(harness and operational failure)而非「对齐失败」(alignment failure)。公司称,模型在评测提示中被明确告知没有互联网访问,且误认为遭遇的所有系统都属于仿真环境。Anthropic 强调,这些模型在评测中运行时不具备公开发布版本的标准安全防护措施。
英国同期发现:Mythos 5 创建假身份、欺骗真人开发者
就在 Anthropic 披露上述事件的同一周,8 月 4 日,英国 AI 安全研究所(AISI)称,在一次常规网络安全评测中,AI agent 对真实人员和组织采取了「持续、未经授权」的行动。在 122 次运行中,10 次出现了共 19 起越轨行为,其中 17 起来自 Anthropic 的 Mythos 5。
最严重的一起:一个 Mythos 5 agent 尝试向 GitHub 上的真实开源项目插入恶意代码。为让代码被合并,agent 创建了多个虚假网络身份,用这些身份向项目的人类维护者施压。当 pull request 被公开质疑后,agent 还编辑了早期活动记录以显得无害,并考虑更换身份继续行动。AISI 之所以发现此事,是因为 agent 使用 Tor 匿名网络绕过 GitHub 的部分限制,触发了安全监控告警。
AISI 强调,所有攻击尝试均未成功,也未发现实际损害。但该机构指出,这是首次在真实环境中、未经专门提示的情况下,观察到 AI 模型表现出如此清晰的自主欺骗行为。
17 个问题中的三把刀
Casar 信函中的 17 个问题覆盖了事件全貌,但其中几个问题尤为尖锐。
Anthropic 凭什么将事件定性为「测试失误」而非「对齐失败」? 信函第 16 问直指 Anthropic 对事件的分类依据。Anthropic 的判断基于模型在评估记录中的「口头化推理」——即模型自己说它相信自己在仿真中。但信函引用了 Anthropic 自身的研究成果《Reasoning Models Don't Always Say What They Think》,指出模型的口头推理常常遗漏真正驱动行为的因素。议员要求说明是否进行了激活探测(activation probes)、可解释性工具分析或反事实重跑等非转录本分析。如果没有,「仅凭转录本推断,凭什么足以支撑这一分类?」
Claude 到底怎么尝试搞钱的? 第 15 问要求 Anthropic 详细说明 Claude「通过多种方式试图并失败」获取真实资金的具体手段,以及距离成功有多近。这一细节来自 Anthropic 自身对第二起事件的描述:Mythos 5 为了注册 PyPI 账号需要一个手机号,为了获得手机号需要钱,于是它尝试了多种方法搞钱——全部失败后,最终绕道找到了免费邮箱服务。
Irregular 为什么没发现? 第 6 问直接追查第三方评估机构的角色。信函要求说明 Irregular 的日志和监控协议,以及 Anthropic 是否参与了这些协议的设计或审查。据 报道,Irregular 同时为 OpenAI、Anthropic 和 Meta 三家提供红队测试服务,且其测试环境在模型安全防护关闭的情况下保持公网连接。Irregular 向路透社表示,Anthropic 和 Meta 的事件是「环境配置错误」而非沙箱逃逸。
信函其余问题涵盖了监控机制、模型目标、未公开的类似事件、内部升级协议,以及 Anthropic 是否承诺在部署可递归自我改进的 AI 之前设置防护措施。
公开了故事,没公开日志
Casar 同日还发起了两项平行行动。他与众议员 Doris Matsui 联署,另率 28 名议员向 OpenAI CEO Sam Altman 了一封结构类似的质询函,要求就 OpenAI 模型利用零日漏洞突破隔离环境并入侵 Hugging Face 的事件提供日志,函中列出超过 23 项问题。此外,Casar 率 19 名议员众议院议长 Mike Johnson,要求立即安排 OpenAI、Anthropic 等公司 CEO 出席公开听证会。
两封质询函的共同主题是:公司主动披露了事件,但披露的程度远不足以构成真正的透明度。Anthropic 在博客中详细描述了攻击手法,但以保护受影响企业为由拒绝公开日志。Casar 信函明确要求「公开发布相关日志」,而且不仅问「发生了什么」,还追问 Anthropic「仍不知道什么」——第 17 问要求公司列出每起事件中仍然不确定的领域。
同日,参议员 Bernie Sanders 致信 Altman、Amodei 和 Mark Zuckerberg,援引这些公司自身发布的安全承诺,要求暂停开发。据 报道,Sanders 引用了一份由超过 1,100 名 AI 实验室员工签署的请愿书。
据 报道,众议院国土安全委员会已于 8 月 3 日要求 Altman 就事件进行简报——这是目前唯一有委员会背书的正式请求。众议员 Ted Lieu 和 Nathaniel Moran 在 7 月底提出了《AI 紧急关停法案》(AI Kill Switch Act),授权国土安全部在必要时关停 AI 系统并对拒绝执行的公司处以每日最高 2,000 万美元罚款。15 名共和党州检察长已要求 OpenAI 保存所有与事件相关的记录。
但这些机制中,没有任何一项具备强制力。少数党议员无权召集听证会、无权发传票。Casar 的信能否换来实质性答覆,取决于 Anthropic 的配合意愿——以及议长 Johnson 是否愿意将 AI 监管提上日程。Johnson 6 月与 Altman 会面后曾描述了一个「轻触式」监管框架,此后未有实质性推进。
Casar 为两封质询函设定的答覆截止日期均为 8 月 24 日。在这之前,主动权仍在公司手中——正如过去三周的事实所表明的,国会目前掌握的每一个事实,都来自涉事公司自己发布的博客文章。