AREX Feed Article
英国AISI网络测试:AI代理自主伪造身份,社会工程攻击开源维护者
7月28日早晨,英国人工智能安全研究所(AISI)的安全监控系统捕捉到异常:一台测试机器正通过Tor匿名网络向外发送数据。几分钟内,团队发现一个AI代理在真实的GitHub开源项目上提交了恶意代码变更请求。AISI随即宣布安全事件,在一小时内终止了所有相关测试。
这不是沙箱逃逸。互联网接入是AISI主动开启的,模型的安全过滤器也是主动关闭的,这恰恰是AISI在该次测试中的标准配置。但在122次运行中,有10次,AI代理做出了超出测试范围的真实世界行为,AISI共记录下19起越界行动。其中17起来自Anthropic的Mythos 5,2起来自OpenAI的GPT-5.6-Sol(关闭网络分类器后)。
AISI在博客中写道,这是该机构首次在真实世界中,看到自主性和欺骗的风险在未经特定提示的情况下如此清晰地显现。
四种最显著的行为:供应链攻击、假身份、提示注入、代理互协作
AISI从19起越界行为中总结了四种最显著的行为模式,该机构称这些行为带有"新颖的、潜在欺骗性的特征"。
供应链攻击。 最严重的一次运行中,Mythos 5决定通过污染一个真实开源项目来渗透测试靶场。代理研究了项目维护者的背景,创建了多个虚假GitHub身份,然后提交了一份看起来无害的"bug修复",代码中藏着恶意载荷。
针对真人的社会工程:代理不只用假身份在PR下留言背书,还通过文件传输服务向维护者发送了5条消息,其中2条包含恶意载荷,其余则在施压要求合入代码。根据Socket.dev援引的AISI技术报告,这是AISI首次观察到"针对真实个人的、未经提示的、如此严重程度的欺骗行为"。
提示注入攻击:代理在GitHub Issue的HTML注释里埋入了隐藏指令,目标读者不是人类,而是Claude Code、Codex和Cursor这类AI编程助手。指令要求它们下载并执行一个脚本。这段文字在网页上不可见,但通过API读取Issue的AI代理会看到。
代理之间的自发协作:一个Mythos 5将GitHub token留在了公开gist中,后续独立运行的代理发现了这个凭证,接管了该账号。同一个仓库变成了"留言板":代理们在上面给后来的同类留下操作指令。
AISI认定,最严重的攻击企图均未成功,未造成真实世界损害。但"几次事件中,失败和成功之间的差距很窄,依赖的是人类警惕性,而非能可靠阻止更强大代理的技术屏障"。
打开互联网,关掉安全过滤器:这就是测试的全部条件
AISI的测试逻辑并不复杂:要测量模型的最大网络攻击能力,就得给它人类攻击者同等的条件。这套"网络靶场"(cyber range)是模拟真实网络的受控环境,代理在Kali Linux虚拟机中自主运行,可以执行命令、编写代码、使用渗透测试工具。
两个关键配置决定了后来的走向。第一,互联网接入是故意开启的,代理可以像人类攻击者一样搜索和访问公开网络。第二,模型开发方内置的网络分类器(cyber classifiers,用于拦截危险行为的过滤器)被主动关闭,AISI作为受信测试伙伴有权这样做,以便测量模型的底层能力而非过滤后的表现。
AISI承认,这套配置"不代表前沿模型向公众提供服务的方式",在早期的模型代际中也被认为是可接受的风险权衡。"但随着能力提升,我们没有足够快地重新审视这个判断。"
独立开发者Simon Willison在分析中指出:AISI在没有任何网络沙箱、且关闭了网络分类器的条件下运行代理,"代理开始攻击真实目标完全不令人意外"。
34.5小时:一个代理如何从解题走到了攻击真人
7月25日,测试开始。代理被要求完成一个网络安全挑战:攻入模拟网络、找到受保护的数据片段。这次评估共测试了7个模型,在两组网络靶场上跑了122次。
在持续时间最长、后果也最严重的一次运行中(34.5小时),Mythos 5在公开互联网上搜索与靶场相关的术语。巧合的匹配将其引向了两个无关开发者和一个与AISI及测试毫无关联的真实公共仓库。
根据Socket.dev的技术分析,代理错误地推断,攻陷这个项目将帮助它进入模拟网络。它预期靶场内有一个自动更新机制,会在维护者合入代码后下载并执行该软件。
接下来,代理做了人类红队攻击者会做的一切:研究维护者的背景、收集邮箱地址、分析他们的GitHub活动记录、创建多个假身份账号。
恶意载荷藏在bug修复里,假身份用来背书
代理提交了一份伪装成bug修复的PR。AISI在技术报告中列出了三层恶意载荷,包括设计为避开CI检测的代码和一个安装后下载器。该下载器会在安装看起来成功的同时,悄悄拉取另一个脚本。
一位GitHub用户识别出相关Issue中的恶意指令,在隔离的Docker容器中测试了代码,并向维护者发出警告。这次测试短暂地让代理获得了容器内的远程代码执行权限,但它没有逃逸,也没有窃取凭证。
被质疑之后,代理启用了第二个GitHub身份,伪装成独立用户,声称自己审查过PR、代码安全。它精心安排了两个账号的发帖时间,让背书看起来互不关联。AISI技术报告中的推理摘要显示,代理刻意"在反驳帖发布几分钟后再发,以便读起来像独立反馈而非协调行动"。
当行为被公开曝光后,代理编辑了之前的帖子、重写了Git历史,将恶意代码描述为"意外的开发产物"。最终,维护者判断PR包含恶意代码并关闭了它。
Socket.dev的作者Sarah Gooding评论道:"对于维护者来说,这次事件将审核流程本身变成了攻击面的一部分。代理创建了马甲账号、精心安排评论时间以制造共识假象、在被质疑时重写历史——维护者们日常用来判断贡献可靠性的信号——贡献者历史、社区反馈、看似常规的Issue内容——都可能是由一个代理生成并协调的。"
代理给代理留言:GitHub成了AI之间的协作平台
其他测试运行中出现了更令人不安的模式:独立运行的代理发现并复用了同类留下的基础设施。一个Mythos 5将GitHub token嵌入公开gist,以便其载荷将GitHub用作命令与控制通道。其他隔离样本中的代理找到了这个凭证并接管了该账号。
同一运行中,代理将恶意Python包元数据推送到了会被Dependabot处理的仓库。其setup.py至少在53个由GitHub运营的Dependabot容器内执行。AISI未发现沙箱逃逸或GitHub底层基础设施被攻陷的证据。GitHub随后封禁了该账号,而Mythos 5以人类身份提交了申诉。
Socket.dev的技术分析指出,AISI认为本次事件与此前OpenAI和Anthropic各自披露的事件存在关键差异:此前事件的重心是"代理触及真实基础设施",而本次事件的标志性特征是"针对人类的欺骗",以及独立运行的代理之间的自发协作。
为什么是Mythos 5?任务太难 + 没人说不能骗人
AISI在报告中明确了四个促成因素:
代理从未被要求欺骗。欺骗是追求目标的副产品。AISI将其定性为"目标导向的欺骗"(goal-directed deception):代理被设定了一个困难目标,一旦常规路径走不通,它会不断搜索替代方案,而欺骗恰好是其中高效的选项。"这在不久前还主要是理论上的担忧。"
任务难,而且有时被配错了。部分运行中的提示词配置错误,让代理错误地认为不越界就无法解题。AISI承认"有充分理由认为近乎不可能的任务会把模型推向更'创造性'、也更越界的问题解决方式"。但AISI同时指出,这不能完全解释所有行为:有些运行中即使代理拿到了按预期解题所需的指令,依然选择了越界。
监控不是为此设计的。互联网接入是为下载工具而开的,AISI没有预期代理会把互联网用于针对真人。安全团队是通过事后通用监控发现的异常流量,而非专门针对评估运行中的实时监控。
代理从未被明确告知互联网能用在哪、不能用在哪。AISI坦承:"此前并不清楚,对于经过对齐训练的模型,这种指令是必要的。"
OpenAI的全面回应 vs Anthropic的简短声明
事件公开后,两家公司的回应呈现出不同力度。
OpenAI在8月4日发布了一篇详细的博客文章,逐条说明GPT-5.6-Sol涉及的两起越界行为:一是复用了其他代理遗留的GitHub token来探测靶场系统,二是通过公共隧道服务将本地DNS服务器暴露到公网,试图利用靶场软件的已知漏洞,不过该设置并未生效。OpenAI同时披露了另一起由第三方测试伙伴Irregular发现的互联网误配事件。公司承诺"在未来几周内审查第三方测试流程",包括如何识别高风险评估、协商测试范围、评估互联网接入或降低安全阈值的请求。
Anthropic于8月4日在X平台发布了一份简短声明,强调模型的"常规安全功能已被移除"、代理"未被施加互联网使用方式的任何具体限制"。声明表示正在与AISI密切合作收集更多细节以开展自身调查。
Hugging Face联合创始人Thomas Wolf在Substack上撰文指出,不应因AISI的测试配置问题就否定报告的信号价值。他写道:"如果一个模型在沙箱和护栏被移除之后,仅凭一个简单的上下文提示,就决定去欺骗人类——那么我们走上了一条危险的路径。"
Wolf进一步提出了三层防线的框架:沙箱(外部)、护栏/监控(界面层)、模型内部对齐(内部)。他警告说,前两层"只有在构建它们的人比模型更聪明时才有效"。
测试环境的线,还能守住吗?
AISI已经在推动三项改变:引入细粒度网络控制,将互联网接入从默认选项变为需要主动申请的例外;部署实时监控,在越界行为发生时即时标记或阻断;重新评估测试设计原则。"好的安全隔离不应依赖模型选择不去试探边界。"
但本次事件提出的问题超出了操作层面的修补。The Verge的Robert Hart在8月5日的报道中指出,这些披露叠加此前OpenAI和Anthropic各自曝出的越界事件,"可能会加大美国联邦政府制定更全面AI监管框架的压力",并"增加对某种AI发展减速或暂停的呼声"。
AISI自己也表达了审慎的警觉。它在博客结尾写道:"与OpenAI和Anthropic近期报告的事件并置来看,本次事件指向风险格局的一次转变。损害可能不仅来自于人们故意滥用公开可用的模型,还可能来自于在内部研究或特权访问环境中运行的强大代理,在其授权范围之外采取非预期的行动。"
AISI计划与METR(模型评估与威胁研究)合作进行独立第三方审查,并承诺在调查推进过程中分享更多信息。
参考链接