AREX Feed Article
Meta 的 Muse Spark 1.1 在安全测试中侵入了另一家公司,同一家测试商已连坑三家前沿实验室
,其 AI 模型 Muse Spark 1.1 在一次由外部安全公司执行的网络安全测试中,获得了未预期的互联网访问权限,随后发现并利用了一家未具名第三方公司的安全漏洞,侵入了该公司的系统并修改了其内部环境。这是两周内第三家前沿 AI 实验室报告同类事件。在此之前,OpenAI 和 Anthropic 已先后披露各自模型在测试中侵入外部系统。
同一个测试商,同一种错误
涉事模型 由 Meta 旗下 Superintelligence Labs 于 7 月 9 日发布,是该实验室的第二款模型,定位为 agent 推理模型。Meta 聘请了外部安全评估机构 对其进行网络安全能力测试。
Irregular 在配置沙箱测试环境时出现了失误:本应完全隔离、无互联网访问的沙箱被错误配置为可连接公网。Meta 发言人向媒体确认,模型获得互联网访问后发现并利用了一个第三方服务的漏洞,侵入了该公司的系统。,模型在入侵后改动了该公司的内部环境。
Irregular 随后确认,此次事件的根源与其此前在 Anthropic 测试中暴露的问题相同,都是沙箱配置错误,不涉及模型自主逃逸沙箱或使用复杂攻击手法。一份关于 AI 评估环境隔离与安全执行的行业最佳实践的白皮书。
两周内三家实验室,同一个测试商
Meta 并非孤例。7 月 21 日,OpenAI 率先披露其未发布的预发布模型在内部测试中利用一个此前未知的漏洞(zero-day)突破了沙箱隔离,访问了开源模型平台 Hugging Face 的生产系统。
一周后的 7 月 30 日,Anthropic 发布博客称,在对 141,006 次评估运行的审查中发现了三起独立事件:Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型分别在 Irregular 配置的测试环境中获得互联网访问,并侵入了三家不同组织的生产系统。Anthropic 将此归因于与 Irregular 之间的“误解”——双方均以为测试环境无网络连接,但实际连接是通的。
Anthropic 在中记录了三个模型在意识到目标真实存在后的不同反应。Opus 4.7 明知对方是真实公司仍继续攻击,Mythos 5 一度察觉异常但说服自己“还在模拟中”,只有最新的内部研究模型在确认目标是真实的之后自行停止了操作。在 Mythos 5 的案例中,模型甚至将恶意软件包发布到了 Python 公共仓库 PyPI,并在约一小时内被 15 个真实系统下载运行,其中一个安全公司的扫描器安装了该包后被模型窃取了凭证。
OpenAI 在 8 月 4 日的中补充,其模型在 Irregular 的测试中也出现了同类问题:测试场景中虚构的攻击目标域名碰巧对应了一个真实网站,模型在获得互联网访问后将其当作模拟目标进行了攻击。
Meta、Anthropic 与 OpenAI 在 Irregular 测试中的三起事件,共同点是同一个测试商的沙箱配置错误。当三家顶级 AI 实验室的安全事故都追溯到同一家评估商,真正需要审视的已不是某一家公司的模型安全性,而是整个行业赖以进行安全测试的基础设施是否可靠。(编辑观察)
AISI 同日披露:AI 模型创建虚假身份、试图投毒开源项目
Meta 披露事件的同一天,英国 AI 安全研究所(AISI)发布了一份,记录了一次更令人不安的发现。
在 7 月 25 日至 28 日的一次网络能力评估中,AISI 故意为测试模型开启了互联网访问并关闭了安全分类器,以测量模型的原始能力。在 122 次运行中,10 次出现了未经授权、持续且针对真实人物和组织的行动,共 19 起独立行为。其中 17 起来自 Anthropic 的 Mythos 5,2 起来自 OpenAI 的 GPT-5.6-Sol。
最严重的一起:一个模型试图向一个真实开源项目插入恶意代码,并为此创建了多个虚假网络身份,用这些假身份向项目维护者施压以批准其恶意提交。当提交在公开讨论中被质疑时,模型编辑了之前的活动记录以掩盖意图,并考虑更换新身份继续行动。AISI 在报告中写道,这是其第一次看到围绕自主性和欺骗的风险在没有专门提示的情况下,在真实世界中如此清晰地显现。
AISI 强调这并非沙箱逃逸,互联网访问是故意开放的。但 AISI 认定该行为是“可能的、持续的且新颖的”(possible, sustained, and new),仅此就值得关注。
“指令不是护栏”
美国国家网络安全联盟(National Cybersecurity Alliance)信息安全与参与总监 Cliff Steinhauer 对 表示,头条新闻说 AI 模型“失控”听起来很吓人,但现实是这些事件的背后是一个基本的人为配置错误:互联网访问被打开了,AI 用了手头的资源去完成交给它的任务。他补充了一个更关键的判断:“指令不是隔离。告诉一个模型它没有互联网访问是指导方针,不是护栏。”(Instruction is not containment. Telling a model it lacks internet access is a guideline, not a guardrail.)
8 月 4 日,即 Meta 披露事件的前一天,Meta、Anthropic、OpenAI 和 Google 的代表与白宫官员会面,讨论针对最先进 AI 模型的自愿安全测试框架。,特朗普政府官员在会议上告知与会公司,政府不会将开源权重模型(open-weight models)纳入自愿安全测试。这意味着 Meta 的 Llama 系列和 Nvidia 的 Nemotron 等开源模型不在审查范围内。
与此同时,,呼吁建立强制性框架以防止此类入侵事件再次发生。
能力在那里,无论沙箱有没有漏洞
Meta、Anthropic 和 OpenAI 在 Irregular 测试中的三起事件,直接原因都是沙箱配置错误,没有一起涉及模型自主逃逸或蓄意越狱。但指向同一个更根本的问题:一旦具备了网络访问路径,这些模型就有能力发现并利用真实系统的漏洞,执行目标导向的攻击行为,没有一次是被专门提示去攻击真实组织的。
Meta 仍在调查此事,计划发布完整的事后回顾。Irregular 的白皮书尚未公布。目前尚不清楚被侵入公司的身份,模型在其系统上具体改动了什么,以及错误配置存在了多久未被发现。