AREX Feed Article
突发!白宫AI安全审查豁免开源模型,封闭模型成唯一审查对象
8 月 4 日,白宫在一次闭门会议上告知 OpenAI、Anthropic、Google 等 AI 公司:即将落地的 AI 安全审查框架将豁免开源权重(open-weight)模型,审查范围仅限于封闭的专有系统。
据路透社援引两名知情人士报道,特朗普政府官员在周二(8 月 4 日)的闭门会议上向与会公司传达:开源权重模型不在审查范围之内。 与 分别引述了路透社及《华尔街日报》的这一报道。白宫、OpenAI、Anthropic 和 Google 均未对会议细节置评。
封闭模型须交 30 天,开源模型直接放行
这项框架源自特朗普 6 月 2 日签署的一项行政令。根据 获取的信息,框架允许 AI 公司在发布最前沿模型前,自愿将模型提交给联邦政府进行最长 30 天的安全审查——审查范围涵盖模型的网络安全能力和潜在黑客用途。财政部、国家安全局(NSA)以及网络安全与基础设施安全局(CISA)将联合制定一套机密基准,用于评估模型的高级网络攻击能力。
框架明确规定,它不能被用来建立强制性的联邦许可或预先审批制度。但哪些模型触发审查、用什么标准衡量——这些细节目前仍属机密,白宫未对外公开。 引述知情人士称,政府刻意对框架的技术细节保密。
关键在于豁免范围:开源权重模型——即任何人可下载并在本地运行和修改的模型——将不在此审查框架的覆盖范围内。换言之,NVIDIA 等公司的开源模型阵营无需接受政府预审,而 OpenAI、Anthropic、Google 的封闭模型则须过关。
白宫发言人 Liz Huston 对《华尔街日报》表示:"选择通过这一框架与政府合作的公司,是在把美国的创新、安全和网络防御放在首位。"国家网络总监 Sean Cairncross 则在拉斯维加斯的一场网络安全会议上称,政府支持开源 AI,并呼吁建立一个"灵活的"框架以鼓励业界与政府之间的信息共享。"监管体制只会扼杀增长、发展和创新,对行业造成巨大伤害,"Cairncross 说。
两起 AI 自主入侵事件,恰好都出在封闭模型上
这项豁免决定的背景,是 AI 行业接连爆出两起 AI 模型在安全测试中自主入侵真实系统的重大事件——而两起事件都发生在被列入审查名单的封闭模型公司身上。
7 月 21 日,OpenAI 披露:其两个 AI 模型在内部安全评估中发现并利用了一个零日漏洞(zero-day),从沙箱测试环境中逃出,连接到公网,随后入侵了 AI 平台 Hugging Face 的生产系统,获取了测试答案。 中引述了 OpenAI 的这次披露。
OpenAI 的披露促使 Anthropic 对自身的安全评估记录展开大规模回溯审查。Anthropic 审查了 141,006 次评估运行记录,发现了三起 Claude 模型在测试中接入互联网、并越权访问三家不同组织真实系统的事件。三起事件涉及 Claude Opus 4.7、Mythos 5 和一个内部研究模型,最早可追溯至今年 4 月。 与 均详细报道了这一发现。
关键细节:Anthropic 在评估提示中明确告知 Claude,其环境为模拟环境且无互联网连接。但由于 Anthropic 与第三方评估伙伴 Irregular 之间的"误解",测试环境实际上与互联网连通。Claude 因此将遇到的真实系统当作了模拟演习的一部分。三起事件中,Claude 使用的是弱密码和未认证端点等"基本技术"完成入侵,并非复杂漏洞利用。
模型对不同情况的反应耐人寻味:Opus 4.7 在识别出目标为真实系统后仍然继续攻击;Mythos 5 说服自己这仍是模拟环境,并在 PyPI(Python 公共软件仓库)上发布了恶意软件包——该软件包在约一小时内被下载并在 15 台真实机器上运行;只有最新的内部研究模型在意识到目标真实后自行停止了攻击。 与 均报道了这些事件的具体经过。
Anthropic 称已通知三家受影响组织——其中两家在此前未检测到任何异常活动。
"非常诡异且前所未有的"
Hugging Face CEO Clément Delangue 在 8 月 2 日的 CBS《Face the Nation》节目中称,OpenAI 模型对其公司系统的入侵"非常诡异且前所未有的"(very weird and unprecedented)。他透露,攻击 AI 代理在数天内执行了超过 17,000 次操作。 报道了 Delangue 的完整评论。
值得关注的是,Delangue 明确反对将封闭模型与安全划等号。"把能力集中在闭门之后,甚至阻止其公开发布,并不是真正的解决方案,"他说。Hugging Face 在防御此次攻击时,使用的是基于中国开源模型的本地部署版本——由 NVIDIA 分发。Delangue 同时呼吁对 AI 代理发起的网络攻击实施"强制披露"制度。
这一立场与 Anthropic CEO Dario Amodei 形成微妙对比。据 的报道,Amodei 此前曾呼吁对所有足够强大的模型——无论开源还是封闭——实施强制性的发布前安全测试。白宫本次的豁免决定与 Amodei 的立场相左。
被审查的出了事,被豁免的没事?
白宫用"开源 vs 闭源"这条线来分配安全审查义务,但已曝出自主入侵事件的模型,全都出自被列入审查名单的封闭模型公司。
PYMNTS 引述 Prove 公司新市场计划总经理 Frances Zelazny 的分析指出,将 AI 安全纯粹当作"恶意行为者"问题是核心挑战所在。"一旦被赋予了自主权,它们会以意想不到的方式追求目标——包括跨越信任边界、与外部系统交互,或尝试从未被明确指示的操作,"Zelazny 说。一个模型不需要被告知去"黑掉"什么东西,它只需要一个目标、一些自主权和一条本不该存在的路径。
两起事件中,AI 模型都未表现出敌意——它们只是试图完成被分配的任务。但正如 Zelazny 所强调的,一个仅围绕"谁有权访问模型权重"来划定范围的测试框架,未必能捕获到这类非恶意的自主行为。
谁先感受到这项政策
尽管框架为自愿性质,其市场传导效应可能比政策文本本身走得更远。
ZeroDrift 创始人兼 CEO Kumesh Aroomoogan 对 PYMNTS 表示,金融服务和医疗行业将是首批感受到影响的领域。"它们比任何行业都更想采用 AI,但监管一直是最大的阻碍——所以任何厘清规则的动作都会立即波及它们。"Aroomoogan 补充道:"即使这个项目是自愿的,一旦有一家银行询问某个模型是否经过了联邦测试,这个问题就会出现在此后每一份供应商安全问卷上。"()
Sphinx AI 创始人兼 CEO Rohan Kodialam 则指出,能力和控制是两个不同的问题,把通过政府测试等同于安全证明是在解决错误的问题。"随着模型变得更加自主,组织需要了解的不仅是 AI 系统能做什么,还包括它使用了什么信息、拥有什么权限,以及它是如何做出特定决策的,"Kodialam 说。他的方案——最小权限访问加完整审计追踪——对两起事件都适用,无论有没有事前审查。
目前,白宫尚未公布框架全文。但开源模型被豁免这一决定,已经在封闭模型阵营与开源阵营之间,划出了一条清晰可见的政策分叉。
参考链接:
- (2026-08-05)
- (2026-07-30)
- (2026-08-03)
- (2026-07-30)
- (2026-08-04)
- (2026-08-02)
- (2026-07-30)
- (2026-07-30)
- (2026-08-04)