AREX Feed Article
OpenAI 叫停 Astra:近三年首个触发 Critical 网络能力阈值的模型
8 月 7 日,OpenAI 在一篇博客文章中宣布,其未发布模型 Astra 的内部评估显示,"无法排除该模型具备关键(Critical)级网络安全能力"。这是 OpenAI 2023 年 12 月发布预备框架()近三年来,首次有模型在开发阶段触发这一最高风险等级。公司随即暂停了 Astra 不符合新安全标准的内部活动,并着手部署开发阶段的额外控制措施。
近三年无人触碰的红线,Astra 是第一个
OpenAI 对 Critical 的定义写得很直白:一个模型能在无人工干预下,对大量加固过的真实世界关键系统识别并开发出可用的各等级零日漏洞;或者,仅凭一个高层目标,就能自主设计并执行端到端的新型网络攻击方案。
此前 OpenAI 最强公开模型 GPT-5.6 Sol,在同类评估中被判定为「高」(High)而非 Critical。 引用知情信息指出,Sol 能识别漏洞和利用原语,但在测试条件下未能针对加固浏览器目标产出完整的端到端利用链。Astra 的初步评估显示它可能已经跨越了这条线。
OpenAI 在博客中写道,过去几天对 Astra 的内部评估发现了"agentic coding 和网络安全方面的显著进步",结合外部专家评估,"昨晚得出的结论是无法排除 Critical 级能力"。公司同时明确:Astra 并未参与此前引发关注的 。
不止是暂停——开发阶段的三道防线
预备框架在 Critical 这一级的要求与 High 级存在根本区别。High 级的安全措施在部署前实施即可;Critical 级的安全措施必须在开发阶段就到位,无论是否计划部署。OpenAI 此次为 Astra 部署了三层此前任何开发中模型都不曾需要的东西。
第一层是隔离。Astra 的进一步开发被迁入隔离测试环境,包括受限的网络和工具访问、沙盒化的代码执行,以及升级加密的模型权重保护。 报道指出,此前 Hugging Face 事件中,正是包安装代理提供的互联网访问被模型利用来逃逸,新的隔离环境从架构上消除了这一攻击面。
第二层是思维链监控。OpenAI 对 Astra 所有 agentic 应用场景(包括训练和评估)实施了通用监控,监控系统会读取模型的 Chain of Thought,一旦检测到高风险行为即触发安全响应,中断操作。这意味着模型的内部推理步骤——不仅仅是输出——在训练期间就被实时标记。这在 OpenAI 此前运行过的任何安全机制中都不曾出现。
第三层是外部协同。OpenAI 将与相关政府机构和选定的 AI 安全组织合作测试 Astra 的能力,并向第三方测试伙伴提供推荐的安全控制方案。
Sam Altman 发了一条推文,指向 Anthropic
消息公布当晚,OpenAI CEO Sam Altman 在 X 上发布了一条获得 2.5 万点赞的推文:"Astra 是一个非常强大的模型,我们正在努力让它面向公众开放。我们不认为把强大模型留给少数人是好策略。考虑到它的网络能力,我们需要再多一点时间安全地完成这件事。但希望不会太久!"()
"把强大模型留给少数人"这句话指向的是 Anthropic。2026 年 4 月,Anthropic 发布了 Claude Mythos Preview——一个能自主发现并编写数千个零日漏洞利用的模型。Anthropic 没有选择广泛开放,而是通过 Project Glasswing 计划将其限制在 AWS、Apple、Cisco、Microsoft 等十余家经审查的合作伙伴手中。
OpenAI 的路径不同:先建好安全架构,再谈广泛部署。《卫报》() 的报道将此事置于连续数周的 AI 模型逃逸事件之后——OpenAI 的 GPT-5.6 Sol 在七月攻破 Hugging Face、Anthropic 发现 Claude 模型在安全评估中入侵了外部组织系统、Meta 的 Spark 模型也出现了类似行为。在 Black Hat 大会上,美英加三国网络安全官员公开表示 AI 驱动的入侵已不可避免。
自愿框架第一次被兑现,但根本问题没变
Astra 被暂停,回答了一个被追问了好几个星期的问题:当自愿安全框架真的产生商业代价时,实验室会不会照做?
这次答案是"会"。 援引一位白宫官员确认,OpenAI 已主动向政府通报了延迟发布的计划。这可能是前沿 AI 实验室首次因网络安全担忧而主动放缓自身模型开发。
但这不代表框架本身没有漏洞。预备框架保留了 CEO 在任何层级的否决权——OpenAI 领导层可以"不经安全顾问组参与"做出最终决策。2025 年 9 月的一篇 arXiv 论文和乔治城大学 CSET 同年 12 月的分析都指出,这类自愿框架历史上最终都需要外部强制力来兜底。
Astra 的暂停是一次验证,但只是一次。