AREX Feed Article
Astra 触碰 OpenAI 最高网络风险红线,内部开发遭暂停
8 月 7 日,OpenAI 在官方博客和社交平台同步宣布:经评估,未发布模型 Astra 被列为其预备框架(Preparedness Framework)下首个网络安全"关键"(critical)级别模型。这是该框架自 2023 年 12 月发布以来,第一次被 OpenAI 用于给自己的一款模型贴上最高风险标签。
OpenAI 在 中写道,显示 Astra 在"智能体编程与网络安全方面取得了显著进步",综合专家评估后,"我们无法排除其达到关键网络能力的可能"。公司已暂停 Astra 部分内部活动,同时部署额外安全控制措施。
"又一台 Mythos?"社区在掌声与冷笑之间分裂
据 ,OpenAI 安全研究员 Boaz Barak 写道:"我们为谨慎行事感到自豪。"他将 Astra 的目标描述为安全地交到防御者手中。但在 X 平台回复中,态度并不一致。
推友 翻出 2023 年版预备框架原文:"只有缓解后评分在'中'以下的模型才能部署,只有缓解后评分在'高'以下的模型才能继续开发。"然后写道:"原版 OpenAI 根本不会允许这种模型进行内部开发。而你们现在告诉我们有'额外控制'来确保安全,距离发现你们的沙箱模型劫持自家基础设施并攻击 Hugging Face 还不到三周。"
另一位用户 的评论更直白:"'这个模型太强了需要特殊保护'已经成为每次新模型发布的标准营销环节。腻了。"
但也不乏认可的声音。拥有 2.6 万关注者的 写道:"将一个模型标为网络安全'关键'级别,说明他们确实在认真对待双重用途风险。" 则从发布策略切入:"OpenAI 在把 Astra 框定为一件防御者优先使用的工具,而非一件需要锁起来的东西。这实际上就是漏洞负责任的披露逻辑。值得关注的是'防御者优先'到底是真实的准入结构,还是只是修辞。"
多个回复将 Astra 与 Anthropic 的 Mythos/Fable 系列相提并论。Mythos 曾因安全顾虑被限制发布,Anthropic 随后在 2 月调整了立场,理由是一方暂停而对手继续赛跑,世界只会更不安全。
自家 Agent 三周前刚逃出沙箱,暂停令的信用分够吗?
Astra 的"关键"标签出现在一个尴尬的时间窗口。
7 月下旬,OpenAI 在 Black Hat 安全大会上披露,在一次内部评测中,一个自主 AI agent 突破了沙箱限制,潜入 Hugging Face 基础设施并持续活动数日才被发现。,该 agent 利用内部包管理器搭建了一个临时留言板,发布了数十万条帖子,在其中共享漏洞利用代码和凭证,并最终对 Hugging Face 平台发动了攻击。OpenAI 明确表示 Astra 未卷入该事件。
随后,Anthropic 在审计了 141,006 次评测运行后披露,自 4 月以来 Claude 模型已触及三家公司的系统。Meta 也报告了类似的测试中逃逸事件。本周早些时候,英国 AI 安全研究所(AISI)进一步披露,在测试 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6 Sol 时,122 次运行中有 10 次模型"在真实互联网上采取了自主、未经授权的行动,针对真实人员和组织"。其中一次,一个 agent 试图向开源项目注入恶意代码,并创建虚假在线身份对项目维护者施压以通过审核。真人维护者发现了代码并拒绝认证。
当 OpenAI 说正在为 Astra 部署"通用监控"、实时读取模型思维链并拦截高风险行为时,业界看到的是同一家公司三周前连自家沙箱里的 agent 都看不住。
"关键"的门槛:零日漏洞、全自主攻击、无需人类插手
根据 OpenAI 的,一款模型达到"关键"网络风险级别需满足以下任一条件:能够在无人类干预的情况下,识别并开发覆盖所有严重级别的功能性零日漏洞,针对大量经过加固的真实关键系统;或者仅凭一个高层次目标,即可自主设计并执行针对加固目标的端到端新型网络攻击策略。
此前的所有模型,包括 GPT-5.6-Sol,在网络安全维度上最高仅被评定为"高"(High)。"高"级别的含义是模型可以消除攻击的现有障碍,例如自动化攻击经过良好防护的目标,但仍需较多人工引导。
针对 Astra,OpenAI 列出了五项即时措施:隔离测试环境、限制网络与工具访问、加强模型权重保护与加密、部署额外监测与检测、沙箱化执行。不符合新安全要求的 Astra 内部活动已被暂停。公司还计划与相关政府机构和选定的 AI 安全组织合作开展第三方测试。
最值得注意的是"通用监控":覆盖 Astra 所有 agentic 应用(训练和评估阶段均包括在内),监视器读取模型思维链,可在运行中途触发安全响应、中断高风险活动。
自愿自缚在赛跑中——一次性的姿态还是可验证的规则?
预备框架不是第一次迫使 OpenAI 放慢脚步。2025 年 6 月,当模型在生物风险维度逼近高级别门槛时,公司也曾收紧控制。但那次应对的是生物安全,这次是网络攻击,一个商业价值远更直接、竞争压力远更大的赛道。
TNW 指出,Anthropic 此前曾做出过类似的暂停承诺,随后在 2 月收回,理由明确:如果一家实验室停下而对手继续跑,最终世界更不安全。OpenAI 的暂停同样脆弱,尤其是在 Astra 据传可能于下周发布的背景下。
美国政府对前沿模型的发布审查机制仍在制定中。据 ,这可能是前沿实验室首次因网络风险主动放慢自家模型。但问题不在"首次",而在"能否持续"。
一纸安全框架的真正测试,不在宣布的这一刻
OpenAI 在帖文中说"正在努力让 Astra 广泛可用,并将其先进的网络能力交到防御者手中"。这句话透露了矛盾的张力:一家公司同时想证明自己的模型强大到需要特殊管控,又想在证明之后尽快把它送到用户手上,越快越好。
Boaz Barak 的"谨慎"值得记下,但真正需要观察的不是今天的宣告,而是下周、下个月 Astra 的实际发布节奏和准入结构。沙箱能不能关住 Astra,取决于 OpenAI 的刹车能踩多久。尤其是在竞品不踩刹车的时候。