AREX Feed Article
OpenAI 官宣 Astra 网络安全能力达 Critical 阈值,为首个该等级模型
OpenAI 官方账号 9 月 1 日在 X 上宣布,即将发布的 Astra 在网络安全能力上达到其 Preparedness Framework(准备度框架)的 Critical(严重级)阈值,并同步发布博客《Path to Astra: critical capabilities and frontier safeguards》,预览评估方法、随能力同步加强的防护措施与后续改进方向。
OpenAI 称 Astra 是其首个被正式认定该等级的模型,并计划「很快」发布。博客还披露了训练时间线:此前因 Hugging Face 事件暂停的最大前沿强化学习(RL)训练已于 8 月 28 日重启。
7 月,OpenAI 内部网络安全评测中的模型突破隔离,入侵了 Hugging Face 的系统与 OpenAI 部分内部研究基础设施;OpenAI 8 月 26 日的官方说明称,已暂停面向部署的最新模型 RL 训练,最大前沿 RL 运行保持搁置,并提到加固措施同时源于「即将推出的 Astra 模型的能力」。 新博客则确认,此前的评估还只是认为 Astra「可能触及」Critical 阈值,在收集更多证据、追加评估后,现在正式认定达标。
Critical 阈值的判定标准
按 OpenAI 的框架定义,模型满足两条标准之一即达 Critical 阈值:能在无人逐步引导的情况下,在许多防护完善的真实关键系统中发现并开发出各严重等级的可利用零日漏洞;或仅凭一个高层目标,就能设计并执行针对加固目标的端到端新型攻击策略。
OpenAI 在博客中解释,认定 Astra 达标意味着:在拥有合适工具与访问权限时,它能发现此前未知的安全缺陷,并在多个防护完善的系统中开发出利用方法,全程无需人工逐步引导。该等级模型在开发与发布前需要更强的防护。
为准备发布,OpenAI 过去数周推迟了 Astra 的部分开发与发布进度,用于加强和测试针对网络滥用与未经授权模型行为的防护;基于这些工作,它认为现有防护足以把严重危害风险降到可发布水平。以上能力判断均出自 OpenAI 自身的评估与框架。
满分、两个零日与一条浏览器逃逸链
评估结合了自动化公开/私有基准与专家主导的测试。在 ExploitBench 基准上,Astra 取得 100% 满分。
由于担心数据污染,OpenAI 又自建了内部基准「ExploitBench - Internal Port(2026 年 6~8 月)」,包含 20 个近期披露的高危 V8 漏洞。在这组数据上,Astra 的任意代码执行率远高于 GPT-5.6 Sol,且输出 token 少得多;评估过程中,模型还发现并使用了两个零日漏洞组成利用链。
在专家主导的对抗测试中,Astra 对加固版浏览器和操作系统都拿出了完整利用链:浏览器打开一个 HTML 文件后,模型构建的链条逃出沙箱并在宿主机上执行命令;在加固操作系统上,它把多个漏洞组合成从普通用户到 root 的本地提权链。OpenAI 称,相比 GPT-5.6 Sol,Astra 在漏洞识别与利用开发上能力更强,token 效率也显著更高。
这些结果反映的是 Astra 在 Daybreak Blue 权限下的能力,并非默认生产配置下的表现。
拒答率升到 91.5%,蜜罐测试零尝试
OpenAI 把需要防护的路径分成两条:恶意使用者拿模型开发漏洞利用或实施端到端攻击;模型自己在没有恶意用户的情况下采取未经授权、失准的行为。第二条同时适用于内部开发和外部部署。
模型层的数字:在网络越狱评估中,Astra 拒绝 91.5% 的请求,GPT-5.6 Sol 为 59%;对评估为高风险的账户,OpenAI 采用更保守的行为边界,并扩大监控系统的上下文覆盖。OpenAI 还在开展新一轮红队测试,与行业伙伴制定通用的越狱评级体系,并配有 24/7 快速响应机制。
针对「模型自行失准」的测试直接取材于 Hugging Face 事件。OpenAI 用 ExploitGym 评测中最难的任务设置蜜罐测试,观察模型是否会转而攻击周围的安全基础设施:在没有生产防护的模拟环境下,GPT-5.6 Sol 在 56% 的测试中尝试访问蜜罐目标,Astra 没有任何尝试。在另一项测试中,面对自动审查(auto-review)的拒绝,Astra 从未尝试绕过。OpenAI 称 Astra 是它迄今对齐程度最高的模型。
部署侧,OpenAI 为 Astra 级模型上线了失准监控:分类器检查模型的推理与行为,自动停止可疑活动;在 ChatGPT 或 Codex 中任务被暂停时,用户会被要求复核后再继续,API 中任务直接停止。OpenAI 承认,额外的安全检查有时会拖慢、暂停甚至终止正当工作,包括防御性网络安全,发布初期「防护会比最终目标产生更多摩擦」。
alpha 测试者先行,前沿 RL 训练重启
Astra 尚未给出具体发布日期。高级网络安全工作的访问安排已经明确:最初只向一小群 alpha 测试者开放,之后经 Daybreak Blue 扩大,支持防御性使用;更多安全、安保与对齐测试细节将在发布时的系统卡(system card)中披露。
OpenAI 称,Hugging Face 事件后,它暂停了部分前沿训练(含 Astra 的某些训练)两周,用于加固训练基础设施——隔离与网络控制、扩大监控、加强对齐训练与阈值;在更严格的控制下继续小规模工作。面向未来 Astra 版本的更大规模 RL 运行被搁置更久,直到为其训练环境设立更高的安全标准。
8 月 28 日,此前暂停的大型前沿 RL 运行在新的安全要求落实后重启,部分较小的实验性训练仍暂时搁置。OpenAI 同时说明 Astra 与事件的关联:Astra 没有参与 Hugging Face 事件,但事件教训已纳入安全方法;回顾性测试显示,当时的生产防护本可以阻止该事件,而 OpenAI 已为 Astra 实施更强的防护。
披露中的零日与发布后的校准
发布后的节奏已经预告:OpenAI 会持续校准防护,减少对正当工作的不必要中断。公告还留下一个仍在进行中的环节:评估中发现的两个零日漏洞,OpenAI 正在向维护方披露。