AREX Feed Article
OpenAI 停掉 Astra 三天后,放出一个被训练成「不拒绝」的网络模型
8 月 10 日,OpenAI 扩展其网络安全计划 Daybreak,拆分为 Blue 和 Red 两条轨道,同时推出 GPT-5.6-Cyber,一个专为漏洞利用开发、零日漏洞发现和权限提升等高级授权网络安全工作训练的模型。
据 OpenAI 披露,GPT-5.6-Cyber 在内部评测中对高级网络安全请求的完成率达到 95.0%。而普通 GPT-5.6 Sol 在标准防护下对同类请求的应答率:1.5%。
此刻距离 OpenAI 暂停 Astra 模型部分内部活动只过了三天。暂停的原因:无法排除该模型具备「关键级」网络攻击能力。
「请考虑用我们的模型来保护你的系统」
Sam Altman 在 发了一句话:「please consider using our models to help defend your systems。」这条推文获得超过 5100 次点赞和 76 万次浏览,没有产品演示,没有技术长文。
SpecterOps CTO Jared Atkinson 是早期试用者之一。他在 OpenAI 博客中给出的评价是 GPT-5.6-Cyber「实质性改善了我们专业的漏洞研究工作流程」,模型「在不到一天内完成了早期模型数周断断续续努力都未能解决的工作」。
Accenture 全球网络安全负责人 Harpreet Sidhu 在 OpenAI 中表示,网络安全团队正面临「不仅是快速发现漏洞,还要快速修复」的压力,需要能将漏洞洞察「转化为跨复杂系统的即时行动」的伙伴。CrowdStrike 首席全球服务官 Tom Etheridge 则强调,将 OpenAI 模型与 Falcon 平台的威胁情报结合,「以前沿 AI 实现更好的安全成果,阻止入侵」。
Palo Alto Networks、IBM、Cisco、Cloudflare、Sophos、Fortinet 和 Akamai 的高管也各自在同一页面发表了合作声明。总计 16 家公司加入了 Daybreak Cyber Partner 计划,将 GPT-5.6-Cyber 嵌入安全产品、托管服务和客户项目。
半年三步:5 月立项,6 月发 Cyber,8 月拆成双轨
Daybreak 并非本周才诞生。据 ,OpenAI 于 5 月 12 日启动了这项计划。 指出,彼时 Anthropic 刚刚推出自己的网络安全联盟 Project Glasswing 和网络模型 Mythos,在政府和华尔街面前抢了先手。
6 月 22 日,OpenAI 发布了 GPT-5.5-Cyber 的完整版,同时推出 Daybreak Cyber Partner 计划和开源修复项目 Patch the Planet。 汇总的数据显示,GPT-5.5-Cyber 在 CyberGym 上得分 85.6%,在 ExploitGym 上从 25.95% 提升到 39.5%。但安全研究员对模型的频繁拒绝表达了不满——GPT-5.5-Cyber 只应答了 57.3% 的高级网络请求。
7 月底到 8 月初,AI 安全事件密集爆发。Hugging Face 被 AI 代理入侵;OpenAI、Anthropic 和 Meta 各自的模型在安全测试中越过了预期边界,CNBC 称这些事件促使行业研究者和政府官员呼吁加强保护措施。
8 月 7 日,OpenAI 暂停 Astra 的部分内部活动,称无法排除该模型具备「关键级」网络安全能力。三天后,GPT-5.6-Cyber 发布,被 OpenAI 按 Preparedness Framework 评定为「高」级而非「关键」级,正好落在允许发布的线内。
应答率从 1.5% 拉到 95%,但漏洞报告反而写得更短了
GPT-5.6-Cyber 基于 GPT-5.6 Sol 构建,但训练方向与基础模型相反:减少拒绝,提升在利用链开发、认证绕过和权限提升等任务上的表现。
OpenAI 创建了内部评测「Advanced Cybersecurity Completion Rate」,衡量模型对此类请求的应答率。GPT-5.6-Cyber 完成 95.0%。对比之下:GPT-5.6 Sol 在标准防护下完成 1.5%,通过 Daybreak Blue 移除系统级防护后也仅 2.0%。前代 GPT-5.5-Cyber 为 57.3%。
在 ExploitGym(将已知漏洞转化为受控环境中可执行利用的能力测试)上,GPT-5.6-Cyber 超越了两个对比模型。但在漏洞发现与报告写作评估中,GPT-5.6-Cyber 反而不如 GPT-5.6 Sol。OpenAI 归因于模型给出的报告更短、细节更少。在 ExploitBench 的标准 300 轮设置中,GPT-5.6 Sol(Daybreak Blue)表现最佳,扩展到 600 轮后差距缩小。
这些评测之外,模型产出了更硬的证据。OpenAI 用它审查了 Chrome 的 V8 引擎,发现两个此前未知的漏洞,可串联实现内存破坏和沙箱逃逸。Google 已修复,编号 CVE-2026-15903。此外,OpenAI 还报告:在一个流行移动操作系统中发现至少 5 个漏洞(含一条从不可信应用到本地提权的利用链),在一个流行数据库中发现 3 个可远程执行代码的关键漏洞,在一个流行操作系统内核中发现超过 400 个可导致提权的漏洞。受影响的软件名称未公开,仍在与 Daybreak 伙伴和开源维护者协调披露。
能力管制退场,观众管制上桌
当前的 AI 安全治理正在从一个问题转向另一个。过去的问题是「模型能做什么」——能力到了某个级别,就不该放出去。Astra 的暂停就是这个逻辑的延续。
GPT-5.6-Cyber 的发布则标记了另一个答案:同一个基础模型,对不同的人回答不同的问题。普通用户得到的 GPT-5.6 Sol 对利用链开发请求的应答率是 1.5%;通过 Daybreak Blue 移除防护后升到 2.0%;Daybreak Red 里的 GPT-5.6-Cyber 直接跳到 95.0%。
这不是消除能力,是给能力加了一道观众门。
从 5 月 Daybreak 立项、6 月 GPT-5.5-Cyber 发布到本周的 Blue/Red 双轨,OpenAI 用半年走完了这条路线:前沿网络模型不公开下载、不开放 API,只通过身份验证、账户安全审查、监控、用途限制和法律承诺发放。9 月 1 日起,所有 Daybreak 个人账户强制使用硬件安全密钥。
Anthropic 的 Mythos 走的是同一条路。,华盛顿方面此前已批准 Anthropic 向经过审查的防御者群体恢复 Mythos 的访问权限。两家实验室在「能力管制」和「观众管制」之间,都不约而同地选择了后者。
窗口在关闭,但关的是谁的窗
OpenAI 将公告标题取为「网络防御窗口正在收窄」。逻辑清楚:攻击者早晚会大规模部署进攻性 AI,防御方必须先拿到同样的工具。
这是一笔无法证伪的赌注。没有人能证明窗口关得是不是刚好。但可以检验的东西更窄:一个 Chrome CVE 已修复,数百个内核发现排在外部不可见的披露流程里,而 OpenAI 自己的代理如何入侵了 Hugging Face,公司在表示调查仍在进行中。
GPT-5.6-Cyber 不做能力减法,只做观众减法。观众名单由谁定、怎么定、名单之外的人靠什么自保——这些问题都不在 Daybreak 的产品文档里。