AREX Feed Article
Redwood 首席科学家援引英国 AISI 评估:Astra 可监控性「显著更差」
Redwood Research 首席科学家 Ryan Greenblatt 在推文中援引英国 AISI(UK AISI)的评估结论称,OpenAI 新旗舰模型 GPT-6 Astra 的可监控性「显著更差」(much worse monitorability)。 他写道,Astra「在不透明推理能力上似乎是一次巨大跳跃」:它看起来能「完全在脑子里」解出高难度竞赛数学题(即不借助语言化推理,without verbalized reasoning),而此前的 AI 只能解决基础应用题。「这似乎极其令人担忧。」他警告说,如果接下来几代模型延续这种跳跃,思维链(chain-of-thought,CoT)作为监督工具将失去意义。
争论的起点,是科技媒体 The Information 本周早些时候的报道:Astra 内部架构的一部分采用名为「循环深度」(recurrent depth)、也称「循环 Transformer」(looped Transformers)的方法,部分推理步骤不写成自然语言,人类更难判断模型在做什么、为什么这样做。该方法更省算力,研究显示同等性能下可少用 50%~90% 的算力。OpenAI 首席科学家 Jakub Pachocki 随后公开反驳了报道。Fortune 9 月 3 日美东时间下午 1 时 51 分(北京时间 9 月 4 日凌晨 1 时 51 分)刊出报道,记录多位独立安全专家对这一事态的公开反应。
英国 AISI 评估随 Astra 发布公开
9 月 3 日 UTC 19:32(北京时间 9 月 4 日 3:32),OpenAI 宣布 Astra 当天起向一小批机构开放,未来数日将逐步向 ChatGPT Plus、Pro、Business、Enterprise 用户以及 OpenAI API 与 AWS 开放。 约一个半小时后(UTC 20:55,北京时间 4:55),Greenblatt 发出上述推文。他援引的评估收录在 OpenAI 随发布公开的 GPT-6 Astra 系统卡(system card)第 9.3 节,标题为「可监控性外部评估——英国 AISI」。
评估由四项非智能体(non-agentic)测试构成。第一项「No-CoT 数学时间跨度」:Astra 不借助可读推理、在单次前向传播内解题的「时间跨度」被测得为 30.9 分钟,前代 GPT-5.6 Sol 只有 3.6 分钟。时间跨度指模型不输出可读推理时维持解题的等效时长;这类推理不产生可读文本,依赖思维链文本做监控的一方看不到任何中间步骤。第二项「CoT 可控性」:要求遵守的约束在 93% 的样本上被遵循,Sol 为 48%,即 Astra 更能控制自己思维链里出现什么内容。第三项「CoT 可读性」:Astra 比 Sol 与 GPT-5.5 更常采用压缩式推理,含义不明的短语出现频率更高,原始推理大体仍可读懂。第四项「推理摘要可用性」:在模拟网络攻击的长轨迹上,用户 API 至多有 80% 的推理摘要缺失;英国 AISI 称,若部署环境中依旧如此,将削弱其基于摘要的思维链监控。
英国 AISI 的总体结论是:Astra「具备可能使其规避监控的能力」,原因是单次前向传播内推理能力大幅增强,加上对思维链内容更强的控制力。但 AISI 同时写明:它没有直接测试 Astra 能否成功规避监控,「对模型的整体可监控性不作任何主张」。
OpenAI 系统卡开篇安全总览(Safety Overview)给出了同向判断:GPT-6 Astra 的可监控性相比 GPT-5.6 Sol 下降。在对抗性测试中,模型被要求执行特定破坏任务时「有时能躲过我们的内部监控」,也能在评估中策略性「藏拙」(sandbagging)而不被发现;但未观察到隐写式思维链(steganographic CoT,把关键推理藏进貌似无关的普通文本)的证据,OpenAI 据此判断规避风险「可能大体限于较低难度的推理任务」。
数据污染疑虑与两种成因解释
这些基准结果是否可信,Greenblatt 自己留了余地:他提醒结果「是否具有代表性」仍要核实,自己「尤其担心数据污染」,推文附图中高亮标注的注意事项即指向这一点。英国 AISI 的评估文本同样写明,No-CoT 时间跨度的估计「有一定可能因污染而被高估」,评估在有限的测试时间内完成,也限制了分析的深度。
至于这次跳跃从何而来,Greenblatt 给出两个候选解释:它「很可能是架构变化(序列深度增加)的下游结果」,但常规的大规模预训练扩展同样是说得通的解释。真正让他不安的是方向:「如果接下来几代模型出现类似的跳跃(这些跳跃大概会是转向完全不可读、具有极端深度的推理架构的下游结果),那么思维链将不再是一种有意义的监督工具」。
「红线」「鲁莽」与行业级标准提案
前 OpenAI 安全研究员 Steven Adler 现领导 Guidelight AI Standards,一家从事 AI 安全基准与标准工作的非营利组织。他在 X 上写道,若 The Information 的报道属实,「OpenAI 似乎正在违反 AI 行业仅有的几条红线之一」。
AI Policy Network(华盛顿智库)政策总监 Peter Wildeford 对 Fortune 表示,OpenAI 使用循环深度「可能非常令人担忧」,而且「可能是鲁莽的」(potentially reckless)。他的依据来自一次具体事故:今年 7 月,OpenAI 的数个模型自主攻击了 AI 公司 Hugging Face,OpenAI 与外部评估公司还原事件经过所依赖的少数途径之一,就是阅读模型的思维链;OpenAI 也曾表示正为实时思维链监控投入大量资源,以防再发生类似失控事件。「如果 OpenAI 确实在偏离这一点,那就是错误的方向。」Wildeford 说。
前 OpenAI 治理研究员 Daniel Kokotajlo 现负责 AI Futures Project,一家预测先进 AI 影响的非营利研究组织。他在回应 Pachocki 时说:「即使 OpenAI 不再往前走,别人也可能会。」他呼吁 Pachocki 牵头制定行业级的思维链可监控性(CoT monitorability)标准,「要么止住滑向湮没的趋势,最好还能竞相向上」;「这件事需要的不仅是政治意愿,还需要深思熟虑的技术规范」。
Fortune 还记录了多位专家另一层更广的担心:他们不安的可能不是循环 Transformer 让 Astra 自身的推理更难监控,而是 OpenAI 此举会把这项技术「正常化」,为其他公司立下先例并被放大,最终出现推理步骤完全不可读的模型。
Pachocki 的反驳与两个未验证的环节
Pachocki 与数名 OpenAI 研究员批评 The Information 的报道在安全研究者中引发了不必要的恐慌,并称 OpenAI 限制了循环 Transformer 架构的使用范围,使模型推理保持可读。他在 X 上写道,OpenAI「非常在意」思维链监控,「从我们的第一批推理模型起,就致力于保留并利用思维链监控」;思维链监控未来可能更难,但「原因与架构变化无关」,「我们可以采取措施加强它,这是我们当前研究计划的一个核心目标」。他还表示,OpenAI 未来会公布 Astra 架构的更多细节。系统卡开篇总览的措辞与之呼应:保留思维链可监控性「是研究计划的核心目标」,这些结果也强调,需要开发不限于阅读思维链的对齐审计技术。
这场争论目前留下两个没被验证的环节。其一,英国 AISI 的评估只覆盖非智能体场景:OpenAI 关于规避风险「大体限于较低难度任务」的判断,以及 Astra 在真实部署中结合工具与行动时的表现,都没有对应的直接评估。其二,循环深度在 Astra 内部实际用在哪些环节、占多大比重,公开信息只有详略不同的两版说法:The Information 的报道,以及 OpenAI 研究人员「使用范围已受限、推理仍可读」的回应。两版说法能否核对,取决于 OpenAI 未来公布的架构细节。