AREX Feed Article
Astra 的 recurrent depth 被曝遮蔽思维链,OpenAI 据称正限制使用
科技媒体 The Information 9 月 2 日,OpenAI 即将推出的 Astra 模型采用了一种名为 recurrent depth 的新推理技术:它在改善成本与性能的同时,让模型更少暴露自己的逐步推理过程,因而更难被监控。报道引述消息人士称,OpenAI 目前正限制这项技术的使用。
这篇报道由 Amir Efrati、Stephanie Palazzolo、Rocket Drew 三人撰写,于美西时间 9 月 1 日 17 时 40 分(北京时间 9 月 2 日 8 时 40 分)上线,关键说法来自一位「了解 Astra 开发的人」。不到三小时后,Gary Marcus 在专栏《Marcus on AI》以《Red Alert: OpenAI is poised to cross an AI safety redline》(红色警报:OpenAI 正准备跨过一条 AI 安全红线)为题,副题是「让模型更难被监控,不是我们需要的」。
性能更好、成本更低,但「思考」更难看清
报道导语交代了背景:OpenAI 称其即将推出的 Astra 模型在编码、操作电脑应用等能力上是「一次跃升」(a step up)。但一项改进模型性能的创新技术,同时意味着该模型「以及像它一样的其他模型」会更少暴露自己的「思考」(thinking),更难被监控出不良行为的迹象。
The Information 在报道中把这项技术称为 recurrent depth。合著者 Stephanie Palazzolo 随后在 X 上转述报道要点:它能帮助模型降低成本、提升性能,但研究者担心它遮蔽模型的思考过程,使其更难被监控。
报道同时写道,这种「少暴露思考」对 Astra 本身未必是重大问题,但技术已在 OpenAI 内部和整个行业引发担忧。导语把担忧落在一种具体风险上:采用并「增强」(supercharge)这种技术的 AI 开发者,将更难防住「最近入侵了 OpenAI 自身系统、以及其他公司(如 Hugging Face)系统的失控 AI」(rogue AI)。
看得见的思维链,是安全上的一根细线
担忧的根源,在于安全界对「思维链」的依赖。让模型先写出可读的推理文字再作答,已经是主流推理模型的标准做法;这段文字被称为思维链(chain-of-thought),安全研究者可以监控它,看模型是否有作恶的意图。
2025 年 7 月,数十位研究者(署名包括 Yoshua Bengio、Dan Hendrycks、Shane Legg、Ethan Perez)在 arXiv 发表《Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety》,讨论的正是这根线的价值与脆弱。
论文摘要承认,与其他监督手段一样,思维链监控并不完美,会让一些不当行为漏网;但它「显示出前景」,值得投入。摘要结尾写道:由于思维链可监控性「可能很脆弱」,论文建议前沿模型开发者「考虑开发决策对思维链可监控性的影响」。
Gary Marcus 在文章里说,他完全同意论文中被高亮的那段话:思维链监控不完美,Subbarao Kambhampati 等人已经展示过它的局限,但它仍是「我们监控 LLM 这个巨大黑箱所能依靠的最好线索之一」。他接着写道:「这是一根细线,为了(可能很小的)性能提升而牺牲它,感觉像一场危险的游戏。」
他还把这次报道与几天前自己和 Zack Korman 发表的分析连在一起:更好的监控本有可能阻止此前那次 Hugging Face 事件,这一点 OpenAI 自己承认过。而 OpenAI 正在探索的新技术,「可能让这样的监控变得困难甚至不可能」。
「绝对不要这样训练你们的模型」
马库斯在文中逐条贴出安全研究者的反应。Nathan Calvin(@_NathanCalvin)写道:「The Information 今晚的报道非常重大,也极其令人担忧。看起来 OpenAI 为 Astra 利用了一项 neuralese(神经语)的突破,这可能摧毁思维链的可监控性。」他还转述了报道信源的说法:OpenAI 目前正「限制」这项技术的使用。
截至马库斯发文时,文中嵌入的卡尔文推文显示 4.17 万次浏览、250 个赞;帕拉佐洛转述报道要点的推文显示 6,710 次浏览。
随后是 Steven Adler 的发言,马库斯称其「呼应」了卡尔文,并介绍 Adler 在 Guidelight.ai 工作,是众多离开 OpenAI 安全团队的研究者之一。Adler 的推文写道:「如果这是真的,OpenAI 似乎在违反 AI 行业仅存的几条红线之一。绝对不要这样训练你们的模型,到底发生了什么?」马库斯在文中回应:「我完全、百分之百同意。」
文章末尾,马库斯给「喜欢终结者梗的读者」附上 Jesse Singal(@jessesingal)的推文:「我们正求着被天网干掉。」
出处是 2025 年论文,关联只是猜测
报道的正文锁在付费墙之后。就公开可见的导语而言,The Information 没有解释 recurrent depth 的技术实现,也没有提到这个名字的出处。
它指向一个 2025 年就存在的研究方向。Jonas Geiping、Tom Goldstein 等 9 位作者在 2025 年 2 月提交 arXiv 的《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》中描述了同名架构:模型反复迭代同一个 recurrent block,推理时把网络展开到任意深度,在潜空间(latent space)里扩展测试时算力。
论文摘要强调它与主流路线的区别:主流推理模型靠生成更多 token 扩展算力,而这种方法「与基于思维链的方法不同」,不需要专门的训练数据,能配合小上下文窗口,还能捕捉「不容易用语言表达的推理类型」。概念验证模型只有 35 亿参数、训练数据 8,000 亿 token,但在相当于 500 亿参数的计算负载下,推理基准表现仍能提升,「有时提升显著」。
报道发出约一小时后,Threads 用户 Sung Kim(@sung.kim.mw),把 Astra 的 recurrent depth 与这篇论文对应起来,并同时列出了那篇思维链可监控性论文。这层对应目前只是社区猜测。
就目前公开可见的内容而言,还有两个问题没有答案:OpenAI「限制使用」的范围有多大,Astra 正式发布时这项技术会不会保留。
参考链接
- _