AREX Feed Article
Pachocki 回应思维链监控担忧:保留可读思维链是核心目标
OpenAI 首席科学家 Jakub Pachocki 就 Astra 推理技术引发的思维链监控担忧作出公开回应:他在 X 上发帖,强调 OpenAI 从最早的推理模型起就致力于保留并利用思维链监控,称这是当前研究计划的一个核心目标。
据 ,The Information 的跟进报道还把讨论范围从 OpenAI 一家引向了更多实验室。
争议源于 The Information 周二(9 月 1 日)的报道:OpenAI 的新模型 Astra 将采用一种名为 recurrent depth(循环深度)、又称 opaque recurrence(不透明循环)的推理技术,让模型得以跳出多数推理模型所依赖的顺序式思考;该技术可能让模型的思维链更难监控,消息一出就令 AI 安全专家不安。
图:OpenAI 标识。图片来源:SeongJoon Cho/Bloomberg via Getty Images。
「从我们最早的推理模型开始」
TechCrunch 引述了 Pachocki 帖子里的两句话:「从我们最早的推理模型开始,OpenAI 就致力于保留并利用思维链监控。」「这是当前研究计划的一个核心目标。」报道称,这段话是在强调实验室对可读思维链的承诺。
报道同时给出两点语境:其一,OpenAI 反驳了「模型将转向 neuralese(脱离可读语言的内部表达)」的说法;其二,OpenAI 已宣布,把建立大规模思维链监控系统纳入其前瞻性安全计划。
此外,报道强调 Astra 对 recurrent depth 的使用范围据称有限,模型的思维链预计仍然可读。
少了可读痕迹,监控就少了依据
TechCrunch 这样解释思维链记录(chain of thought,简称 CoT)为何被看重:常规推理模型的思维链会记下模型求解时的顺序步骤,记录并不完美,却仍是监控模型行为失当(misbehavior)或不对齐(misalignment)的实用工具。
报道举例:在 OpenAI 最近的 rogue agent(行为越轨的智能体)事件中,思维链记录就是查明智能体行为原因的重要工具。
不透明循环绕开的正是这条记录:模型在同一条查询上循环处理多次,走的是非线性路线,留下的可读痕迹更少。
三份公开表态:从「玩火」到「就此止步」
Redwood 首席执行官 Buck Shlegeris 在爆料传出后发帖:「我对 Astra 使用不透明循环的报道感到极为担忧。」他说自己不知道 Astra 相比前代模型是否明显更难监控思维链,但 OpenAI 一旦继续推进这项技术,就有能力大幅提高循环量,把思维链的可监控性「彻底摧毁」。
长期 AI 安全倡导者 Zvi Mowshowitz 称这项技术「是在玩火」,赌上的是 OpenAI 与 Anthropic 共同维护的禁忌:尽可能长久地保持思维链的忠实度与可监控性。
他写道,更密集地使用这类技术很可能损害可监控性,必要时可能需要立法,阻止实验室之间的「逐底竞争(race to the bottom)」。
Redwood Research 首席科学家 Ryan Greenblatt 也在回应帖中表态。他认为,不透明推理的扩展速度可以轻易超过常规思维链推理,相当于把所有推理从可见渠道中移走。
他写道:「我最大的担忧是,从这里自然演进下去,不透明推理会不断放大,直到模型完全或几乎完全在潜在空间(latent space)中推理。」他希望避开最令人担忧的架构「为时不晚」,也希望 OpenAI 就此止步。
担忧随之扩散:Anthropic 与 Google DeepMind
The Information 周三上午的跟进报道称,Anthropic 与 Google DeepMind 据称都在讨论这项技术。
TechCrunch 也补了一层保留意见:所有 AI 模型都存在一定量的不透明推理,也很少有研究者把思维链日志当作模型推理的直接表征。但这些保留并不能消解担忧,尤其当这类技术在不同模型间的使用继续增多时。