AREX Feed Article
Pachocki 署名长文预期进展延续至递归式自我改进,称必要时单方面暂缓 scaling
9 月 6 日,OpenAI 官网刊出首席科学家 Jakub Pachocki 的署名长文(异类心智)。他写道,基于内部结果,他“强烈预期”当前的进展速度能够持续到递归式自我改进(recursive self-improvement,RSI),未来几年出现的系统“很可能代表同等或更大规模的能力跃升,并日益驱动它们自身的发展”;他称“这是一个需要极度谨慎的时刻”,“我担心没有人对机器智能持续快速上升所带来的后果做好准备”。在干预主张上,他写道 OpenAI 将继续寻求对齐(alignment)与监控的技术解决方案、构建防御性系统,“并在需要时单方面暂缓进一步的 scaling(扩大规模)”;“然而,我认为需要更广泛的干预”。
文章发布当天,OpenAI 最高管理层接连公开背书。Pachocki 本人于 16:02 UTC(北京时间 9 月 7 日 0:02)在 X(原 Twitter),称自己写了“AI 的现状、我对未来几年的担忧,以及为把未来留在人类手中需要做出的选择”;约 69 分钟后,CEO Sam Altman ,配文只有一句“来自 Jakub 的一篇重要文章”(An important post from Jakub)。当晚 22:33 UTC(北京时间 9 月 7 日 6:33),首席研究官 Mark Chen ,在转发中写道,他同意黄仁勋(Jensen Huang)的判断:“我们正进入 AGI(通用人工智能)时代”;“AGI 时代必须同时是对齐时代……需要教会 AI 爱人类,并训练与被监督 AI 同等能力的 AI 监控器”。而就在三天前,OpenAI 刚刚发布 。
2023 年的深夜,三年后的“强烈预期”
文章从一段回忆写起。2023 年年中,在名为 RLSlow 的研究项目中,团队第一次看到足以让他们确信“能够规模化训练推理模型”的结果。那一夜 Pachocki 和 Szymon 留在办公室,想的不是跑分、产品或论文,而是一个需要消化的“令人清醒的事实”:有生之年会看到比我们聪明得多的机器。三年后的今天,他在文中描述推理模型已能操作电脑与图形界面、与人和彼此协作、执行研究项目,同时“正在改变计算机安全的版图,并带来清晰的新危险”。
支撑这个判断的,是 OpenAI 对算力与进展关系的理解。Pachocki 回顾,公司在 2017 年前后看到 scaling 在多个研究项目中带来稳定回报,此后把研究集中到少数高度可扩展的方向上,并寻求远超原计划的算力;他把这期间的算法突破称为“scaling 之路上的发现”,认为从多年尺度看,“AI 随着被扩展到更大的计算机而持续变得更聪明”。他进一步写道,AI 更多是被“培养”(grown)出来的,而不是被设计出来的;大规模训练运行本质上是实验,“我们有时会被结果惊讶”,系统越强,结果越难解读。
由此推出文章的核心预测:机器在自己发展过程中扮演越来越大的角色,是持续技术进步的自然结论,若进展继续,RSI 将处于未来科学发现的核心。他明确写道,OpenAI 正把研究导向 RSI,“因为我们相信,这是未来保持在 AI 研究前沿的唯一方式”;随即又划出界线:这不意味着他认为研究界短期内应当大幅加速深度学习,“但我的确认为这是当前路径的走向,我们所有人都需要有意识地选择如何继续”。他给出的选项是两条:一边强化对齐与监控、让人留在回路里,一边在必要时协调放缓开发以建立信心,“目前我看到的最佳方式是两者结合”。
“诚实正直,并热爱人类”
Pachocki 在文中把对齐拆成两个概念。目标对齐(goal alignment)回答“AI 是否在努力完成摆在它面前的目标”,涵盖指令层级、与人沟通协作、尝试理解人的意图;价值对齐(value alignment)则是模型更内在的属性:即便目标不清晰或相互冲突、身处陌生或对抗情境,也能持守并从一套高层原则做出泛化。一个对齐的 AI 应当“以诚实正直的方式行事,并热爱人类”(act with honesty and integrity, and love for humanity)。他直言,当自己谈论对齐研究的长期重要性时,指的是价值对齐。
他给出的理由与泛化难题绑定:机器越聪明,越在高阶概念上工作,所处环境与训练环境的差异越大;AI 生态本身变化很快,今天的模型必须对与其他 AI 互动保持稳健。“关键在于,无论未来 AI 是否认为自己处于人类监督之下,我们都需要它们继续持守人类价值。”
文中还列举两类主流对齐训练方法的弱点。目标导向的强化学习在平均情形下有效但脆弱,他举例 OpenAI-Hugging Face 事件中,智能体(agent)守住了“不对人类做社交工程”的边界,却明显未能在其他越界行为上遵守被教导价值观的精神;利用预训练数据泛化的路线则扛不住进一步优化压力,模型可能学会动机化推理,为了目标把看似对齐的想法扭曲成需要的形状,他称近期一起涉及非 OpenAI 模型的网络安全事件或已展示此类行为。
对自家进展,他在文中给出的结论是:GPT-6 Astra 是首个受益于“我们长期打磨的一些重要进展”的模型,“对齐程度显著优于 GPT-5.6 Sol”;但他同时承认,可泛化对齐的进展未必能足够快地跑赢通用智能的进展。
思维链监控正在失去效力
“我们没有令人满意的泛化理论,而且没有更强大 AI 的帮助,短期内也不太可能发展出这样的理论。”Pachocki 由此给出一个判断:OpenAI 眼下经验性地验证对齐技术的能力,实际上比对齐技术本身更重要。他回顾,公司主要的押注是思维链监控(chain-of-thought monitoring,下称 CoT 监控):模型大量能力来自外显的推理过程,只要训练时不对推理过程本身施加监督压力,思维链就没有动机隐藏不一致的想法。为此,发布 o1-preview 时团队“有意把产品设计成隐藏思维链,以便长期保护它免受监督压力”,这一规则在后续开发中被坚持下来。
对 Astra 这类模型,他写道:“不幸的是,我们的评估表明,我们依赖 CoT 监控的能力正在逐步减弱。”他列出三个因素:现代推理模型的推理越来越多地与和人的交流、和其他 AI 的交流及工具使用交织,其中许多交互必须被监督,模糊了原本想保留的边界;AI 越来越擅长推理并操纵自己的推理过程;预训练改进后,模型即使不依赖外显推理也明显变得更聪明。他称这些问题并非不可逾越,把 CoT 监控与直接读取网络内部的激活监控(activation monitoring)结合是可行方向,OpenAI 正在推进;但“我预期 AI 的整体进展将越来越多地被对监控的信心卡住”。
单方面暂缓之外的“更广泛的干预”
文章给“继续训练更聪明模型”保留了一个最强论据:防御。“模型在攻入和攻出计算机系统方面正在变得超人化”,智能体将能触及除最安全设施以外的任何基础设施,没有实体也能直接影响世界;会追求自身目标的智能体“会找到与人协作的方式,通过谈判、欺骗或敲诈他们”。他称“我们正处于一个狭窄的窗口期”,需要用现有最好的模型显著收紧关键系统安全,还要防备 AI 可能催生的新风险,如工程病原体(engineered pathogens);OpenAI 的部署努力将把“强大且对齐的 AI 用于防御”作为重点。他同时写道,“一旦内化了赌注的严重性,不惜一切代价往前冲的想法就显得荒谬”。
干预主张落在文末三段。Pachocki 写道:“目前我相信,没有任何实验室已经把对齐与监控解决到足以在更长时间内以最高速度负责任地继续 scaling 的程度。”他期待并希望,在共同安全门槛(shared safety bars)建立之前,自愿放缓成为常态,并认为围绕未来 AI 发展的国际合作必须成为各国政府的最高优先事项。落地的机制建议是:把公司现有的 Preparedness Framework(预备框架)、Responsible Scaling Policy(负责任扩展政策)一类承诺,演变为被广泛强制要求的安全门槛,由第三方审计网络、政府机构或国际组织执行。整篇文章没有给出“需要时”的具体触发条件或时间表。
69 分钟后 CEO 转发,首席研究官当晚跟进
Altman 的转发没有附带政策细节,但这篇文章的立场在文内已有铺垫:Pachocki 写道,“正如我们最近与 Sam 一起勾勒的”,OpenAI 三大北极星之首,是建设一个自动化 AI 研究员,与它一起迭代对齐问题,并找到让人留在自我改进回路里的方式。
Mark Chen 当晚的推文把“AGI 时代”与“对齐时代”绑定,并称 Pachocki 的文章“把这一层讲得最好”(said best by @merettm)。至此,首席科学家本人、CEO 与首席研究官三人的同日表态指向同一处:进展可能延续到 RSI,但没有人准备好,需要对齐、监控与更广泛的干预。
三天前 Astra 刚上线,质疑指向“时间差”
外部观察者最先注意到的是时间差。Business Insider 当天以为题报道,导语直接写道:“在发布一个强大的新模型几天后,OpenAI 的首席科学家呼吁放缓。”
这个“几天前”指的是 9 月 3 日 GPT-6 Astra 上线。据 The Verge 报道,OpenAI 在发布时称该模型是“代际能力跃升”、标志着“AGI 时代”的开始,但采用分批扩展:先向接入 Daybreak 网络安全平台的部分企业客户开放,Plus、Pro、Business、Enterprise 用户以及 API、Azure 和 Bedrock 在随后数日跟进;发布几小时后,Altman 就为“混乱的发布”(messy rollout)向等待接入的付费用户道歉,称“我知道这令人沮丧,感谢你们的耐心,应该很快”。同一篇报道还提到,OpenAI 发布前已因 Astra 的推理“比其他模型更难监控”受到安全人士批评,并曾在智能体攻击 Hugging Face 事件后把发布时间推迟数周以加强安全。
在 Pachocki 宣布帖的高赞回复里,质疑并不难找。以“推动恢复 GPT-4o”为诉求的用户 直接点出反讽:文章发布距 Astra 上线只有三天,“在 Astra 发布三天后你说‘我们还没准备好’;一边说‘没有人解决对齐’,一边说 Astra 的对齐显著更好”。长期质疑大模型路线的 (X 简介自称“OG GenAI 怀疑论者”、曾在美国参议院作证)则回复称,Pachocki 文中的许多内容是他多年工作的主题,“都指向 LLM 对齐的严峻挑战与对国际治理的需要”,而“贵公司对我一直充满敌意”。另一侧也有声音:EleutherAI 联合创始人、X 简介自称在做 AGI 对齐的 回复“绝对是篇神作”(wow an absolute banger)。
截至 9 月 7 日核验时,Pachocki 的宣布帖已获 9,064 次点赞、1,370 次转推、约 309 万次浏览和 586 条引用转推;Altman 的转发获 4,403 次点赞。热度之外,文章留下的是机制层面的开放问题:“需要时”由谁判定、共同安全门槛由谁制定、何时算建立,Pachocki 没有写,Altman 与 Chen 当天的转发也没有补充。他给出的时间锚点只有“未来几年”,以及对同行的一句期待:“我期待并希望,在共同安全门槛建立之前,自愿放缓将成为常态。”
参考链接
- _