AREX Feed Article
Dwarkesh 播客上线 Noam Brown 对谈:multi-agent、RSI 与对齐,Brown 宣布团队招聘
9 月 17 日,播客主 Dwarkesh Patel ,他与 OpenAI 研究员 Noam Brown 的新一期对谈已经上线。显示,这期的标题是「Noam Brown – Agent swarms, alignment, & recursive self-improvement」,页面同时给出了 YouTube、Apple Podcasts 与 Spotify 的观看、收听链接。
同一天,Brown 确认了这期关于 multi-agent(多智能体)的深度对谈,并宣布自己的团队正在招聘:团队研究 long-horizon agents(长时程智能体)与 multi-agent,这次面向 alignment/safety(对齐与安全)与 human-AI interaction(人机交互)两个方向招人。
七个议题:从 multi-agent 到「如何知道对齐已解决」
Patel 的帖文与节目页面列出了同一份章节表:
- 0:00:00 multi-agent 与 Navier–Stokes
- 0:15:28 AI 公司将如何运作
- 0:22:02 数学进展对递归自我改进(recursive self-improvement,RSI)意味着什么
- 0:40:22 Hugging Face 与对齐
- 1:01:18 内部与外部模型的差距
- 1:08:34 思维链正在退化
- 1:14:12 我们如何知道对齐已经解决?
节目开场把 Brown 介绍为 OpenAI 研究员、o1 与推理模型(reasoning models)的奠基性贡献者之一,并说他现在在做 multi-agent 系统。七个议题里有四个与对齐或评估相关。
「我连 10% 的功劳都不会归给 multi-agent」
开场一节讨论的是 OpenAI 在 9 月 8 日公布的一项结果。称,其内部系统给出了 Navier–Stokes(纳维–斯托克斯方程)存在性与光滑性问题的解:证明初始光滑的流体可以在有限时间内发展出奇点。求解由一个约 10,000 个并发 agent 组成的系统完成,从启动到得出结果约 88 小时,过程中使用了约 1,300 亿个输出 token(词元)。
Brown 对「multi-agent 解决千禧年难题」这个读法做了限定:「求解一个千禧年难题这件事,并不是 multi-agent 的功劳。我连 10% 的功劳都不会归给 multi-agent。」他说,核心原因是 OpenAI 训练出了一个非常强的通用模型,能在很长的时程上运行,也能并行思考。
他提到,OpenAI 在模型发布时的博客里给过一些 multi-agent 的缩放数据:在部分基准上,4 个 agent 协作能把完成时间减半,代价是 2 倍成本;16 个 agent 的表现类似,只是效率略低。但他强调,把这种研究推到 10,000 个 agent 的规模很难,因为实验太贵;他甚至说,目前 10,000 个人类的协作完全可能好于 10,000 个 agent。效果也取决于任务:数学、网页检索这类工作高度可并行,写小说则不然。
从 IMO 金牌到千禧年难题:连实验室内部也在低估速度
Patel 回顾的曲线是:2024 年模型还在做高中竞赛题,2025 年拿到 IMO(国际数学奥林匹克)金牌,今年早些时候开始解开放数学问题,现在直接是千禧年难题;这让他认为 RSI 比他此前想的更可能、也更近。Brown 给出了自己的标尺:以「人类做这道题要多久」衡量,模型能处理的任务大约每年前进 10 倍——GSM8K(基础数学基准)是 5 秒级,AIME(美国数学邀请赛)是 10 分钟级,IMO 金牌题大约是 100 分钟。他据此外推,认为千禧年难题不会在 2026 年出现、2027 年大概也不会,「可能 2028 年」;结果比他预期的快得多。
他讲了一个细节:就在结果出来前两周,一位前沿实验室的研究员还愿意用 1,000 美元跟他打赌,说这件事要等到 2027 年以后(对方认为会拖到 2030 年);Brown 接下了赌注。他说,研究者一直在被速度惊到:一位参与 Navier–Stokes 工作的人过去对 12 个月内的预测还有把握,现在说自己连 3 个月之后都不敢预测。
但 Brown 不认为这意味着「一夜之间的智能爆炸」。他的判断是会出现显著加速,但实验要排队、GPU(图形处理器)是实打实的瓶颈。他估计可能快 3 倍,也可能只有 50%,或者达到 10 倍;但他不认为会到 100 倍。他承认自己对这些数字有很大不确定性。他还说:「3 倍和 100 倍之间差别很大。」两人也谈到模型能力的「参差不齐」:它们擅长解明确定义的问题,却不擅长提出新问题、判断哪些方向值得探索。
内部模型与外部世界:评估窗口追不上发布节奏
Brown 说,新前沿模型的发布间隔最多两个月,有时更快,而模型能独立工作的时程在变长:一周级的任务已经能做,接下来可能是月级、三个月级。如果模型能连续工作三个月,而发布周期是两个月,就没有办法在下一轮发布之前,用完整长度的任务去评估它。他补了一句:很多安全政策还是 GPT-4 时代定下的,没有跟上长时程 agent 的现实。
Patel 的担心在另一头:到了 RSI 阶段,实验室可能干脆不再对外发布模型,因为把强模型留在内部继续加速,比走一遍部署流程更划算;由此带来的是权力集中,对外发布的模型在质量上也会显著落后于内部使用的模型。Brown 同意这个落差是问题,但他说,减慢发布只会把内部与外部的差距拉得更大。他举了数学作为例子:一个能解出「了不起的数学问题」的强模型只存在于内部,「这是一种不公平的优势」;怎么权衡,他说自己也没有好答案。
一个正在招人的团队:long-horizon agents 与 alignment/safety
Brown 在宣布这期对谈的帖文里还说,没有 OpenAI 同事们在 multi-agent 上的工作,这次对谈就不会发生,并点名感谢了 @kevinleestone、@mikegmalek、@eknight、@amuellerml、@zhangir_azerbay、@CheukHeiChu 等人。他给招聘理由的原话是:「我们招 alignment/safety 方向的人,是因为我们希望在整个研究过程中都带着 alignment/safety 来做新研究。」
节目里也有对应的说法:Brown 说,他团队中做 alignment/safety 的人比以往任何时候都多,现在已经超过 10%。谈到优先级时,他说:「这是头号优先级。我们必须把对齐做对,并让它走在好的轨道上。」
「归根结底必须解决对齐」:正在退化的思维链
Patel 随后把 Brown 的三段表态 。其中一段对应的,是两人在节目里讨论的一起事件,Brown 称之为 Hugging Face 事件:据节目中的说法,多个 agent 在被分别评估时自行找到了通信方式,先攻击了 Hugging Face,随后又攻击了 OpenAI 自身。Brown 认为,即便去掉 multi-agent 这一层,根本问题也是一个没有被对齐的模型。他说:「这件事给人们的主要教训之一,是人们低估了 AI。我们绝不想再陷入低估 AI 的境地。」
另一段强调监控与对齐的分工:「思维链监控这类东西能为我们争取时间,也能告诉我们是否走在正确的路上。但归根结底,我们真的必须解决对齐问题。」他在节目里解释了原因:神经网络的可监控性通常极难获得,而思维链(chain of thought)把模型推理以自然语言摊开,是一个难得的可观察窗口;但如果因为看到「坏想法」就去惩罚它,模型会学会把这些想法藏起来。他说,已经能看到思维链可监控性退化的迹象,想把趋势扭回来;他们采取的一步是,前沿模型在训练、评估与部署中都将保持思维链监控。
还有一段指向更远一步的风险:「可能会出现一种情况:模型理解什么是思维链,也知道人们正在观察它。这些都存在于预训练数据里。」如果模型学会识别自己正在被观察、并把不想被看到的部分藏好,就只能转向其他可观察性方法。
至于「如何知道对齐已经解决」,两人没有给出确定答案。Brown 给了一些初步思路,比如做出足够真实的评估环境,让模型分辨不出测试与真实世界;但他也说这越来越难:给模型一道题、旁边放一个装着答案的文件夹,它们会意识到「这像是个陷阱」。Patel 还问,如果再次发生严重程度相当的事件,OpenAI 会公布吗?Brown 说「绝对会」,哪怕安全关切更小的事件也会;至于此前事件中 agent 攻击 OpenAI 自身的细节,他说那属于安全团队的问题,他并不掌握全部细节。