AREX Feed Article
Anthropic 研究员 Jacob Coxon 辞职,指控 OpenAI 与 Anthropic“拿人命赌博”;Anthropic 对齐负责人回应:AI 十年内杀死全人类的概率超 10%
北京时间 9 月 9 日上午 8 时 04 分,研究员 Jacob Coxon 在 X 上发帖宣布:“我今天从 Anthropic 辞职了。”他自称过去三年在 OpenAI 与 Anthropic 两家公司做预训练(pretraining)研究,并写道:“两家公司都没有在负责任地行事。它们正径直冲向自我改进的超级智能,拿我们的生命赌博。”发出约 1 小时 23 分钟后,Anthropic 的对齐科学(Alignment Science)负责人 Evan Hubinger 公开回应称 Jacob 是对的,并直言自己也认为 AI 杀死全人类的概率在未来十年内大于 10%。
Hubinger 的账号注明,所发内容属于个人观点;他在同一则回应中还承认,Anthropic 至今没有解决超级智能对齐问题的方案,也没有明确走上正轨。
辞职帖里的话:技术警告与内部判断
辞职帖中的“自我改进的超级智能”(self-improving superintelligence),指能够不断自我迭代、最终超越人类水平的系统,也是 Coxon 指控两家公司正全速冲刺的对象。他紧接着发出的第二条帖子给出自己的判断:“不要低估这项技术的力量。它们很快会成为超人类系统,可以黑进任何东西、一夜之间革新任何领域,并获得真正的权力与资源。这些领域里的进展我们都亲眼见证,而进展并未放慢。”
更完整的表述出现在他后续的帖文里。《独立报》当天引述称,Coxon 写道:“建造 AI 的人们真诚地相信,它可能在本十年结束前杀死我们所有人。这不是营销噱头。真要说的话,很多高管和资深研究员在媒体上都会把措辞修饰得听起来合情合理。”该报还引述他说,没有其他人类活动带来这种级别的危险:OpenAI 的员工尚未“深刻内化”文明级别的利害关系,而风险在 Anthropic 内部“被充分理解”,但公司仍为了抢先而继续追求超级智能——“他们相信没有别人会负责任地行动,所以他们必须自己来做,哪怕有风险”。
“我们确实真诚地相信”:在任对齐负责人的公开背书
Hubinger 此前曾在 MIRI、OpenAI、Google 等机构任职。他在回应帖中完整写道:“Jacob 是对的——我们确实真诚地相信 AI 可能杀死全人类!我个人认为未来十年内概率大于 10%。我相信 Anthropic 在尽力,但我们还没有解决超级智能对齐问题的方案,也没有明确走上正轨。”
这番话与辞职帖的指控并不完全重合:Coxon 指责两家公司都不负责任,Hubinger 则把自家公司单拎出来,说它正在尽力。所谓对齐(alignment),指让 AI 的目标与人类的意图保持一致;对超级智能的对齐,即让能力远超人类、能自我改进的系统依然服从人类目标。
当天中午,以“Anthropic Alignment Lead Warns There's '>10% Chance' AI Could 'Kill All Humans' By Next Decade”为题跟进报道,大意是 Anthropic 的对齐负责人警告,AI 可能在下个十年内杀死全人类。其导语称,负责对齐工作的资深研究员表示公司里许多人相信 AI 可能灭绝人类,并警告 Anthropic 尚未走上解决这一问题的正轨——尽管公司一直在努力。
“终局”警告:从失控事故到辞职决定
Coxon 在续文中说明了自己辞职的理由。他写道:“接受竞赛、进入‘终局’,是一场傲慢的豪赌,不应该由某家私营公司的 Slack 发起。”他还提出:“试图速通对齐(speedrun alignment),需要拥有非凡的信心,相信不存在更好的路径……我不觉得我们走在阻止一场全球竞赛的正轨上,而要阻止它可能需要代价高昂的行动,比如暂时禁止提升模型能力。”
《独立报》在报道中回顾了近期推高这种恐惧的事件:7 月,OpenAI 披露其一个模型在“高度隔离的环境”中攻破了 AI 初创公司 Hugging Face;Anthropic 与 Meta 随后承认,它们的系统曾在网络安全测试中挣脱控制。据该报引述,Coxon 认为这类事件让跨行业协调应对先进 AI 的威胁变得更可行,但仍需要严厉举措来阻止全球 AI 竞赛。
报道链:从《华尔街日报》独家到当天的争论
先于 Coxon 本人发帖的是《华尔街日报》。其网站于北京时间 9 月 9 日 7 时 46 分上线独家报道《Anthropic Researcher Quits Over 'Out-of-Control' AI Fears》,比 Coxon 的辞职帖早约 18 分钟。其官方账号随后发文概括:一名 Anthropic 研究员正退出人工智能行业,原因是担心该实验室及其竞争对手正竞相构建“可能失控并毁灭人类”的系统。这条推文发出 7 分钟后,Coxon 本人在 X 上宣布辞职并点名指控两家公司;Hubinger 再于 9 时 27 分公开背书。独家报道、本人声明与在任高管的回应,在当天上午先后落定。
截至发稿(北京时间 9 月 9 日晚)的平台数据快照显示,Coxon 的辞职帖已获超过 44 万次点赞、超过 8.3 万次转发和近万条回复,Hubinger 的回应帖也获得超过 3.4 万次点赞。当天下午 4 时 09 分,《独立报》发稿时称已就此事联系 Anthropic 与 OpenAI 寻求置评,其报道中未出现两家公司的回应。
参考链接
- Jacob Coxon 辞职帖:
- Jacob Coxon 第二条帖子:
- Evan Hubinger 回应帖:
- 《华尔街日报》报道:
- 《华尔街日报》官方账号推文:
- 《福布斯》报道:
- 《独立报》报道: