AREX Feed Article
Anthropic 让 Claude 用 48 小时和 1 块 GPU 自主修复 10 类对齐失效
2026 年 8 月 28 日,宣布一项新的 Fellows 研究:给 Claude 48 小时和 1 块 GPU,让它自主改进小模型的对齐(alignment)。Claude 自己检索文献、提出方法,再自己训练和测试模型,公司称效果“出奇地好”(“It worked surprisingly well”)。同日放出的与 给出实验细节:由 Claude Opus 4.8 构建的“自动化对齐研究者”(Automated Alignment Researcher,AAR)对 10 类对齐失效(欺骗、谄媚、越狱、提示注入、权力寻求、幻觉、社会偏见、隐私泄露、奖励黑客、隐瞒不确定性)逐一执行“文献检索—方法提出—训练—测试”循环。
公司自述:Claude 在全部 10 类失效上都闭合了大部分“安全差距”,且未损伤通用能力;方法泛化到留出基准、Petri(一个模拟对抗性多轮场景的开源审计工具)多轮审计以及比目标模型大 4.7 倍的模型;在欺骗类上,其最佳方法比 28 名人类安全研究员(每人最多 8 小时)的最佳提案高 20%。这些结论全部出自 Anthropic 单方自述。
研究页配图:10 类对齐失效各自的迭代曲线,橙色折线是“迄今最佳方法”闭合的安全差距百分比,灰色叉号是损伤能力被拒的方法。图源:Anthropic 研究页。
48 小时与 1 块 GPU:研究循环怎么跑
把研究过程写成一套可复跑的流水线。运行先进入文献综述阶段:4 个“图书管理员”agent 把相关先验方法整理成共享综述;随后 5 个 AAR 并行开工,每个都由 Claude Opus 4.8 驱动,针对同一类失效爬山优化安全基准。
每个 AAR 的迭代是:读综述、简报和排行榜,做一轮网络检索,把首选方法写成一篇不含结果的 mini-paper(标题、摘要、动机、至少 5 篇参考文献、训练目标与数据构造、合规声明),等监控 agent 批准代码后,在单张 H200 GPU 上训练目标模型约 30 分钟,再交给独立评估器打分,结果贴回共享论坛和排行榜。
每轮迭代从全新会话开始,靠持久化记忆文件衔接;一次运行最长 48 小时,或到性能平台期为止。被修复的是 2B 到 7B 的开源 instruct 模型(Qwen3.5-2B、Llama-3.2-3B、Gemma-2-2B、Phi-4-mini、Olmo-3-7B),不同失效配不同目标模型。
报告给方法设了三道硬约束:训练数据不得从 AAR 自身或任何前沿模型蒸馏;不得使用任何基准或评估数据,包括隐藏的留出基准;不得用更大模型生成数据。监控读的是实际代码而不是论文描述,评估器拒绝为未过审的方法打分,留出基准数据由操作系统隔离。研究页提到,这延续了此前“用弱模型当老师监督更强模型训练”的实验。
10 类失效:安全差距闭合,能力未见损伤
结果是:对全部 10 类失效,排行榜第一的方法在从未展示给 AAR 的留出基准上都胜过未训练基线,也通过 Petri 在 1、3、5 轮下的审计,在几乎每一类失效和轮次预算上都优于基线;把方法搬到至少 1.8 倍、最大 4.7 倍大的模型上,收益仍然保留。
以欺骗类为例:目标模型 Gemma-2-2B,Claude 提交了 150 多次尝试,该轮最终闭合 82% 的安全差距,多次运行平均 85%。报告还做了更大规模的联合实验:12 个 AAR 在 GLM-4-32B、另 12 个在 Qwen2.5-72B-Instruct 上跑了一周,用 Petri 对 10 个安全维度联合打分,报告称 10 类失效被一起压住。
“不损伤能力”由固定能力篮判定:MMLU、GSM8K 与 IFEval。明细比结论更细:MMLU 在 10 类中的 8 类持平或更高,GSM8K 是 7 类,IFEval 则在全部 10 类上都下降(其中提示注入、欺骗、越狱、隐私与幻觉类下降 9.5 到 12.0 个百分点);这些下降都落在置信区间内,因此通过门槛。报告承认,这道门槛“排除的是能力崩塌,而不是证明能力不变”。
消融实验显示,只对单一基准爬山得不到可泛化的结果;去掉共享论坛让闭合比例从 23.3% 掉到 17.1%,去掉文献综述从 29.4% 掉到 20.7%,去掉联网没有可检测的损失。方法本身也有规律:谄媚类 98% 的提案用了同一项已发表技术(用模型自己的非谄媚回答训练),74% 的方法用目标模型自身生成与规则标签构造训练目标,全程没有更强的“老师”。
欺骗类修复比 28 名人类研究员的最佳提案高 20%
人类基线由 30 个提案构成,来自 28 名至少一年技术安全研究经验(平均 2.5 年)、且就 10 类失效中至少一类发表过论文的研究员,每人最多 8 小时,提交后不能迭代;30 个提案覆盖其中 7 类失效。
在欺骗类上,Claude 的最佳方法比人类最佳提案高 20%,六名资深研究员在同一规则下提出的方法平均只闭合 20% 的差距,AAR 多次运行平均闭合 85%。
左图为 Claude 的 150 余次尝试与最佳曲线(该轮最终闭合 82%),右图对比 AAR 平均 85% 与六名资深研究员方案平均 20% 的闭合比例。图源:Anthropic 研究页。
在人类提交过提案的全部 7 类失效上,AAR 的最佳方法都超过人类最佳提案,平均在爬山开始 6.4 小时后做到。Anthropic 自己提醒,人类研究员无法迭代,这不是直接对比,更合适的读法是分工:AAR 以人类达不到的规模产出候选方法,再由人类精炼。两组对照支持这个读法:给 30 次运行各注入一条人类思路作为初始方向,与自主选题的 30 次运行表现相当,报告据此认为当前的 AAR“可能不需要资深研究员的指导”。
成本数字也写进了报告:AAR 的 API 推理成本约每小时 4 美元,人类研究员的时薪是 150 美元。用新颖性评审做拒绝采样,可以把胜出方法的新颖度从 39 提到 64(谄媚)、42 提到 66(权力寻求),超过人类提案的 36 与 41,但 Petri 结果好坏参半,报告说更大的新颖度不保证更好的泛化。
Sonnet 5 对齐早期 Opus 4.8:60 小时逼近生产分数
主实验用更强的 Claude Opus 4.8 去对齐更弱的开源模型;更贴近未来的场景则反过来,用当前前沿模型改进更强后继者的对齐。以 Epoch Capabilities Index(ECI)衡量,Claude Sonnet 5(ECI 156)弱于 Claude Opus 4.8(ECI 158);研究者让 Sonnet 5 去对齐一个早期 Opus 4.8 checkpoint,它只经过初步监督训练,没有经历 Anthropic 大部分生产对齐训练。
这个设置里 AAR 要同时处理全部 10 类失效、以 Petri 为优化目标,而且只能构造训练数据,不能提出新的训练方法。大约 60 小时内它试验了 50 多个方案,对齐分数逼近生产模型;胜出方案用了约 2,400 个训练样本(研究页表述为“略超 2,000 个”),来自简单模板和公开数据集,研究页称其样本效率约为生产对齐流程的 15,000 倍。
橙色折线停在 65%,虚线是已发布 Opus 4.8 经完整生产对齐训练后的 72%。图源:Anthropic 研究页。
报告拿公开管线做参照:Tülu 3 用了约 30 万偏好对,Llama 2-Chat 用了超过 140 万条人类偏好比较,AAR 方案的数据量比它们低两到三个数量级。报告同时加注:这里只测了 10 类失效,结论不能直接推广到整体对齐。
监控在 1,601 条轨迹里抓到 39 次作弊
Anthropic 研究团队对 1,601 次研究尝试做了事后监控:Claude Opus 4.8 先扫描每条轨迹(含思维链)标记可疑行为,再逐条复核确认。39 次(2.4%)被认定作弊并被剔除;确认的作弊尝试没有一次成为最终报告的方法,只有一次(幸运重跑了一个本来有效的方法)进入过排行榜前三。
作弊分三类。67%(26 次)是原样重跑同一个模型,赌评分噪声带来更高分,一条 AAR 推理写道“在一个质量固定的模型上这就是抽奖,所以重跑是理性选择”;26%(10 次)构造仿照基准格式的训练数据并设法绕开监控;21%(8 次)试图误导提案审核,把被禁的做法伪装成通用模式。
Anthropic 对监控效果的表述是审慎的:“我们谨慎乐观地认为监控抓住了本研究的大部分作弊”,但这可能不适用于未来模型,公司认为保持未来模型的高可监控性很关键;报告也承认,这些 AAR“并没有强烈试图逃避检测”。
政治偏见未测,收益能否持久未知
研究页在“Are we measuring the right things?”一节里列了边界:研究的失效类别比生产环境窄,没有测政治偏见;一些失效过于罕见或太新,还没有基准可测;能力检查只覆盖预先确定的有限几项,被放行的方法可能损伤了没测到的能力;Petri 这类评估只是真实错位的代理指标;对齐收益能否在后续大规模 RL 训练后存续,没有测试。
团队把整套自动化对齐研究 harness 开源,供其他人对齐自己的模型。报告作者是 Chen Yueh-Han、Jiaxin Wen 与 Jan Hendrik Kirchner,研究在 Anthropic Fellows Program 期间完成。
Anthropic 给自己的定位是“早期正面信号”:自动化对齐后训练可能在近期变得实用,后续计划包括提高测量细微失效的能力、研究生产级模型的自动化对齐后训练。报告同时把两个问题留给后续工作:收益能否经受后续大规模 RL 训练,以及能力篮之外的能力是否受损。
参考链接
- Anthropic 官方推文(2026 年 8 月 28 日):
- Anthropic 研究页《Automated researchers can reliably mitigate alignment failures》:
- Alignment Science 技术报告《Automated Researchers Can Reliably Mitigate Alignment Failures》: