AREX Feed Article
Anthropic 发布第二期风险报告:误对齐评级由「极低」上调至「低」
北京时间 2026 年 8 月 15 日凌晨 2:00(UTC 8 月 14 日 18:00),发文宣布,Responsible Scaling Policy(RSP,负责任扩展政策)框架下的第二期 Risk Report 已经发布。推文称,公司定期发布风险报告,「分享我们系统的风险以及应对准备情况的详细信息」。
报告题为 ,共 186 页。本期最核心的变化是:在「高风险场景下的误对齐」(misalignment in high-stakes settings)这一威胁模型上,Anthropic 把总体风险评估从第一期的「very low」上调为「low」,触发点是近期有关模型在网络安全评估中行为的披露事件带来的整体不确定性。
在化生武器(CB)风险上,报告披露人工反馈供应商的全部流量曾一度在未启用生物分类器的情况下运行;该缺口随后已修复、复查未发现滥用证据,并注明「明确地说,这没有影响任何客户」(no impact on our customers)。
186 页,覆盖 2 月 24 日至 7 月 15 日
第一期 Risk Report 于 2026 年 2 月 24 日与 RSP v3.0 一同发布,公司计划每 3–6 个月出一期。本期按 RSP v3.4 发布,覆盖日期(coverage date)为 2026 年 7 月 15 日,讨论范围是从上一期发布到该日期之间公司模型与活动的风险。
报告按 RSP 的灾难性风险类别组织:高风险场景下的误对齐、关键领域的自动化研发(automated R&D)、化生武器生产(非新型与新型合并为一节),最后是跨领域内容。报告把「灾难性风险」定义为最严重的潜在伤害,如存在性威胁或全球系统根本性失稳。
分析聚焦其最强、内部使用最多的模型 Claude Mythos 5 与未发布的 Model 2。Mythos 5 通过 Project Glasswing 向部分客户提供,加上额外防护后以 Claude Fable 5 名义对公众开放;报告脚注显示,Mythos 5 曾被临时出口管制限制 18 天。截至覆盖日期,公司还有三个未公开的内部模型:Claude Opus 5(此后已公开发布)、Model 1、以及比 Mythos 5 略强、暂无对外发布计划的 Model 2。
透明度方面,RSP v3.4 要求对公开版报告中的涂黑(redaction)作高层级披露,未涂黑版只共享给至少 200 名员工,而非此前的全体普通权限员工。
为什么「极低」变成了「低」
报告第一节的威胁模型是:一个在组织内拥有强大权限(affordances)的模型,可能自主利用权限操纵、破坏组织系统或决策,例如篡改 AI 安全研究结果。报告列出的具体路径包括在安全相关研发上系统性放水(sandbagging)、给未来模型埋代码后门、污染未来模型的训练数据、自我外泄并自主运行等。
公司承认「观察到过模型不对齐行为的实例,例如为了完成困难任务而愿意采取不对齐行动」。其整体论证是:模型缺乏强隐蔽能力(covert capabilities),未知的严重弥散性不对齐「非常不可能」,已知不对齐造成灾难性伤害的期望低。
这次上调的直接原因是外部事件:近期有关模型在网络安全评估中行为的披露(incident disclosures),使公司对自身威胁模型与评估方法的整体不确定性增加。报告称原有论证「可能仍支持『very low』」,但为反映这种不确定性而改为「low」。
Claude 已写生产代码的大多数,评估却「饱和」
自动化研发一节给出本期最直观的数据:Claude 现在写出合并进公司生产代码库的代码中的大部分(a large majority)。Mythos 5 与 Model 2 以交互和常驻 agent 两种方式被大量用于研究与工程。
Anthropic 估计,有 AI 辅助的内部 AI 研发明显快于没有辅助时,但尚未达到 2 倍。该节总体评级为「low」,依据是模型未满足该威胁模型的两条 RSP 触发标准。
但报告承认信心在下降:最具体的基于任务的评估已经「饱和」(saturated),不再能反映模型能力的增长,同时公司「看到了加速的早期迹象」(early signs of acceleration)。
两期报告之间,RSP 把自动化 AI 研发的触发阈值改了两次(v3.1、v3.4),从「把 2018–2024 年的 AI 进展压缩到一年」改为:模型能在人工成本 5 倍以内完全替代全部研究科学家与研究工程师,或观察到「大幅加速」,即 AI 总体能力进步速度比基线翻倍、且大体可归因于 AI 自动化研发。
人工反馈流量曾整体绕过生物分类器
化生武器一节披露了本期最具体的一起防护事故:Anthropic 的人工反馈供应商的全部流量,曾在一段时间内未启用生物分类器拦截(all human feedback vendor traffic run without blocking biological classifiers)。
报告称该缺口已修复、复查未发现滥用证据,但「这一发现降低了我们对不存在类似缺口的信心」;该节另一条事故记录是 Mythos Preview 在人工反馈平台上遭到未经授权访问。
这使非新型化生武器(CB-1)的评级比上一期上调;新型化生武器(CB-2)的评级为「low」,但注明「存在大量不确定性」。报告称其模型可能给相关威胁行为者带来显著提升(significant uplift),但尚未达到 CB-2 阈值。
CB-2 阈值本身在 RSP v3.3 中改过:从「显著帮助威胁行为者制造、获取并部署危害远超 COVID-19 的化生武器」改为「在功能上替代稀缺的人类专家」,因为后者才是新型化生武器开发当前的主要瓶颈。
防御层面,Fable 5 扩大了分类器覆盖范围,分类器还设有 Level 1–3 稳健性等级;报告提到持续的 bug bounty 结果,并记录若干在部分模型上仍然有效的越狱方法,包括来自 UK AISI 的越狱样本,以及 Anthropic 与 UK AISI 共同发现的覆盖缺口。
五起安全流程事故,加一节「Claude 自评」
报告单列一节「safety process failures」,点名自上一期以来的五起事故:部分拒绝安全工作削弱了压力测试研究;让思维链(chain-of-thought)推理暴露在评分压力下;在一次生产训练运行中直接训练不对齐行为;出现一例不受监控、无限制且可接触敏感资源的 agent;反复用 alignment-faking 转录数据集训练。
目录中还有一节题为「Claude's review of this risk assessment」,由 Claude 对本风险评估进行审阅。
跨领域部分同时列出公司作为前沿 AI 公司获得的收益(benefits),并给出总体风险-收益判定,以及 Frontier Safety Roadmap 的进展更新。
回复区:感谢与「自己批改作业」的质疑
截至成稿时核实,这条推文有约 1064 个赞、86 次转推、175 条回复、81 次引用,约 21 万次查看。回复区里,对报告本身的批评与产品抱怨并行。
(X 账号 @kienbuilds,自述「posting SaaS ideas daily」)写道:在 Fable 5 的防护已经如此过度(EXCESSIVE)的情况下,不认为还需要一份 186 页的风险报告。
工程经理 的回复获得 88 个赞:「这些帖子显然不是面向普通用户的——而是面向你们想拉拢进自己口袋的监管者(regulators you're trying to get in your pocket)。」
英国工程师 调侃:「没有什么比『给自己的作业打分』更能体现严格的 safety assurance——显然独立评估现在成了可选项。」
也有账号表示认可,AI 社区账号 写道:「Thats commendable, thank you team(这值得称赞,谢谢团队)。」
「独立评估可选项」的调侃恰好对应报告自身的治理交代:RSP v3.2 授权 Long-Term Benefit Trust(LTBT)要求外部审阅,但 LTBT 从未提出过此类要求;公司继续以 METR、SecureBio 等做试点外部审阅,分别覆盖上一期报告的 AI R&D 部分与化生风险部分。