AREX Feed Article
中国外交部回应 Anthropic 报告:不了解具体情况;同日 Green 批评其忽视重放攻击预警
9 月 11 日,中国外交部例行记者会上,法新社记者就 Anthropic 在 9 月 10 日发布的威胁情报报告提问。据,记者称该报告显示 Anthropic 已封禁多个据信与中国政府有关联的账户,相关行为者利用聊天机器人 Claude 收集海外宗教团体、在叙利亚维吾尔人和海外华侨华人团体的信息。发言人毛宁回答:「我不了解你提到的具体情况。中国始终坚持人工智能向善发展,同时坚决反对歪曲事实,对中国进行攻击抹黑。」这是中国政府对该报告的首个公开回应。
同一天,任教于约翰斯·霍普金斯大学的密码学家 Matthew Green(@matthew_d_green) Anthropic 的漏洞处置。他称自己 5 月就报告过相关加密问题,被告知重放攻击不在该公司的威胁模型内;而 9 月 10 日的报告显示,这类攻击已被利用数月。
记者会上,毛宁称「我不了解你提到的具体情况」
记者会实录由外交部官网在 9 月 11 日 19:20 发布;法新社的提问出现在这场记者会上。毛宁的回应一共两句:第一句表示不了解具体情况;第二句重申中方立场,强调中国坚持人工智能向善发展、反对歪曲事实和攻击抹黑。
报告中的中国相关案件:宗教事务情报与叙利亚维吾尔人行动
9 月 10 日,Anthropic 这份名为《Detecting and countering misuse of AI: September 2026》的。报告称,其威胁情报团队识别并阻断了 2025 年 12 月至 2026 年 8 月间试图滥用 Claude 的操作,覆盖网络行动、影响行动、监控、诈骗与欺诈、生物滥用、常规武器研发、蒸馏七类危害;每起活动都得到处置,相关账号被封禁,并在适当情况下与有关当局和行业伙伴分享了情报。
在监控章节,报告记录了多起与中国相关的案件。一起行动被描述为「与中国政府立场一致」:它用 Claude 追踪、画像并试图招募在叙利亚的维吾尔人,包括以报酬换取对当地武装单位的报告;报告称该行动的操作者不具备阿拉伯语能力,靠模型实时翻译,并让模型扮演「专家」为欺骗性沟通做质检,同时策划针对维吾尔海外媒体记者的协同打压行动。
另一起则被描述为与中国政府有关联的情报收集行动:它用 Claude 为亚洲多国的宗教领袖与海外华人群体制作中文档案,目标包括亚洲多国的天主教枢机、台湾基督长老教会领导层、藏传佛教社群与法轮功及其关联媒体;报告称该行动还勘查了宗教场所的平面图与结构,产出「人物调研底稿」「线索报」「态势感知」等内部格式文档。报告在综述中还称,中国一个宗教事务情报收集单位以前需要多组分析师,现在缩减为一个办公室,用 AI 助手每月产出数以千计的调查。
以上均为 Anthropic 报告的结论与说法;对其中具体案情,毛宁没有作出确认或否认。
Green 的批评:五月上报的加密问题与报告中的「重放」
Green 的批评围绕一个词展开:重放。他在推文中写道:「嘿,Anthropic!这些加密问题我五月就报告给你们了,你们说这无关紧要,因为重放攻击不在你们的威胁模型里。而现在看来,你们已经看着别人利用它们好几个月。我其实有点恼火。」在里,他说做这些测试主要是为了好玩,被要求走开反而让他可以把研究写成博客公开;让他不快的是,给一家万亿美元公司做免费的渗透测试,却连一句道谢都没有。
这些说法在 5 月已有公开版本:5 月 29 日,Green 在个人博客中写道,主流推理模型的 API 会把模型隐藏的原始推理(chain-of-thought)以加密副本的形式发给客户端;他发现,未修改的加密推理块可以被重放——不但在同一会话内,还能跨会话、甚至跨账号。他写道,自己把结果报给了 OpenAI 和 Anthropic 的漏洞赏金项目:OpenAI 称无法复现;Anthropic 则表示「他们认为侧信道或重放不存在任何安全影响」,但可能会更新开发者文档,提醒应用开发者多加小心。他当时给出的建议是:推理状态「不应该能跨会话或跨账户重放」。这篇博客在 8 月 11 日更新:一群来自欧洲各地的研究者受它启发,把这个手法做成了真正可用的攻击。
上述五月沟通的细节,出自 Green 本人的叙述。在他那条推文下,Or Hiltch(@_orcaman)称,他和团队曾报告 Claude Code 的一个远程代码执行(RCE)沙箱逃逸漏洞:漏洞被接受,但修复用了约 50 天才发布;他们向 Cursor 和 Codex 报告的类似漏洞约一周就关闭了。
「跨会话重放」:保存签名、新建会话、换回推理痕迹
在报告的「蒸馏」章节,也有一组手法以「重放」为名:「跨会话重放攻击」(cross-session replay attacks)。Anthropic 称,自 2026 年 2 月以来,公司已检测并阻断来自 7 家中国实验室、针对其公开模型的非法蒸馏活动,并点名了 Moonshot 与 DeepSeek。
按报告描述,Claude 回应时返回的是指向原始推理的「思考签名」(thinking signature),而不是原始推理文本,API 在后续调用中据此查回推理轨迹——这是 Anthropic 防止未经授权蒸馏的一项控制。报告称,Moonshot 保存响应中的推理签名、开启一个新会话,然后诱导 Claude 把签名转换回完整推理轨迹;报告把这类做法称为「跨会话重放攻击」,称它让蒸馏方绕过了上述控制。DeepSeek 使用了同一手法,并把用户请求静默转发给 Claude。
报告记录的规模是:Moonshot 在 2026 年 5 月至 7 月被观测到超过 2,300 万次交互;DeepSeek 在 7 月的 14 天里被记录到 1,210 万次交互。两段观测窗口集中在 5 月至 7 月,与 Green 所说「被利用好几个月」的时间段对应。
报告列出了多项应对:Claude 现在会先概括内部推理再作答,使被盗记录对训练别家模型的价值降低;Fable 5.1 引入「保留思考」(preserved thinking),阻止新的 API 账号修改位于推理之前的系统提示、工具或消息,报告称这是攻击者诱导 Claude 泄露推理的常见手法;当系统发现潜在滥用信号时,会要求账号完成身份验证。
跨会话重放的修复:「正在引入新的方法」
Green 在五月提出的建议是,让这类推理数据不能被跨会话或跨账户重放;九月的报告记录了这类重放被用于提取推理痕迹。
针对跨会话重放本身,报告给出的修复说明是:「我们正在引入新的方法,以加强对这类手法的防御。」报告没有说明这些方法的具体机制与时间表。
参考链接
- _