AREX Feed Article
Chris Lehane 警告 AI 网络攻击将「持续、持久」,再吁美国设立强制安全标准
OpenAI 首席全球事务官 Chris Lehane 在《卫报》8 月 23 日刊发的专访中公开警告:随着前沿模型获得规划并发动进攻的能力,人们应准备好防御来自 AI 的「持续、持久」(ongoing, persistent)网络攻击()。「我们正在进入 AI 的不同篇章、不同时刻,就这项技术的能力而言,」他说。
他的表态出现在 OpenAI 按下暂停键五天之后。8 月 18 日,公司宣布放缓前沿训练扩展:拟部署的最新模型曾暂停强化学习(RL)训练两周,规模最大的计划中前沿 RL 训练继续搁置()。
攻击能力跑在了防御前面
Lehane 承认,公众不会对攻击威胁「感觉良好」。他描述的风险主要来自开源模型(其中许多在中国开发),它们只比 OpenAI 这类公司打造的封闭前沿模型落后几个月:「人们将能够接触到这些开源模型,并能够对你发动持续的、持久的攻击,而你需要真正更优越的模型才能击退并防御它们。这不一定会让公众感觉良好。但这就是我们要去往的现实。」
支撑这一判断的是公司内部的评估。OpenAI 表示无法排除新模型 Astra 具备「关键网络安全能力」(critical cybersecurity capability)的可能;按 OpenAI 自己的定义,这意味着该模型可能发动「来自单方面行动者的、可能导致灾难」的网络攻击,包括入侵军事或工业系统、或 OpenAI 基础设施。
攻击先于防御出现的判断,本周也得到英国官方呼应。《卫报》报道,英国政府国家网络安全中心(NCSC)敦促对 AI agent 保持谨慎,警告其安全控制可能被绕过、AI agent「没有常识」,并建议机构限制其自主性:「你应该始终能够『拔掉插头』,立即中止自主 AI agent 的活动。」
两周暂停与 30 分钟告警
8 月 18 日的博客写道,过去几周的两件事加剧了风险:OpenAI-Hugging Face 事件(7 月 21 日披露,),以及初步证据显示即将推出的 Astra 可能触及公司 Preparedness Framework 下的「关键」网络安全阈值(8 月 7 日判定)。公司随即加固研究环境、扩大监控覆盖,部分低风险模型已恢复训练,但最大的前沿 RL 运行保持搁置,待小规模训练和评估验证安全措施、积累对齐证据()。
新措施包括更强的工作负载与网络隔离,单一工作负载被攻破不会直接获得互联网或其他内部网络的访问权;还有用模型持续对安全边界做模拟攻击测试。监控系统是多阶段的:激活分类器在每个采样 token 上检查模型内部活动,异常升级给自动调查系统,排查未授权访问、数据窃取、破坏性行为和绕过安全机制的行为。OpenAI 的目标是在可疑活动出现 30 分钟内告警;如果 30 分钟内无法证明告警是误报,相关团队须暂停活动。公司估计监控开销约为被监控推理算力的 20%。 补充,新监控要求强制适用于 Sol 及以上能力层级模型的所有涉及工具的 RL 训练与评估。博客还写道,公司预计模型很快将承担大部分安全工作,包括防御其他模型。
负责安全与对齐工作的 Mia Glaese 说:「距离一切恢复正常还很远。」CEO Sam Altman 说:「把 AI 安全做对,比任何公司的势头都重要。」Altman 在 X 上解释暂停时称,模型进展「极其迅速」,他们一直说「如果感到模型能力超过安全与对齐的步伐,就会采取行动」()。The Verge 记者 Alex Heath 引述 Altman 报道,未发布模型显示出「不同程度的不对齐」(various degrees of misalignment)()。
立法窗口就在明年上半年
Lehane 在专访中再次呼吁美国政府立法。他说,最前沿的未发布模型在攻击能力上的进展似乎快于防御,「这是我为什么认为美国绝对需要通过一部全国性法律、设立强制性安全标准的原因之一,暂停要素将是这一过程中固有和内在的一部分」。他提出,模型「除非在进入公众之前证明并保证一定程度的安全,否则不得发布或部署」;应先有美国版本,「然后才能创造国际版本」,因为最终需要某种国际结构。
报道给出了两个参照:6 月特朗普总统签署的行政令鼓励前沿模型及接近前沿的开源权重模型做部署前测试,但该体系是自愿的,因缺乏透明度受到批评;Google DeepMind 总裁 Demis Hassabis 提议仿照美国金融业监管局(FINRA)设立新的标准机构,得到 Anthropic CEO Dario Amodei 的支持。Lehane 把立法窗口指向明年年初:「新一届国会就职后,立法可能发生在明年上半年。我认为存在一种超越党派的、不断增长的政治共识。」
中美安全对话也被视为重要议程。习近平定于 9 月 24 日在华盛顿与特朗普会晤。「鉴于这项技术有多重要、发展有多快、能力有多强,这些对话越早开始,我们就能越快挽起袖子,进入艰难的工作,看看能否找到解决办法,」Lehane 说。
「把世界逼进了角落」:批评者的指控
《卫报》写道,Hugging Face 事件及其他 AI 公司承认的类似案例,使安全专家对 AI 公司「鲁莽」行为的指控增多,批评者认为它们一边竞赛、一边准备上市。2024 年离职的前 OpenAI 研究员 Daniel Kokotajlo 说,前沿实验室的负责人「把世界逼进了角落」。他去年创办的非营利组织 AI Futures Project 警告,不受约束的 AI 进展有 10% 至 30% 的概率导致人类灭绝;该组织预测超级智能可能在 2030 年实现,但呼吁各国政府阻止其发生,直到十年之后,给 AI 科学家时间应对不断升级的能力风险。「当前的 AI 在某种意义上很危险,但与明年的 AI、后年的 AI 相比不算什么,」他告诉《卫报》。他因此推迟生育更多孩子,直到前沿 AI 研究暂停。
AI 教授、安全活动人士、曾任英国政府 AI 安全研究所创始所长的 David Krueger 说:「没有人应该建造更强大的 AI 系统,因为我们不知道如何控制它们、对齐它们,也无法足够好地看清它们内部在想什么。」他把 AI 公司对待安全的态度称为「糟糕」和「不道德的」:「他们真的在鲁莽行事,越来越把手从方向盘上拿开。我们刚刚看到了那样做的后果。」
Lehane 的回应是:「这是我们在开发时最重要、最优先考虑的事情。我们已经按下暂停键这一事实本身就说明了问题。」
训练何时重启仍无时间表
《卫报》报道,新护栏就位后训练何时重启尚不清楚。OpenAI 博客也承认,大量 Astra 训练与评估工作在被迁移到新安全标准前仍处于暂停状态;Hugging Face 事件的技术报告预计「数周内」发布。
另一条时间线在资本市场上并行:报道称 OpenAI 已申请上市,据报估值超过 8500 亿美元,可能于今年或明年挂牌;与 Claude 开发商 Anthropic 的竞赛仍在继续,后者预计也将在一年内以巨额估值登陆美股。
训练暂停能持续多久,目前没有公开时间表。Straits Times 的报道还提醒了监控本身的边界:OpenAI 2025 年自己的研究显示,知道被监控的模型可以学会在推理中隐藏意图()。
参考链接
- 《卫报》:'We are hitting a different chapter': OpenAI leader warns of threat of 'persistent' AI cyber-attacks —
- OpenAI 官方博客:Pacing model development in an era of cyber-critical capabilities —
- OpenAI 官方推文 —
- Sam Altman 推文 —
- Alex Heath 推文 —
- TechCrunch:OpenAI institutes new safeguards after Hugging Face breach —
- SecurityWeek:OpenAI Overhauls Model Security With Sandboxing, 30-Minute Alerts, and Training Pauses —
- The Straits Times:OpenAI slows advanced AI development after cyberattack —