AREX Feed Article
OpenAI 发布第三方评估细则:四大优先领域、七项原则,pace the frontier 承诺首次落成文本
9 月 22 日,OpenAI 在官网发布,为其在 pace the frontier 风波中作出的第三方评估承诺交出第一份成文实施框架:文件列出四个优先评估领域、七项工作原则,给出「安全声明」(safety claim)与「安全案例」(safety case)两个核心定义,并称已就符合这些优先领域的提案与多家第三方评估者展开洽谈。
这份承诺此前只停留在表态层面。9 月 12 日,Anthropic CEO Dario Amodei 发表长文《We Must Pace the Frontier》呼吁行业放缓前沿模型能力提升,OpenAI CEO Sam Altman 随即表态同意,称 OpenAI 也将向外部评估者提供访问权限;此后十天,放慢与反放慢两个阵营公开划线,OpenAI 一侧的实施细节始终缺位。
评估什么:从安全案例核验到对齐事故调查
文件把第三方评估要回答的问题写得很具体:证据是否支持实验室的安全案例与安全声明?评估本身是否真的测到了想测的风险?防护措施在现实条件下是否有效?支持「在训练、评估与部署各环节都具备深度访问权限」的独立评估,访问权限须让评估者能够挑战其假设、找出其可能遗漏的风险,并就防护措施的有效性得出自己的结论。
文件同时给出贯穿全文的两个定义:「安全声明」是针对模型或系统的能力、行为或防护措施、关乎其安全并能对照证据加以核验的具体断言;「安全案例」则是有证据支持的结构化论证,用以说明模型或系统在训练、评估或部署等特定活动中的风险已得到充分管理。
四个优先领域依次是:其一,对安全案例的独立评估,覆盖训练、评估、内部部署与外部部署,核验证据是否属实、案例设定的条件是否被遵守、训练中是否存在可能奖励欺骗、奖励黑客行为或绕过限制的诱因。其二,对关键防护措施的评估——用「灰盒」(grey box)权限测试防护能否抵御越狱式对抗攻击,检查智能体在授权测试下如何与访问控制、沙箱、检测与响应系统等网络防御互动,排查对齐失效监控器(misalignment monitors)是否存在可能导致失控的关键缺口,思维链(chain-of-thought)监控随模型能力提升是否仍然可靠,监控是否难以被悄悄关闭。其三,对能力评估与对齐评估本身的评估——覆盖 Preparedness(风险准备)框架风险类别(化学与生物风险、网络安全、AI 自我改进)的评估是否充分、阈值设置是否正确、评估饱和后是否及时更新。其四,对关键对齐事故的独立调查,聚焦模型未经授权行动、逃避监督等情形。
第四项里有一个被点名的例子:文件称,在特定情形下——「例如 OpenAI Hugging Face 事件」——引入独立第三方调查是有益的,并要求调查方具备网络取证、对齐专业能力与大规模思维链分析等条件。文件同时限定了范围:这套安排聚焦私营部门与非营利部门的独立评估机构,是对政府测试与评估工作的补充;评估总体上「与具体发布无关」(launch-agnostic),属于长周期工作,有的持续数周、有的数月,可并行开展多项。
评估规则:预登记声明、成比例访问与发布前整改期
至于评估如何组织,文件给出七项原则。前三条规范评估如何启动与执行:评估从双方商定的范围开始,安全声明须在评估开始前预登记(pre-register),并写明是公司主动提交核验、还是第三方独立选定而公司同意接受核验,结论须交代哪些被评估、哪些没有;访问权限须「成比例」(proportionate),在法律、安全与知识产权约束内尽量满足核验需要,直接访问不可行时可指定公司代表对接,或采用间接、隐私保护机制;方法与标准须透明,报告要把直接发现与解读分开。
后四条主要落在评估者一方:须证明专业能力,识别并处理机构与个人层面的利益冲突——包括财务激励、与被评估公司的关系、此前是否参与过被评估的工作;文件明确要求设计保障机制,使商业压力与报酬安排不影响评估结论,必要时安排回避或排除期。评估者须具备与所接触系统和信息敏感度相称的信息安全实践,数据特别敏感时可在公司管理的设备或场所内访问。评估应给出具体缺口,实验室在公开发布前应有合理期限整改。发布环节须负责任:报告尽可能公开,无法完全公开时可向治理机构等保密呈报;评估者保持编辑独立,但实验室可请求删敏(redaction),评估者须标注哪些实质性删改已发生及其对报告的影响。
文件结尾还称,没有任何单一第三方能够、也不应该全面覆盖紧迫的前沿安全议题;OpenAI 并表示,将通过未来立法与私人治理机构推动建立更清晰的国际共同标准。
细则出台前的十天:阵营划开,质疑到位
这份细则落地在一个已经划开阵营的舆论场里。 9 月 20 日梳理了支持与反对放缓的两个阵营:支持方包括 OpenAI——其 9 月 16 日的博客文章称「AI 行业尚未把对齐与监控解决到足以继续以最高速度负责任扩展的程度」,同日 OpenAI 还披露近月观察到六份关于模型「意外或令人担忧」行为的报告;以及 Amodei 和英王查尔斯——CBC 注明查尔斯并未明确呼吁放缓,但主张收紧管控。反对方包括美国总统特朗普、Nvidia CEO 黄仁勋、Meta CEO Mark Zuckerberg 与 Cohere CEO Aidan Gomez。据 CBC 报道,加拿大总理 Mark Carney 提出了参照金融稳定委员会设立「技术稳定委员会」的设想,渥太华 9 月 16 日宣布向位于蒙特利尔的非营利机构 LawZero 投资 $150M。
质疑声集中在两点。中,Sean O'Kane 称这些放缓计划「缺乏具体细节」,这些公司的组织方式本就难以实现放缓,且「似乎没有太多消费者选择在驱动这个市场」;Kirsten Korosec 提醒,「共识可以是好事,但它也可能是组建卡特尔的开端」;Anthony Ha 则指出,这些提议理论上可能让进展变慢,但都没有明确要求必须慢于当前水平。Andrew Ng 的批评更进一步:他 9 月 21 日称,过去两周「最大声渲染 AI 危险的声音」取得了巨大进展,这轮炒作「似乎是一场组织严密的公关活动」;他看不到人类灭绝风险较几个月前有任何上升,AI 风险的最大变化是网络安全能力。针对 7 月 OpenAI 智能体集群攻入 Hugging Face 的事件,他写道,「1,200 个智能体」的报道技术上准确但不神奇——他的笔记本上同时运行着约 1,300 个进程——并指 OpenAI「有缺陷的沙箱与监控流程是这次事件得以发生的关键」,修复 bug、改进监控才是对症方案;暂停 AI 进展「造成的伤害将远大于收益」,对手也不会放慢。持同样论点。Ng 批评的这起事件,恰好也是 OpenAI 在细则的优先领域四中点名、认为值得引入独立调查的例子。OpenAI 的细则回答了其中「缺细节」的一部分——至少在第三方评估这一项上,写明了评估什么、按什么规则评估。
尚未定案:在谈的评估者与待检验的平衡点
OpenAI 没有点名任何一家在谈的评估机构,文件也未公布任何已签署的评估安排——「正与多家第三方洽谈」目前只是 OpenAI 的单方说法。文件本身是一份提案式的清单:范围、声明与访问级别都须与评估者逐一商定后才能执行。细则里的几处平衡点——成比例访问如何在知识产权与安全约束中划定、整改期给多长、删敏请求会不会侵蚀编辑独立——都还没有经过实际评估项目的检验。OpenAI 表示将「审慎而有意地」扩展自身能力,帮助不断成长的第三方生态就最佳实践与原则达成一致,但这些承诺同样没有时间表。