AREX Feed Article
嵌入式评估者迎来首个具名伙伴:Anthropic 与 Accenture 预计五年各投至少 10 亿美元
美西时间 9 月 18 日(北京时间 19 日凌晨),Anthropic 在 X 平台和官网宣布与 Accenture 合作开展前沿 AI 独立评估,CEO Dario Amodei 在 9 月 12 日长文中作出的「嵌入式评估者」承诺由此迎来第一个具名实施伙伴。据和 ,合作将由 Accenture 旗下专业 AI 业务 Faculty 牵头,涵盖模型评估与红队测试(red-teaming)、对齐评估(alignment assessments)以及模型安全护栏测试;两家公司预计在未来五年各投入至少 10 亿美元,建设这一领域的评估能力。
那篇长文给出分三步的「定速」(pacing)计划:嵌入式评估者、民主国家间协调与全球协调,并写明定速不等于停止模型训练或技术进步。Anthropic 单方面承诺先行第一步,同时呼吁各国政府要求其他前沿公司跟进。OpenAI CEO Sam Altman 当时公开赞同,写下「我同意 Dario,我们需要为前沿定节奏」,并称独立评估者是个「好主意」();9 月 17 日,Anthropic 又发布了衡量其内部 AI 研发节奏的三组指标()。
Faculty 牵头:评估者要进到训练现场
按的说法,嵌入式评估者不同于今天的外部评估者:他们要在 AI 公司内部工作,拿到与普通员工相当的访问权限——看着模型在训练中成形,跟进决定模型如何构建和部署的决策,并与员工直接交谈。从这个位置出发,评估者可以考察公司如何运作、核验它是否在兑现安全承诺、找出盲点、报告事件,并让公众对收益与风险获得更有依据的描述。
页面给出的选人理由是:Accenture 帮助多个行业的企业和政府部署 AI,对企业在实践中如何使用 AI 的理解,塑造了他们的安全方法,他们会把这种视角带进对 Anthropic 模型的评估。
Anthropic 直接付账:独立评估还没有定型的资金体系
官宣页面写明,「鉴于这项工作的重要性和紧迫性,Anthropic 将直接资助 Accenture 的工作」;Anthropic 同时在与 METR 等非营利评估机构对话,由后者以自有经费试点嵌入式评估的部分内容。页面承认,为独立评估出钱这件事目前没有定型的体系——长期而言,Anthropic 主张经费来自集合资金或政府渠道,这是其 6 月发布的 中的呼吁;在此之前,他们会与不同评估者采用不同的资助安排。
页面也划清了责任边界:「独立的嵌入式评估者不会减少我们的责任,而是让责任更可核验」,模型安全仍由 Anthropic 自己负责;公司会继续训练并发布前沿模型,希望独立评估者在此过程中并肩工作。合作是非排他的:Anthropic 将在未来几周宣布更多评估者,Accenture 也会以类似方式服务其他 AI 开发者。
官宣两天前,评估机构还在等一个名字
官宣前两天,TechCrunch 采访多位第三方评估者后报道称,他们普遍欢迎 Amodei 的提案,但指出细节有待敲定、且最好有立法背书——否则很难说嵌入式评估者会是独立的监督者,还是按 AI 公司条款行事的供应商()。报道写道,当时 Anthropic 和 OpenAI 都未披露与哪些评估者合作、评估者何时进驻、能访问哪些系统、哪些内容可以公开。这次官宣至少回答了「和谁」:第一个名字是 Accenture,外加经费与范围。
更难的问题没有随这份公告解决。Apollo Research 研究主管 Alexander Meinke 对 TechCrunch 说,AI 公司应当能回答关于训练过程的一些非常基本的问题,「比如:AI 在对齐训练进行期间,是否曾主动尝试破坏这项训练?」「答案应该是断然的否。现在我们完全依赖公司自己仔细检查、再如实向公众报告,而从近期事件看,默认情况下这两件事他们都不会做。作为嵌入式评估者,我们可以真正去查。」FAR.AI CEO Adam Gleave 说,评估者默认被当作普通承包商,受严格的 NDA(保密协议)约束,他的公司已回绝几家对评估过程索要过多控制权的前沿开发商。Safer AI 执行总监 Henry Papadatos 则认为,自愿机制终究取决于公司善意,需要监管来强制要求。
立法已在推进:加州去年通过 SB 53,要求大型前沿 AI 开发者公开安全框架并报告重大安全事件,本月又签署 SB 813,设立州认可的「独立验证组织」框架;但 TechCrunch 指出,现有法律的范围仍小于 Amodei 的提案。想承担这一角色的机构也已出现:据 BBC 报道,今年早些时候遭 OpenAI 智能体集群攻击的 Hugging Face,其 CEO Clement Delangue 正在发起 Open Alignment Initiative,并希望成为嵌入式评估者中的一员。TechCrunch 还盘点:Meta、SpaceXAI 与 Google DeepMind 至今未作同样承诺,DeepMind CEO Demis Hassabis 另提出设立独立行业机构来测试前沿模型。
半年从不足 1% 到 26%:被测量的节奏
Anthropic 公布这组数据的用意,是给公众、第三方和政府提供观察前沿实验室内部研发节奏的窗口。Amodei 在长文中警告,大约从今年夏天起,AI 能力的推进因 AI 越来越能构建下一代 AI 而急剧加快,6~12 个月内可能出现一群能以持久僵尸网络接管整个互联网的智能体。9 月 17 日发布的《Measurements for understanding the pace of AI development inside frontier labs》据此给出了基于 Epoch AI 自动化评级量表(从 AL0 无 AI 参与到 AL5 完全自主)构建的「Anthropic R&D Automation Index」:截至 2026 年 8 月,Claude「主导」(leads)公司 26% 的 AI 研发工作,2 月时不足 1%;评级达「AI 协作」(AL3)及以上的工作超过 90%;没有任何被测工作子集达到完全自主。配图显示「AI 主导」(AL4)份额自 3 月起逐月抬升——1%、3%、12%、14%、22%、26%。Reuters 报道称,Anthropic 将定期发布这类数据,让外人看到 AI 构建下一代技术的速度有多快()。
监督数据一并公布:最常用内部平台上任一时刻约有 30,000 个智能体在从事研究与工程工作,其操作 100% 在执行前经过在线监控;8 月分析的逾 10 亿次决策中,0.002%(约 1/47,000)被拦截;每周约 100,000 条被标记对话记录做离线审查,其中约 50 条升级到人工。Anthropic 在中写道,世界正在考虑为前沿定节奏,「我们应尽一切可能缩小前沿实验室所知与公众所知之间的差距」,而「任何前沿开发者都可以发布同样的测量指标,并让第三方加以核验」。
测量报告还写明,Anthropic 计划在内部嵌入来自多个机构的独立第三方评估者,给他们与内部风险评估团队相当的流程、系统和数据访问权限,由第三方核验安全实践、报告事件并监测包括上述指标在内的关键数据;与 Accenture 的合作正是这一安排迈出的第一步。悬而未决的部分同样写在官宣页面上:嵌入式评估是全新事物,「关于它将如何运作的许多细节仍在敲定」——评估者能访问哪些信息、如何报告发现,至今没有标准。至于长文的后两步——需要行业层面协调的第二步与需要全球层面协调的第三步——则超出了 Anthropic 单方面承诺的范围。Anthropic 表示,随着工作启动、更多评估者加入,会继续公布更多进展。