AREX Feed Article
Claude Opus 5.5 独立评估落地:METR 称 AI R&D 提升温和,Artificial Analysis 测算每任务成本与 Opus 5 基本持平
针对 Claude Opus 5.5 的两份第三方评估结果在发布当天公开。独立评测机构 发布部署前评估摘要,认为该模型相对 Claude Fable 5.1 在 AI R&D 任务上是温和改进,不太可能完全自动化 AI R&D; 于 9 月 22 日 23:34(UTC)测算,Opus 5.5 (max) 在其智能指数(Intelligence Index)基准上每任务成本 $5.98,与 Opus 5 (max) 的 $5.86 基本持平。两者分别对上了发布当天悬置的两个问题:被点名的外部评估者究竟测出了什么,以及官方「便宜 40%」的说法在真实用量下是否兑现。
于 9 月 22 日 16:31(UTC)官宣 Opus 5.5 上线,官方口径称其性能达到 Fable 5.1 水平、;据 报道,定价为每百万 token 输入 4 美元、输出 20 美元,Anthropic 并称模型发布前经 Frontier Design 与 METR 两家机构的外部测试。
METR 如何评估:五项任务、10 个工作日与一份经 Anthropic 审阅的文本
METR 的摘要页面日期为 9 月 22 日,未标注具体时刻;评估在部署前完成。页面开头交代了独立性边界:评估在无偿协议下进行,METR 起草初稿后,Anthropic 有机会审阅并编辑文本,最终文本由 METR 认可,并收录进 。
评估依据 10 个工作日的 API 访问,围绕五项任务展开:NanoGPT Speedrun 竞赛的受限版本 Budget NanoGPT Speedrun;概念论证数据集 LMCA(Language Model Conceptual Argumentation);Train a Program,测试训练机器学习模型复刻某段软件行为的能力;Gaming Bot,要求智能体(agent)只凭非视觉控制接口写出能玩电子游戏的 Python 程序;以及 Sunlight,测试开放式研究并撰写相应报告的能力。METR 另参考了其此前 Frontier Risk Report 记录的前代模型趋势、Anthropic 对能力问卷的回答和一次研究者访谈。
第一层结论关于模型能带来多大加速。METR 写道,「有相当的把握」认为 Opus 5.5 相对 Fable 5.1 不构成 AI R&D 能力上的巨大跃升,而可能是温和改进:在 METR 的量化评估中是增量进步,而非不连续跳跃。模型在可验证任务(Budget NanoGPT、Gaming Bot)和较难验证的任务(LMCA、Sunlight)上都有改进,但在困难的长程任务和开放式推理上仍带有专家人类不太会出现的定性短板。METR 认为,完全自动化 AI R&D 需要在前瞻、预测、自建反馈回路等「判断力」或「品味」类技能上大幅进步,而现有证据并未显示 Opus 5.5 在这些技能上较 Fable 5.1 有大的提升。
METR 同时给出另一面:Opus 5.5 仍可能明显加速研究者、自动化 AI R&D 的有限环节,生产率提升可能略高于 Fable 5.1。报告提醒,频繁的小幅量化进步与 AI R&D 能力的快速整体进步并不矛盾,但现有数据不足以区分进步速率在持平、加速还是减速,也不清楚还需多少次这种规模的增量改进才会出现质变。
Anthropic 自己的系统卡与这一判断同向:Opus 5.5 的 AI R&D 能力「达到或略高于 Claude Mythos 5.1」,远不能替代其科研与工程人员,内部指标未显示持续的 AI 归因 2 倍开发加速。
「1.5 倍加速」估计出自另一支 METR 团队的初步报告,适用周期不明
第二层结论关于 Opus 5.5 的开发过程本身。METR 认为其「至少在一定程度上被 AI 加速,但不太可能被显著加速」,依据是一份内部初步报告的估计:AI 使能力开发整体提速约 1.5 倍,即一年取得 1.5 年的进展,达到 2 倍的概率约 30%。METR 明确指出,这份初步报告没有说明估计适用的时间段,无法确定它描述的是 Opus 5.5 的开发期还是其他时期。
这份估计的来历有明确边界:它出自另一支 METR 团队对 Anthropic 内部 AI R&D 加速情况的单独评估,该团队拥有比撰写摘要的团队更高的访问权限。由于权限差异,摘要作者只拿到结论,未能接触支撑证据和推理细节,因此只把它当作评估输入、不为其主张辩护。METR 称这种安排是更完整评估流程的『试用版』,预计未来几周公布这项调查的更多公开产出。摘要还提到,评估使用了一个目前无法公开的额外信息来源。
页面脚注列出了协议的透明条款:METR 可以不经 Anthropic 同意,公开审阅与删节流程的存在及大致条款、Anthropic 是否行使过删节权、结论是否实质依赖被删节的信息、获得的访问权限级别等事实。页面本身未说明 Anthropic 是否行使过删节权。
Artificial Analysis 实测成本:token 用量涨幅抵消基础降价
Artificial Analysis 拆出的数字链路是:与 Opus 5 相比,Opus 5.5 的 token 用量增加本会带来约 80% 的每任务成本涨幅,把成本从 Opus 5 (max) 的 $5.86 推高至 $10.51;基础价格下调 20% 将其压至 $8.41;缓存读取(cache reads)价格降至 $0.20,再降 29%,最终落在 $5.98。
价格表与账单在这里分了岔。价格表上,Opus 5.5 的定价比 Opus 5 低 20%(Reuters);Anthropic 开发者账号的口径是「每任务便宜约 40%」。但按 Artificial Analysis 在 max 档测到的用量结构,跑同一项任务实际支付的费用与上代基本持平。「便宜 40%」能否兑现,取决于具体任务的 token 消耗模式。
同样的分歧出现在第三方平台之间。Cursor 当天自报 Opus 5.5 登上其 CursorBench 榜首(Max 档 57.8%),且「每任务成本较 Opus 5 低 40%」,贴文未附方法学细节;Artificial Analysis 测出的却是持平。两个数字方向相反,说明成本结论依赖任务类型和用量结构。Anthropic 系统卡写明「大部分性能提升可在低于最大推理力度(effort)的档位获得」;AWS Bedrock 模型卡显示 effort 分 low/medium/high/xhigh/max 五档、默认 medium。max 档的账单只是该模型使用成本的一种情形。
发布当日的平台落地:Copilot 全面可用,效率自报数字仍待对表
Opus 5.5 的可用范围在发布当日铺开。 在官宣约一小时后(17:34 UTC)宣布该模型在 GitHub Copilot 全面可用(generally available),列出的入口包括 Visual Studio Code、Visual Studio、Copilot CLI、编码智能体(coding agent)、Copilot 应用、github.com、iOS 与 Android 的 GitHub Mobile、JetBrains IDE、Xcode 和 Eclipse,面向 Pro+、Max、Business 与 Enterprise 用户逐步推出。GitHub 称早期测试显示该模型任务解决率与 Opus 5 相当、所用步骤与 token 显著更少,并能在多步任务中快速从错误中恢复;这一效率表述属平台自报口径,尚未见独立复核。更新日志另说明,该模型会对文本输出添加水印,不改变含义、质量与可读性,也不增加 token 或成本。
云平台方面,AWS Bedrock 模型卡(页面日期 2026-09-22)列明模型 ID anthropic.claude-opus-5-5、上下文窗口 1M token、最大输出 128K,自适应思考(adaptive thinking)常开且不可关闭,支持 bedrock-runtime 与 bedrock-mantle 端点及 geo/global 跨区推理,模型启动日期为 2026 年 9 月 22 日。Reuters 称模型亦上线 Google Cloud 与 Microsoft Azure。
发布当天的独立技术审视也落在 effort 档位这条线上。开放模型研究员 Nathan Lambert 在官宣约 15 分钟后贴出官方能力—effort 档位曲线,配文「先生,这是怎么回事」(Sir what is going on here)。据其解读,模型在部分基准上中等 effort 档的表现高于 x-high/max 档,呈非单调形状,与 OpenAI 模型的常规曲线不同;该解读为其个人观点,观察对象是官方图表。这条帖在 X 上引来大量独立讨论。
截至发稿,本批可公开核对的外部评估文本只有 METR 一份。METR 同时划定了自身边界:评估不负责验证 Anthropic 政策中任何具体阈值的合规主张,也不评估模型的对齐属性。1.5 倍加速估计适用于哪个时期、各家平台自报的效率数字与独立测算之间的出入如何收窄,要等 METR 预告的几周内那批产出和更多独立数据。