AREX Feed Article
Anthropic 发布 Claude Opus 5.5:称多数工作达 Fable 5.1 水平,运行成本较 Opus 5 低 40%
2026 年 8 月 31 日,Anthropic 在官网发布公告,正式推出 ,称其为新 Claude 5.5 家族的首款模型。按公告口径,Opus 5.5 在大多数工作中达到 Claude Fable 5.1 的水平,运行成本较 Opus 5 低 40%,每百万 token(词元)输入 4 美元、输出 20 美元;模型已在 Amazon Web Services、Google Cloud、Microsoft Azure 等平台可用,Claude Platform 上的模型 ID 为 claude-opus-5-5。
公告称,Opus 5.5 发布前由 与 等外部评估者测试,在 Anthropic 的自动化行为审计(automated behavioral audit)中取得迄今最强成绩,并称该模型「比近期模型更不容易采取难以逆转的行动或越出被给予的边界」。公告同时预告,Claude Sonnet 5.5 与 Haiku 5.5 将在未来数周内推出,带来性能、效率与安全方面的多项同类改进。文中性能、定价与安全数据均出自 Anthropic 公告及其的官方口径,本报道未做独立测试。
定价:缓存读取降六成,订阅用量上限上调
公告把降幅拆成两层:Opus 5.5 服务所需算力低于 Opus 5,每百万 token 单价更低;完成同一任务消耗的 token 也更少。按公告的测试口径,两者叠加后,默认设置下典型工作负载的成本较 Opus 5 低 40%。具体价格为:
| 每百万 token 价格 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 输入 | 4 美元 | 5 美元 |
| 输出 | 20 美元 | 25 美元 |
| 缓存读取 | 0.20 美元 | 0.50 美元 |
| 缓存写入 | 5 美元 | 6.25 美元 |
输入与输出单价较 Opus 5 低 20%;降幅最大的是缓存读取,从 0.50 美元降到 0.20 美元,低 60%,公告称这类读取占代理与编码类工作成本的大头。速度方面,公告称 Opus 5.5 生成输出的速度较 Opus 5 快 30% 以上;Claude Code 与 Claude Platform 另提供最高 2.5 倍速的快速模式(fast mode),定价为每百万输入 8 美元、输出 40 美元。订阅侧的变化包括:Pro、Max 与 Team 计划的五小时用量上限上调,订阅用户还获得一个可保存、随时启用的速率限制重置。
基准成绩:三类测试领先,两项低于 GPT-6 Astra
公告的基准表显示,Opus 5.5 在代理编码、计算机操作与知识工作三个类别领先。在命令行环境中完成复杂多步专业任务的 Terminal-Bench 4.0 上,Opus 5.5 以 xhigh 档取得 66.4%,高于 Fable 5.1 的 55.8% 与 Opus 5 的 52.3%,也高于 OpenAI 报告的 GPT-6 Astra 最高分 57.9%;衡量 44 种职业真实工作的 GDPval-AA v2.1(Artificial Analysis 的测试)取得 1,846 Elo,高于 Fable 5.1 的 1,735 与 Opus 5 的 1,708;Humanity's Last Exam(带工具)得分 67.7%,OSWorld 2.0(按部分完成计分)为 81.8%。
两处例外写在同一张表里:在 Zapier 构建的业务流程测试 AutomationBench 上,Opus 5.5 得分 40.0%,低于 GPT-6 Astra 的 41.4%;在代理科研测试 Terminal-Bench-Science 0.1 上,58.7% 的成绩也低于 Astra 的 64.6%。页面注释说明,Zapier 的运行不设后备模型,安全栏介入即记为失败,因此 Opus 5.5 的成绩低于其实际水平;其分数来自 Zapier 在早期访问期间的自行评估。
Anthropic 同时提醒,在这个能力层级,基准分差对真实差距的指示作用已经减弱——就其实际使用而言,Opus 5.5 与 Fable 5.1 的差距比分数显示的更小。注释还说明,Opus 5.5 的基准成绩是在开启生产安全栏的状态下测得的:安全栏介入后,网络安全任务由 Claude Opus 4.8 代为完成,生物学与前沿大语言模型(LLM)开发任务由 Claude Opus 5 完成,公告称这可能拉低了它的分数。
任务案例:68 万行代码迁移不到一天,并购分析 63 分钟完成
公告列举的任务级案例集中在编码与知识工作。编码方向,一位早期测试者用 Opus 5.5 在不到一天内完成 68 万行代码的迁移,公告称这类工作通常需要一个工程团队做数周;另一位早期测试者用它审计并修复一个 20 万行代码库,用时不到 3 小时,而按公告的说法,Opus 5 做同样的事需要 20 小时以上,token 消耗是 Opus 5.5 的 2.5 倍。在 Anthropic 的内部测试中,Opus 5.5 与 Fable 5.1 分别把负载均衡软件 HAProxy 从 C 重写为 Rust:两者都通过了 HAProxy 几乎全部回归测试,Opus 5.5 用时 9.5 小时(Fable 5.1 为 12 小时),成本低 51%。另一项内部测试要求模型压低一个 Web 应用每个页面的加载时间,Opus 5.5 在 40 次中成功 39 次,公告称 Opus 5 的改动幅度更小,还顺带改变了应用的原有行为。
按公告的成本换算,Opus 5.5 在 FrontierCode 默认档下以约为 GPT-6 Astra 五分之一的单任务成本胜出,在 CursorBench 上以约三分之一的成本高出 GPT-5.6 Sol 11 分。
知识工作的测试更细:让 Opus 5.5、Fable 5.1 与 Opus 5 仅凭一份难以找到财报的网页副本撰写公司季度业绩报告,自动评分程序逐项核对每个数字与引语,出现任何编造即判不通过。结果,Opus 5.5 在不同档位下的 18 份报告有 16 份过线,Fable 5.1 与 Opus 5 无一通过。公告援引早期测试者、投资公司 Walleye Capital 的反馈称,Opus 5.5 在最低档就基本解决了其评估套件,更高档位时还发现评估指令中的一处错误并自行纠正——此前没有其他模型发现过这个错误。在一场虚构 HR 软件公司并购分析的对决中,Opus 5.5 与 Opus 5 得出相同的交易结论,但 Opus 5.5 的财务模型更透彻、演示更易读,用时 63 分钟(Opus 5 为 93 分钟),成本低 50%,Opus 5 的版本则带有小错。
沟通也被列为改进项。公告称 Opus 5.5 会把最重要的信息放在前面,减少行话和怪僻表达,并遵守给定的写作规则;一位早期测试者的评价是「它写东西的方式和我一样」。Anthropic 认为,产出更易核对既是实用改进,也是安全收益。
行为审计:近 2,000 个场景,越界尝试较 Opus 5 少约 85%
安全数据的核心是自动化行为审计,公告称之为其运行的最全面对齐测试:它覆盖近 2,000 个模拟场景,Opus 5.5 在几乎所有失范行为指标上好于近期的各款 Claude 模型,在多数诚实性指标上也是 Anthropic 测过的最强模型。在一项专为测试「跨越隔离边界倾向」设计的新评估里,Opus 5.5 试图绕过边界的频率比 Opus 5 或 Claude Mythos 5.1 低约 85%,且每次尝试都是低严重度并自行上报——公告称,对在自家代码库与系统上无人值守运行 Claude 的团队而言,这一点与模型能力本身同样重要。
公告称,Opus 5.5 在几类曾导致近期的行为上有所改进:带偏见的动机性推理、试图逃出沙箱,以及认定自己身处模拟环境后采取有害动作。提示注入(prompt injection)方面,Opus 5.5 在编码、工具使用、计算机操作、网页浏览的全部测试设置中不弱于或强于 Opus 5;在 AI 安全公司 Gray Swan 的测试中,它与 Fable 5.1 并列为注入成功率最低的模型。
公告同时承认评估仍有盲区:可靠拦下每一次失范行为仍是未解问题,且有迹象表明 Opus 5.5 常会怀疑自己正在被评估,这直接影响 Anthropic 判断它在真实部署环境中会如何行动;随着部署场景扩大、模型能力增强,公告预计这一挑战还会变大。
防护栏:多数网络安全任务转由 Opus 4.8 处理
部署侧,公告称 Opus 5.5 是首款以与 Fable 5.1 同级安全栏发布的 Opus 模型,覆盖网络安全、生物学与蒸馏(distillation)三类风险,介入时都会透明回落到另一个模型。具体而言:多数网络安全任务将改由 Opus 4.8 处理,日常开发中的找错修错不受影响;面向网络防御者的 Cyber Verification Program 将扩容至 Opus 5.5,分三档开放更宽的可信访问,包括使用 Claude Mythos 模型。生物方向,公告称其在与 Dyno Therapeutics 合作的分子预测与设计长程评估中取得提升,专家红队评定其科学新颖度与所测最佳模型相当;受安全栏限制的机构可申请,公告称其面向学术实验室、初创公司与制药公司等经审查的组织。
蒸馏指攻击者用大量假账户工业化套取模型能力的行为。针对这类风险,防蒸馏措施「保留思考」(preserved thinking)同步上线:它阻止 API 用户篡改 Claude 的既有上下文以套取其推理,与 Fable 5.1 一样,适用于 2026 年 8 月 31 日及以后创建的 API 账户。此外,Opus 5.5 支持零数据保留,带有为符合欧盟《人工智能法案》而设的水印措施,「thinking」模式不再允许关闭。产品侧配套还包括在每步操作执行前筛查的分类器、可供安全团队审计的开源沙箱,以及在合并前拦截漏洞的代码审查。
9 月 22 日发布的 给出了更细的结论:在化学与生物风险上,Opus 5.5 被归为具备 CB-1 能力(合成非新型武器相关)而不具备 CB-2 能力(合成新型武器相关),在 Anthropic 的评估组合中它与 Claude Mythos 5.1 差异不大,但未改进此前在 Mythos 5.1 上被视为 CB-2 否决项的若干弱点;AI 研发能力略高于 Mythos 5.1,但远不能替代研究人员,内部指标未显示持续的 2 倍 AI 加速;网络方向未发现它能开发新型攻击能力的迹象,也未发现关键级越狱;鉴于其能力,Anthropic 称已暂时对越狱采取更宽的安全边际,同时继续压低分类器的误报率。系统卡也记录了退步项:多轮测试中,它在生物武器类对话上有改进,在跟踪监视与影响操纵类对话上有所下滑。
发布背景与外部评估:METR、Frontier Design 的结论未随公告公布
公告还交代了发布背景:这是 Anthropic 自呼吁「给前沿降速」(pace the frontier)以来的首次模型发布。CEO Dario Amodei 在公告发布前一周发表,主张 AI 进展应当限速,让安全实践跑在模型能力前面。公告称,当前一代模型依赖的是一套成熟做法——充分的对齐测试、METR 与 Frontier Design 等外部机构的事前评估、按能力匹配的高风险领域安全栏;而对能力更强的模型(例如能完全自动化 AI 研究本身的那类),Anthropic 称不认为上述措施足以单独达到其安全标准,公共政策需要发挥更大作用。
不过,公告页只写明 Frontier Design 与 METR「参与了发布前测试」,没有附上两家评估者的具体结论;这些外部测试究竟发现了什么,目前无法从公开材料核对。