AREX Feed Article
Anthropic 放出 Opus 5:Frontier-Bench 翻倍、距 Fable 5 仅 0.5%,定价一分不涨
2026 年 7 月 24 日,Anthropic 发布了 Claude Opus 5,作为 Claude Max 和 Claude Pro 的新默认模型。定价与前代 Opus 4.8 完全持平(输入每百万 token $5,输出 $25),但在 上性能翻倍,在 CursorBench 3.2 上距旗舰 Claude Fable 5 仅差 0.5%,开销却只有一半。
更反常的是它处理长程智能体任务的方式。在一项 Frontier-Bench 任务中,Opus 5 被给了一张机械零件手绘图的原始像素,要求重建为 3D FreeCAD 模型,且不提供任何直接查看图纸的途径。它自行编写了一条计算机视觉管线从像素中提取几何信息,反复重建出完整零件。同等条件下,没有竞品模型在五次尝试内解出这道题。
Cursor 和 Devin 当天接盘,Alex Albert 翻出半年前的老账
发布当日, 宣布 Opus 5 即刻可用,称其在 CursorBench 上默认 effort 下得分 66.7,与 Fable 5 的 66.5 几乎持平,且兼容零数据保留协议。 同步将 Opus 5 接入 Devin,在 FrontierCode 1.1 上以一半成本逼近 Fable 级表现,尤其在困难调试和根因分析任务上优势明显。
Lovable 联合创始人 Fabian Hedin 在 Anthropic 官方博客中给出了更具体的数字:"Claude Opus 5 在我们内部评估中超越了家族中每一个模型。它在最难的智能体编码任务上比 Opus 4.7 提升了 22%,而且更稳,各轮之间的方差小得多。"LatchBio 的 CEO Alfredo Andere 描述得更生动:"在我们的基因组分析中,Opus 5 比我们跑过的任何模型都更像一个谨慎的科学家:它会选用正确的统计检验排除混杂因素,用独立方法交叉验证自己的结果,在漫长的多步分析中始终保持方向。"
Anthropic 研究员 翻出了半年前的一条旧推文做对比:"仅仅六个多月后,Opus 5 已经能做出接近超人类水平的电子表格和幻灯片,质量堪比咨询顾问的产出。变化太快了。"
,HyperWriteAI 前 CEO 兼 AI 投资人,在试用近两周后提醒用户:"如果你用老办法使 Opus 5,它会很烂。删掉所有 skills、MCP、Claude.md,从头开始。不要再告诉它怎么做,只说你想要什么。这两个小改动差别巨大。"
两个月四连发,模型发布从"大片首映"变成了"每周上新"
Opus 5 是 Anthropic 在不到两个月内发布的第四个 Claude 5 系列模型。此前, 于 6 月 9 日首发,随后因出口管制被下架,7 月 1 日重新部署并附加了更新的网络安全防护; 于 6 月 30 日发布,以 $2/$10 的入门价提供接近 Opus 4.8 的智能体能力。Opus 4.8 夹在其中,充当了过渡角色。
将这种节奏描述为 AI 部署模式已从"重磅发布"转向"能力、成本、速度的快速迭代",同时指出 Anthropic 为 Opus 5 新增的 effort 拨盘让用户可按任务需求调节计算资源投入——OpenAI 此前也为客户推出了类似的算力和 token 控制功能。
Axios 还提到,特朗普政府已着手推迟部分模型发布。Anthropic 发言人对 Axios 表示:"我们继续与政府伙伴合作,由他们对我们的模型进行独立测试。Opus 5 也在其中。"
翻倍、三倍、0.5%——三个数字说清性价比
Opus 5 的性能跃升集中体现在几个硬指标上:
Frontier-Bench v0.1 翻倍。Opus 5 以更低的单任务成本超越 Opus 4.8 两倍以上,且压过所有被测模型。这是 Anthropic 在软件工程评估上取得的新最优。
ARC-AGI 3 三倍领先。这项评估要求模型解决全新类型的问题,Opus 5 的得分是第二名模型的三倍。
CursorBench 3.2 仅差 0.5%。在 max effort 下,Opus 5 达到了 Fable 5 峰值得分的 99.5%,开销省一半。在 high、xhigh、max 三档 effort 上,它在给定成本下的性能均超过所有竞品。
其他评估佐证了同一趋势:Zapier AutomationBench 上,Opus 5 的通过率在同等成本下约为次优模型的 1.5 倍,最低 effort 档位已超过任何其他模型的最高分。OSWorld 2.0 上,它以 Fable 5 最佳成绩三分之一多一点的费用超越了 Fable 5。
安全侧同样值得留意。在自动化行为审计中,Opus 5 的总体不当行为得分为 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5,是 Anthropic 近期模型中最"对齐"的一个。它遵守 Claude Constitution 的程度最高,欺骗性回应率最低,也最不容易被诱导滥用。
配套发布的还有两项 beta 功能:Claude Platform 上的对话中途工具切换(不破坏 prompt 缓存),以及 API 端的自动回退——当安全分类器拦截请求时,可配置自动路由到其他模型,而非直接阻断。
不再是"备用机":Opus 5 对 Fable 5 的替代意味着什么
在 Opus 5 之前,Anthropic 的产品分层是清晰的:Opus 级负责日常,Fable(Mythos)级负责最难的任务。Opus 4.8 与 Fable 5 之间存在巨大的能力鸿沟,频繁切换模型是常态。
Opus 5 改变的是这个假设。当一款 Opus 定价的模型能在 CursorBench 上追平 Fable 5、在 OSWorld 上超越 Fable 5、在 Frontier-Bench 上刷新最优,"上 Fable"的理由正在被侵蚀。Anthropic 对 Axios 表示,Fable 5 仍应作为"最复杂、长程自主任务"的首选模型,但 Opus 5 已在多数日常场景中模糊了这条分界线。
Triple Whale 联合创始人兼 CEO AJ Orbach 的测试给出了一个更形象的注脚:"Opus 5 会像一个真正的前端工程师那样检查自己的工作。在我们的 benchmark 上,它在桌面和手机宽度上打开页面,发现了一款产品被埋在了移动端折叠线以下、一个结账按钮跑到了屏幕外,在交回来之前全修好了。"对大多数工程团队来说,一个会自查、会迭代、会在交付前纠错的模型,比一个理论得分更高但需要人盯着的模型实用得多。
Alex Albert 在发布当天的推文里留下了一句注脚:六个月前他还觉得 Opus 4.5 已经把日常任务推到了新高度,现在 Opus 5 直接把这条线又往上划了一截。
参考链接
- _