AREX Feed Article
Claude Opus 5 炸场:ARC-AGI-3 一把拉开近 4 倍差距,Cursor/GitHub/Copilot 全线亮绿灯
7 月 24 日,Anthropic 发布 Claude Opus 5。定价与 Opus 4.8 完全相同——输入 $5/百万 token,输出 $25/百万 token——但智能水平逼近 Fable 5。ARC-AGI-3 得分 30.2%,是此前 GPT-5.6 Sol Max 创下的 7.8% 的近四倍。主推文 12 小时内收割 5.7 万点赞、7100 次转发、1650 万次观看。
Cursor、GitHub、Lovable 同时亮绿灯,全平台无死角上线
Cursor 官方在发布后 4 分钟即宣布 Opus 5 上线,给出关键数据:"CursorBench 66.7 对 66.5,默认 effort 下与 Fable 5 持平,价格只有一半。而且兼容 Zero Data Retention。"这条推文拿下 5500 赞、23 万次观看。
GitHub 紧随其后确认 Opus 5 已接入 Copilot,称其在 agentic coding 工作流中"验证自身工作、减少不必要的执行开销"表现突出。VS Code 官方账号同步转发。
ARC Prize 联合创始人 Mike Knoop 和 François Chollet 的团队发表独立验证:Opus 5 在测试中展现出"此前未见的 novel behavior",能解决此前所有模型都无法攻破的环境,ARC-AGI-3 得分 30.2%,而 Fable 5 自身的成绩甚至未在图表中单独标注——被 Opus 5 超越。
独立评测机构 Artificial Analysis 给出更全面的结论:Opus 5 以 61 分登顶其 Intelligence Index,与 Fable 5(60 分)基本持平,领先 GPT-5.6 Sol Max(59 分)。在 agentic 知识工作基准 AA-Briefcase 上,Opus 5 以 1720 Elo 领先 Fable 5 达 146 分,且单任务成本降低 20%。
Claude Code 团队成员 Thariq 的配套文章更是引爆第二波讨论:他将 Claude Code 的 system prompt 砍掉了约 80%,专门针对 Opus 5 等新模型优化。该线程获得 1.1 万点赞、240 万次观看、2.3 万次书签。
Cognition(Devin 开发商)CEO Scott Wu 表示 Opus 5 在 FrontierCode 1.1 上"以一半成本逼近 Fable 级性能",在调试和根因分析方面尤为突出。Zapier CEO Wade Foster 称 Opus 5 在 AutomationBench 上"不增加 token 消耗即登顶,此前模型无法通过的任务,Opus 5 一次通过率 100%。"
Fable 5 发布仅一个月,Anthropic 为何急于补上 Opus?
6 月 24 日,Anthropic 发布 Mythos 5 和 Fable 5,其中 Fable 5 被定位为"最雄心勃勃的工作才需要的顶级模型",但 30 天数据保留政策和严格的 safety classifier 让部分企业用户犹豫。
7 月 1 日,Sonnet 5 上线,补齐中端。Opus 系列仍停留在 5 月 28 日发布的 4.8 版本。在 Haiku、Sonnet、Fable 均已进入 5 系之后,Opus——这个面向日常重度使用的"主力旗舰"——成了唯一缺失的拼图。
更大的背景是商业压力。据 Contrary Research 分析,Anthropic 在 2025 年底企业 LLM 市场份额约 40%,Claude Code 单产品年化收入已达约 10 亿美元。Reuters 报道其估值约 3800 亿美元,2026 年收入目标 200 至 260 亿美元。支撑这些数字的是与 Azure 达成的 300 亿美元算力合同——只有企业持续扩大用量,这笔账才算得过来。
本周,美国法官批准了 Anthropic 与图书作者的 15 亿美元版权和解协议。6 月,美国政府已采取措施限制外国获取 Anthropic 最先进模型。对一家估值 3800 亿美元的公司而言,Opus 5 既是产品发布,也是监管环境收紧下的战略卡位。
半价打满血:11 项基准榜首,但真正的杀招在"自检"
ARC-AGI-3 上的表现是本次发布最惊人的数字。30.2% 的成绩不仅是前纪录的 3.87 倍,ARC Prize 团队还观察到 Opus 5 在测试中表现出此前模型不具备的问题解决模式——它不是在已有策略中搜索,而是在生成新的解法路径。
Frontier-Bench v0.1 上 Opus 5 得分 43.3%,Opus 4.8 仅 18.7%,Fable 5 为 33.7%。翻倍不止于分数——每任务的成本还更低。Cline 团队报告 Opus 5 在 SWE-Bench 上以 97% 拿下第一。
GDPval-AA v2 上 Opus 5(max effort)得分 1861 Elo,领先 Fable 5 和 GPT-5.6 Sol Max 逾 100 分。Terminal-Bench v2.1 上 89%,与 GPT-5.6 Sol 持平。Humanity's Last Exam 得分 53%,与 Fable 5 相当。
但 Anthropic 自己在发布会上坦诚了模型的边界:网络安全任务仍落后 Mythos 5,生物学研究同样不及。一位发言人告诉 VentureBeat:"Opus 5 赢的是有明确终点的限界任务,Fable 5 赢的是连基准测试都测不到的长程自主工作。"
真正让早期用户反复提及的不是分数,而是行为模式的变化。Stripe 的 Cristian Rivera 将 Opus 5 置于"开发环境幕僚长"角色整整一个周末:"它自己建了监控、驱动每台机器,只在需要判断时叫我。"Harvey 的应用研究负责人 Niko Grupen 报告 Opus 5 在同等质量下平均少生成 26% token。一家交易公司的工程师用它单次会话完成了一个新交易所的市场数据 feed,此前任何模型都无法完成——Opus 5 甚至自己写了一套测试工具来验证解析代码。
五档 effort 设置——low、medium、high、xhigh、max——允许开发者按需在智能与速度之间滑动。xhigh 档位下 Opus 5 成本仅为 Fable 5 的 64%,而得分仍高于 Fable 5。
3800 亿估值背后,每颗 token 的性价比才是战场
此前,AI 模型的竞争叙事是"谁最聪明"——谁的 benchmark 分数最高,谁的参数规模最大。Fable 5 和 Mythos 5 延续了这条逻辑:不惜成本,追求极致。
Opus 5 改写了规则。
它以 Opus 4.8 的定价——输入 $5、输出 $25/百万 token——交付了逼近 Fable 5 的智能。在 CursorBench 上差距仅 0.2 分,在 AA-Briefcase 上反超 146 分。五档 effort 设置让用户可以用更少的 token 完成更多工作:高 effort 下 Opus 5 成本仅为 Fable 5 的 47%,得分却高出 32 Elo。
这不是一次"降价促销",而是一次定价策略的结构性调整。Anthropic 的 API 和企业 token 消耗是其核心收入引擎;一个"花更少 token、做更多事"的模型,本质上是在扩大自动化可覆盖的工作量边界。此前因 Opus 4.8 成本效益不划算而被搁置的任务,现在可以上线了。而每一个上线任务,都是循环的 token 收入。
Artificial Analysis 在推文中点出关键:Opus 5 在 max effort 下平均每个 Intelligence Index 任务花费 $2.03,低于 Fable 5 的 $2.75,但仍高于 Opus 4.8 的 $1.80 和 Sonnet 5 的 $1.53。"但到了 high 和 xhigh effort,Opus 5 在更低的单任务成本下同时超越了 Opus 4.8 和 Sonnet 5。"这意味着 Opus 5 真正的竞争优势不在峰值性能,而在开发者日常使用中最频繁触及的那个"性价比甜点区"。
最好的模型不是最聪明的,是开发者刷得起的那一个
Opus 5 的发布不靠"最强"取胜。它靠的是在开发者每天打开 IDE、提交 PR、排错调试的那一刻,用更低的价格给出和 Fable 5 几乎一样好的答案。ARC Prize 的 François Chollet 曾将 ARC-AGI 定义为"测量模型面对全新问题时生成新解法的能力"。Opus 5 在这项测试上把记录从 7.8% 拉到 30.2%,没有靠更大的参数规模,而是靠更聪明的推理路径。这才是这场发布留给行业最值得追踪的信号。
本文基于 Anthropic 官方公告、ARC Prize 独立验证、Artificial Analysis 基准测试、VentureBeat/TechCrunch/ZDNET 报道及 X 平台开发者社区讨论撰写。
Sources:
- — 57.5K likes, 7.1K retweets, 16.5M views
- — 11.7K likes, 2.4M views