AREX Feed Article
Sonnet 5反杀Opus,Token涨35%,定价崩了
Claude Sonnet 5 在 6 月 30 日正式上线。Anthropic 将它定位为"史上最具 Agentic 能力的 Sonnet",但真正让开发者坐直身体的数据藏在 System Card 里:Sonnet 5 在 Terminal-Bench 2.1 上跑出 80.4%,以近 6 个百分点的优势首次反超旗舰模型 Opus 4.8(74.6%)。这是 Mid-tier 模型第一次在终端操控评测上正面击败自家旗舰。
与此同时,一个隐藏在脚注里的技术细节引爆了开发者社区的持续辩论——新分词器让同一段文本的 Token 数量膨胀了最多 35%。"每 Token 更便宜,每任务更贵"的悖论,正在撕开 Agentic 时代定价逻辑的第一道裂缝。
终端操控上,Sonnet第一次赢了Opus
Claude Sonnet 5 在 6 月 30 日正式上线,Anthropic 将它定位为"史上最具 Agentic 能力的 Sonnet"。但真正让开发者坐直身体的数据藏在 System Card 里:Sonnet 5 在 Terminal-Bench 2.1 上跑出 80.4%,以近 6 个百分点的优势首次反超旗舰模型 Opus 4.8(74.6%),相对前代 Sonnet 4.6(67.0%)更是 13.4 个点的跃升。
这不是一次常规的 Mid-tier 迭代。Sonnet 5 在 Humanity's Last Exam 工具辅助模式下拿到 57.4%,与 Opus 4.8 的 57.9% 几乎打平;在知识工作评测 AA-Briefcase 和 GDPval-AA 上甚至微弱领先 Opus 4.8。
在 Cursor 内部评测 CursorBench 上,Sonnet 5 拿下 57%,对比 Sonnet 4.6 的 49%——这是 Cursor 有记录以来 Sonnet 代际之间的最大跳跃。SWE-Bench Pro 达到 63.2%,比前代高出 5.1 个百分点。
6 月 30 日下午,ClaudeDevs 官宣推文迅速突破 118 万次观看、8,855 次点赞和 767 次转发。一天之内,Sonnet 5 成为 Free 和 Pro 用户的默认模型。
57万播放教程刷屏,HN顶部评论却在质疑"财富收割"
Sonnet 5 上线后不到 24 小时,X 平台上涌现了大量实战内容。
设计师 Viktor Oddy(Design Rocket 创始人,6 万粉丝)发布了一段 18 分钟的 Claude Code + Sonnet 5 网页设计教程,用 Sonnet 5 重建了价值 3.5 万美元的动画网站。帖子获得 57.4 万次观看、4,909 次点赞、455 次转发和 7,543 次收藏。知名开发者 Theo(t3.gg,35 万粉丝)紧急发布拆解视频:"Big day for Claude fans!我们有了 Sonnet 5,Fable 明天也回来了🙏",视频观看量超过 8.2 万。
一条据称来自 Anthropic 工程师的内部建议在 X 上被疯狂传播,观看量逼近 50 万,获得 1,819 次点赞。核心信息是:"大多数人会用错 Sonnet 5 和 Fable 5。花一下午设置正确,就能停止每天多付钱。"
但 Hacker News 上的画风截然不同。Sonnet 5 发布帖以 155 分登上首页,63 条评论中,置顶评论直指核心矛盾:"我不理解为什么要在 Opus 上降低努力级别来用这个——Sonnet 5 在高努力级别下,单任务成本反而超过 Opus。"另一条高赞评论更为尖锐:"这些模型正在被优化为从用户和公司身上提取财富,而不是解决问题。"
在 Reddit 的 r/ClaudeAI 板块,官方公告帖下讨论同样白热化。有人直接贴出计算表:Sonnet 5 在高推理级别下既比 Opus 4.8 更贵,也更笨。"新的分词器是一次隐形涨价——同样的文本多出约 30% 的 token,即使 per-token 价格看起来没变。"
开发者 Diego 在 X 上发布了一套 Fable 5 做编排、Opus 做深度推理、Sonnet 5 做机械执行的模型路由方案,获得 39.1 万次观看和 4,305 次点赞——社区已经在用自己的方式回应"单任务成本悖论"。
Agentic从差异化卖点退化为入场券的那六周
Sonnet 5 不是在真空中发布的。过去六周,三大 AI 实验室完成了同一件事:把"Agentic"这个词从旗舰级的差异化标签,变成了全产品线的默认配置。
5 月 19 日,Google 在 I/O 大会上发布 Gemini 3.5 Flash,明确定位为从对话聊天机器人转向"能规划、能构建、能以最少人工输入迭代真实工作"的 Agentic 工具。Flash 系列首次被赋予前沿级推理能力,打破了"快模型只能做简单任务"的旧边界。
紧接着,OpenAI 在上周释出 GPT-5.6 Sol 预览版,官方口径同样是"最具 Agentic 能力的模型",核心技术卖点是允许用户将工作拆分给多个子代理,实现更长时间的自主任务执行。GPT-5.5 的高推理模式早已在开发者中广泛使用。
Anthropic 自己也在加速。Fable 5 因出口管制短暂下架后,于 7 月 1 日——也就是 Sonnet 5 发布次日——全球回归。Fable 5 负责天花板,Sonnet 5 负责性价比,Haiku 负责速度,三条线形成完整的高低搭配矩阵。
在 Polymarket 上,Sonnet 5 的 6 月 30 日发布窗口早已被市场押注:32% 的概率指向 6 月 30 日,远高于其他日期。这不是突袭——而是一次被全行业预判了时间的、不得不打的牌。
比Opus便宜40%,为什么单任务反而贵了15%?
Sonnet 5 的成本悖论来自两层叠加效应。
第一层是分词器。 Anthropic 为 Sonnet 5 引入了与 Opus 4.7 相同的新分词器。同一段文本产生的 Token 数量比 Sonnet 4.6 多出 1.0 到 1.35 倍——Simon Willison 实测英文文本膨胀至 1.42×,Python 代码约 1.27×,中文几乎不变。推广期价格($2/$10)覆盖了这一膨胀,但 9 月 1 日回归标准价 $3/$15 后,Finout 建模显示同一工作负载的有效成本将比 Sonnet 4.6 基线高出 20%–35%。
第二层是行为性的。 Sonnet 5 被设计为"更自主"——主动检查输出、追溯根因而非修补症状、在复杂任务上推进到底。这意味着同一任务消耗的 Token 更多。Artificial Analysis 评测显示:Sonnet 5 在 Intelligence Index 中每任务消耗 $2.29,而 Opus 4.8 仅需 $2.00——尽管 Opus 的 per-token 价格是 Sonnet 的 1.67 倍。Sonnet 5 的 Agentic turns 比低努力模式多出约 6 倍。
Anthropic 新增了 xhigh 努力级别,形成五档拨盘。拨到 xhigh 时,Sonnet 5 在 OSWorld-Verified 和 BrowseComp 上可触及 Opus 4.8 中高档位的表现,但此时成本优势消失甚至反转。这恰恰是 HN 顶部评论的核心困惑。
但也存在例外。AI 从业者 Shalini Goyal 用 HTML5 Canvas 物理模拟测试了四款模型(汽车撞墙、破坏球拆房、投石机攻城),Sonnet 5 仅用 15,047 Token($0.15)就匹敌了 GPT-5.5 的 31,152 Token($0.94),成本仅为其六分之一。在创意生成类任务上,Sonnet 5 的 Token 效率反而显著优于竞品。
Mid-tier追平旗舰之后,模型路由成了新核心能力
此前的模型选择逻辑简单而稳定:高端推理用 Opus,日常编码用 Sonnet,大批量简单任务用 Haiku。Sonnet 5 在这条分界线上砸出了一道裂缝。
它在 Terminal-Bench 上反超 Opus 4.8,在知识工作评测上微弱领先,在 Humanity's Last Exam 上几乎打平——这意味着对于相当比例的开发者工作负载,Sonnet 5 和 Opus 4.8 不再是"高低配",而是需要按任务类型做动态路由的平行选项。
Diego 在 X 上发布的编排方案正是这一逻辑的产品化:Fable 5 做全局编排,Opus 做深度推理子代理,Sonnet 5 做机械执行子代理,Codex 作为不同视角的 Peer 工程师并行处理高 stakes 决策。这套"一人指挥、三模型协同"的工作流在 48 小时内获得近 4,000 次转发、8,600 次收藏。
更大的格局变化在竞品侧。Google Gemini 3.5 Flash 以免费 tier 提供前沿级 Agentic 能力,OpenAI 的 GPT-5.6 Sol 将子代理拆分作为核心卖点。当三家顶级实验室同时把 Agentic 下沉到 Mid-tier,竞争不再是谁有 Agentic 能力,而是谁能提供更可预测的 Agentic 成本。
Anthropic 的推广价到 8 月 31 日截止——这个日期成了一个隐性的行业节点。如果 Sonnet 5 在 9 月回归标准价后确实比 Opus 更贵,大量工作负载将回流 Opus,或外溢至 Gemini 和 OpenAI。
定价逻辑崩了之后,开发者要换的不是模型,是算账方式
Sonnet 5 真正的遗产不会写在任何一张 Benchmark 表格里。它用一次代际跃升做了一件事:向整个行业证明,当模型变得足够自主时,"每百万 Token 多少钱"这个沿用了三年的定价单位,已经不再能回答开发者真正关心的问题——"完成这个任务要花多少钱"。
8 月 31 日之前,推广价暂时遮住了这道裂缝。但裂缝本身不会消失。Agentic 时代的性价比方程从此多了一个变量:模型思考得越深、推得越远,账单就越偏离 sticker price。开发者要换的,从来不是模型——是算账方式。
本文基于公开信息独立撰写,不代表 Anthropic 或任何关联方立场。
Sources:
- (官方公告,2026-06-30)
- (2026-06-30)
- (2026-06-30)
- (2026-06-30)
- (2026-07-01)
- (2026-06-30)
- (155 points, 63 comments)
- (1.18M views, 8,855 likes)
- (574K views, 4,909 likes)
- (25K views)
- (500K views, 1,819 likes)
- (391K views, 4,305 likes)
- (2026-06-30)