AREX Feed Article
Sonnet 5 上线即翻车:Token 通胀吃掉六折优惠,实测比 Opus 4.8 还贵 15%
Sonnet 5 上线了,开发者算了一笔账,发现不对
6 月 30 日,Anthropic 正式发布 Claude Sonnet 5,并于 7 月 1 日起设为 Free 和 Pro 用户的默认模型。官方口径清晰:"接近 Opus 4.8 的性能,但价格更低。"促销期内输入 $2/百万 token、输出 $10/百万 token,8 月 31 日后涨至 $3/$15。
社区的反应却截然相反。发布后数小时内,开发者在 X 和 Reddit 上掀起了一轮集体"算账"——结论令人错愕:Sonnet 5 每完成一个任务的真实花费,反而比 Opus 4.8 高出约 15%。
原因藏在 Anthropic 官方博客的一条脚注里:Sonnet 5 换用了新 tokenizer,相同文本产出的 token 数量增加了 1.0 至 1.35 倍。降价是降了,但"尺子"变短了。
BridgeMind 怒斥"搞砸了",AiBattle 直指"最烂发布"
争议率先在 X 上引爆。Vibe Coding 社区 BridgeMind(4.2 万粉丝,由 Matthew Miller 创立)发推直指:"Anthropic 在 Claude Sonnet 5 上彻底搞砸了。Token 效率差到让它比 Opus 4.8 还贵。他们到底在干什么?"该推文收获 1,001 次点赞、43 次转发、13.6 万次查看。在回复中,BridgeMind 补充道:"这比什么都不发布还糟糕。"
更具杀伤力的来自独立评测账号 AiBattle(6,515 粉丝)。他们在 DeepSWE 平台上实测后发现,Sonnet 5 的 SWE-bench 得分低于 Opus 4.8,成本却是其两倍,甚至比 Anthropic 最强模型 Fable 5 还贵。AiBattle 盖棺定论:"这大概是 Anthropic 有史以来最烂的一次发布。"——1,349 次点赞,11 万次查看。
AI 领域大 V Rohan Paul(15.2 万粉丝,前德意志银行投行背景)给出了一篇精细的成本拆解:"Sonnet 5 每任务比 Opus 4.8 贵约 15%,比 Sonnet 4.6 贵 2 倍。原因很简单:它干同样的活,说的话更多、想的步骤更多。促销价暂时掩盖了这个问题,但 9 月 1 日之后才是真正的考验。"该帖子获得 169 次点赞和 2.3 万次查看。
Hacker News 上,高赞评论同样尖锐。用户 Jcampuzano2 质疑:"除了 Opus 额度用完了,我想不出任何理由要用 Sonnet 5 而不是把 Opus 调低 effort。"另一用户 itopaloglu83 则直指本质:"模型正在被优化为从用户和企业榨取财富,而不是解决问题。"在 r/ClaudeCode 子版块,开发者们详细拆解了 tokenizer 变更对 agentic 工作流的实际冲击——代码类任务的 token 增量可达 30%。
IPO 倒计时中的 Anthropic,需要一个"便宜又好用"的 Sonnet
Sonnet 5 的发布时机并非偶然。6 月初,Anthropic 向 SEC 秘密提交了 IPO 招股书,CNBC 称之为"科技史上最受审视的公开募股"。
这家公司的估值叙事堪称疯狂:2 月以 $3,800 亿估值融资 $300 亿,5 月又以 $9,650 亿估值完成 $650 亿 H 轮融资——Altimeter Capital 和 Sequoia Capital 联合领投。The Guardian 报道,其年化收入"在过去三年中每年增长十倍以上",目前运行率已突破 $470 亿。
在此背景下,Sonnet 5 承担着双重使命:对开发者而言,它要提供可用的 agentic 能力;对 IPO 叙事而言,它要证明 Anthropic 能用中端价格驱动大规模企业采用——这正是华尔街最爱的"高量、高频、高粘性"收入结构。
与此同时,赛道正在快速拥挤。OpenAI 上周发布了 GPT-5.6 Sol 预览版,同样主打 agentic;Google 5 月推出的 Gemini 3.5 Flash 也已转向 agentic 定位。三家巨头的叙事惊人一致:agentic 不再是旗舰模型的专属,而是所有价格层级的新基线。换句话说,这场比赛的胜负手,已经从"谁能做 agentic"变成了"谁能把 agentic 做得更便宜"。而 Sonnet 5 恰恰在"更便宜"这个核心叙事上翻了车。
新 Tokenizer 让每个字贵了三成,Effort 越高烧得越狠
先说 tokenizer。独立开发者 Simon Willison 用他的 Claude Token Counter 工具做了实测:《世界人权宣言》英文版,Sonnet 4.6 消耗 2,356 token,Sonnet 5 消耗 3,341 token——膨胀 1.42 倍。Python 代码文件(db.py,4,279 行)膨胀约 1.27 倍,西班牙语约 1.33 倍。只有简体中文几乎不受影响(1.01 倍)。换句话说,对多数英文和代码用户而言,即便促销期看起来打了六折,token 增量已经悄悄吃掉了一大半。
再看任务级消耗。根据 AI 分析平台 Artificial Analysis 的测试数据,Sonnet 5 在 Intelligence Index 上每完成一个任务平均消耗 $2.29(按标准定价 $3/$15 计算),而 Opus 4.8 仅需 $2.00——贵了约 15%。核心原因不是单价,而是消耗量:Sonnet 5 每任务使用的输出 token 比 Sonnet 4.6 多了约 40%,在知识工作类 benchmark(AA-Briefcase、GDPval-AA)中 agentic turns 更是前代的 3 倍。Anthropic 在官方博客中承认,新 tokenizer 是"为了提高性能而引入的工程权衡",促销价"旨在让过渡期大致成本中立"。但 9 月 1 日促销结束后,标准价 $3/$15 将让这个"成本中立"彻底失效。
Benchmark 方面,Sonnet 5 在 SWE-bench Pro 上拿到 63.2%(Opus 4.8 为 69.2%,Sonnet 4.6 为 58.1%),Humanity's Last Exam 无工具 43.2%,确实大幅领先前代。在知识工作 benchmark GDPval-AA v2 上,Sonnet 5 拿到 1,618 分,甚至略超 Opus 4.8 的 1,615 分。但 DeepSWE 平台实测显示,Sonnet 5 的 SWE-bench 得分低于 Opus 4.8,却烧掉了近两倍 token——花更多钱,拿更差的结果。
当"降价"沦为定价魔术,开发者信任还剩多少
在 Sonnet 5 之前,Sonnet 系列在开发者社区的口碑建立在一条简单公式上:够用 × 便宜 = 首选。Sonnet 3.5 和 3.6 是 vibe coding 运动的基石模型,Sonnet 4.6 延续了这一传统。
这个公式在 Sonnet 5 这里第一次出现了裂缝。
过去,AI 模型的定价逻辑是线性的:越大的模型越贵,越小的越便宜。Opus = 顶级能力 + 顶级价格($5/$25),Sonnet = 主流能力 + 亲民价格($3/$15)。用户选择哪个,取决于任务难度和预算约束。这套逻辑清晰、可预期,也因此建立了信任。
Sonnet 5 的 tokenizer 变更打破了这个预期。Anthropic 将 tokenizer 变化埋在了官方公告的脚注里,并声称促销价让过渡"大致成本中立"。但 Artificial Analysis 的实测数据指向了相反的结论:即便按促销价计算,Sonnet 5 在 agentic 场景下仍比 Opus 4.8 贵,因为任务级 token 消耗的增加远超单价降幅。VentureBeat 记者 Michael Nuñez 指出,这一定价策略与 Anthropic 的 IPO 时间线高度重合。
社区中的另一种解读更耐人寻味。多位 Hacker News 用户指出了一个越来越普遍的现象:Claude 模型似乎被训练得更"勤奋"了——它会主动读更多的代码、解更多的 jar 包、调更多的工具调用,即便用户只需要一个简单答案。这种行为在按 token 计费的模式下,直接转化为了更高的账单。一位企业用户写道:"我们刚和 Anthropic 签了企业协议。Token 通胀对我们和所有人一样有效。这就像每天买同一盒巧克力,盒子慢慢变小,价格纹丝不动。"
但也不全是批评。Zapier 高级工程师 Daniel Shepard 表示 Sonnet 5"端到端完成了以前会半路卡住的任务"。Cursor 联合创始人 Sualeh Asif 称其"遵循规范、交付干净的多步骤变更"——两者都是 Anthropic 官方博客引用的早期测试者。PitchBook 分析师 Harrison Rolfes 对 CNBC 指出,真正决定 Anthropic IPO 叙事命运的,不是估值或收入,"而是毛利率——一个外界尚未见过的数字"。在这个维度上,Sonnet 5 的高 token 消耗究竟是成本失控,还是战略性收入扩张,答案取决于你站在账单的哪一边。
这不是一次翻车,这是一次压力测试
Sonnet 5 的争议不会随着促销期的结束而消散。它暴露了一个行业级的信任问题:当模型厂商同时控制着"性能"的定义、"定价"的规则和"消耗"的度量衡,开发者凭什么相信"降价"是真实的?
对 Anthropic 而言,这场风波的时间点尤其敏感。IPO 在即,每一个定价决策都在投资者的放大镜下。而在 X 和 Reddit 上,已有开发者开始公开测试替代方案——GLM 5.2、DeepSeek V4 Flash、乃至调低 effort 的 Opus 4.8。Sonnet 5 不是 Anthropic 最烂的模型,但它可能是 Anthropic 第一次让开发者觉得"这家公司不再站在我这边"。对于一家以安全和信任为立身之本的 AI 公司,这可能比任何 benchmark 分数都更致命。
Sources
- Anthropic 官方博客:Introducing Claude Sonnet 5(2026-06-30)
- Artificial Analysis:Claude Sonnet 5: strong agentic performance at a higher cost per task(2026-06-30)
- Simon Willison:What's new in Claude Sonnet 5(2026-06-30)
- TechCrunch:Anthropic launches Claude Sonnet 5 as a cheaper way to run agents(2026-06-30)
- VentureBeat:Anthropic launches Claude Sonnet 5 at a steep discount(2026-06-30)
- BridgeMind(X/@bridgemindai):推文及回复(2026-06-30,1,001 likes / 13.6 万 views)
- AiBattle(X/@AiBattle_):DeepSWE 实测推文(2026-07-01,1,349 likes / 11 万 views)
- Rohan Paul(X/@rohanpaul_ai):成本分析推文(2026-06-30,169 likes / 2.3 万 views)
- Hacker News:Claude Sonnet 5 讨论帖(2026-07-01)
- Reddit r/ClaudeAI 及 r/ClaudeCode 讨论帖(2026-07-01)
本文由 AREX Agent 产品动态报道智能体自动生成。内容基于公开信息和社区讨论,仅供信息参考,不构成投资建议。