AREX Feed Article
Sonnet 5 上线:逼近 Opus 4.8、价格砍六成,Theo 当场打脸
时隔四个月,Sonnet 终于换代了
美东时间 6 月 30 日上午 11 点,Anthropic 正式发布了 Claude Sonnet 5,并立即将其设为 Free 和 Pro 用户的默认模型。
官方推文用一句话定义了这款新品:"迄今最具 agentic 能力的 Sonnet——它能制定计划、使用浏览器和终端等工具,并以几个月前还需要更大、更贵模型才能实现的水平自主运行。"
这条推文在 12 小时内拿下 3.9 万点赞、4,182 次转发和 730 万次浏览。开发者生态的反应同样迅猛:Cursor 在同一天确认 Sonnet 5 上线,CursorBench 得分从 Sonnet 4.6 的 49% 跳升至 57%;GitHub Copilot 宣布即刻支持;VS Code、Vercel AI Gateway 相继接入。
但对 Anthropic 而言,这次发布远不止一次产品迭代。这是公司 6 月 1 日秘密提交 S-1 之后的第一款新模型,也是一场关于"中端模型能不能撑起万亿估值"的公开测试。
Theo 晒账单:比 Fable 还烧钱
官方叙事是"接近 Opus 4.8 性能,Sonnet 级价格"。社区的反应却没那么客气。
拥有 35 万粉丝的开发者 Theo(t3.gg)连发数条推文打脸。他贴出 Artificial Analysis 的实测数据:Sonnet 5 跑完整 benchmark 的成本比 Opus 4.8 还高,甚至比 Anthropic 最贵的 Fable 5 更烧钱。"Oh my god, Sonnet 5 was MORE EXPENSIVE THAN FABLE to run the whole bench 💀",这条推文拿下 5,274 个点赞和 56 万次浏览。
另一位 22.6 万粉的知名开发者 banteg 则直呼"欢迎来到 benchmerfing 时代",贴出数据显示 Sonnet 5 在部分场景弱于 Sonnet 4.6,且"是史上 token 效率最低的模型——比 GPT-5.5 笨 4.3 倍"。
但也有人看到不同的画面。Box CEO Aaron Levie(298 万粉)发布了企业级实测结果:在能源(+4.7pp)、零售(+4.4pp)等垂直领域,Sonnet 5 显著超越前代,尤其在融资尽职调查等需要深度推理的任务中,能捕捉到源报告自身未能发现的错误。
Zapier 高级工程师 Daniel Shepard 的反馈更为直接:"我们交给 Sonnet 5 一个两步任务——更新 Salesforce 客户层级,向企业联系人发送上线公告——它端到端完成了。以前走到一半就卡住。"
IPO 前夜,Anthropic 需要一条中端收入曲线
Sonnet 5 发布的时机绝非巧合。
6 月 1 日,Anthropic 秘密向 SEC 提交了 S-1 招股书草案。此前一周,公司刚完成 650 亿美元的 H 轮融资,估值达 9,650 亿美元,年化收入已突破 470 亿美元。PitchBook 分析师 Harrison Rolfes 对 CNBC 的评论一针见血:"真正决定估值叙事的不是收入,是毛利率。"
在此背景下,Sonnet 5 承担着双重使命:对开发者而言,它提供了接近旗舰模型的性能;对 IPO 叙事而言,它证明 Anthropic 有能力在中端价位上量产高质量 AI,驱动高复购的 API 收入。
另一个关键背景:6 月 12 日,美国商务部暂停了 Fable 5 和 Mythos 5 的全球部署。就在 Sonnet 5 发布的次日(7 月 1 日),Anthropic 宣布 Fable 5 将恢复上线——但加装了更严格的安全分类器。在这段窗口期里,Sonnet 5 和 Opus 4.8 是开发者实际能用的天花板。
知识工作首超 Opus,但 tokenizer 埋了暗雷
Sonnet 5 在基准测试上的进步是真实的。
官方数据显示,在 agentic coding 评估中,Sonnet 5 达到 63.2%,虽不及 Opus 4.8 的 69.2%,但较 Sonnet 4.6 的 58.1% 提升了 5.1 个百分点。在 Terminal-Bench 2.1 上,差距进一步缩小:80.4% vs Opus 的 82.7%。在 Humanity's Last Exam(带工具)中,Sonnet 5 的 57.4% 几乎追平 Opus 4.8 的 57.9%。
最引人注目的是知识工作基准 GDPval-AA v2:Sonnet 5 得分 1,618,以微弱优势超越了 Opus 4.8 的 1,615。这是 Sonnet 系列首次在知识工作维度反超旗舰。
CursorBench 上,Sonnet 5 在 High 推理层级拿下 57%,在 Max 层级达到 61.2%,而 Sonnet 4.6 High 仅为 48.8%。
但真正的暗雷藏在技术细节里。Sonnet 5 采用了与 Opus 4.7 类似的新 tokenizer,同一段文本可能产生 1.0 至 1.35 倍的 token 数。官方将入门定价($2/$10)设为"迁移成本中性",但 9 月 1 日标准定价生效后($3/$15),token 通胀效应将与涨价叠加。
这就是为什么 Theo 的 benchmark 账单如此刺眼——Sonnet 5 在单任务中消耗的 token 数远超竞品。在 CursorBench 上,Sonnet 5 High 平均每任务用掉 41,735 token、$3.74,而 GPT-5.5 High 仅为 13,329 token、$3.59。花差不多的钱,后者 token 效率高出数倍。
便宜,才是 agentic AI 的真正入场券
Sonnet 5 发布的更大背景,是整个 AI 行业正在从"谁的模型最强"转向"谁的 agent 最便宜且可靠"。
TechCrunch 在报道中指出了这个转折:OpenAI 上周发布的 GPT-5.6 Sol 同样是"迄今最具 agentic 能力的模型",Google 5 月上线的 Gemini 3.5 Flash 也被定位为从聊天到自主执行的跃迁。agentic 能力已经成为每个价位段的基础期待——差异化不再是谁能做 agentic 工作,而是多便宜、多可靠。
在这个坐标系里,Sonnet 5 的得分是分裂的。性能上,它确实把中端模型的 agentic 天花板抬到了接近旗舰的位置。但成本上,token 效率的问题让"便宜六成"的宣传打了折扣。
Anthropic 对此的策略是提供多个推理努力层级,让用户在成本与精度之间自行调节。但正如一位开发者指出的:"如果你已经付了每月 200 美元,为什么要用 Sonnet 5 而不是 Opus 4.8 Max?"
答案可能不在开发者个体,而在企业采购。当数千个并发 API 调用的账单摆在财务部门面前时,Sonnet 5 相对于 Opus 4.8 的标称价差($3/$15 vs $5/$25)仍具有说服力——前提是 tokenizer 的实际影响不超过 Anthropic 的上限估计。
这一仗,打的不是 benchmark,是收入模型
Claude Sonnet 5 最大的悬念不在技术层面,而在财务层面。
当 Anthropic 的 S-1 最终公开时,投资者会盯住一个核心问题:驱动收入大盘的,到底是高毛利的 Opus 级调用,还是薄利多销的 Sonnet 级调用?Sonnet 5 的使命,就是在 IPO 定价之前,交出一条足够粗的中端收入曲线。
而这条曲线能否画出来,取决于一个基准测试测不出来的东西——真实世界中,开发者跑完一整周的工作负载之后,是续费,还是切回 Opus。
本文基于 Anthropic 官方博客、TechCrunch、VentureBeat、CursorBench 公开数据及 X/Twitter 公开讨论撰写。
Sources:
- Anthropic Blog — "Introducing Claude Sonnet 5" (Jun 30, 2026):
- TechCrunch — "Anthropic launches Claude Sonnet 5 as a cheaper way to run agents" (Jun 30, 2026):
- VentureBeat — "Anthropic launches Claude Sonnet 5 at a steep discount" (Jun 30, 2026):
- CursorBench:
- GitHub Changelog — "Claude Sonnet 5 is generally available for GitHub Copilot" (Jun 30, 2026):
- X/Twitter — @claudeai, @theo, @banteg, @cursor_ai, @github, @levie, @AnthropicAI
- Fortune — "Anthropic confidentially files for IPO after a $965 billion valuation" (Jun 1, 2026):