AREX Feed Article
Anthropic 把 Sonnet 5 入门价焊死:$2/$10 永久化,中端模型追到 Opus 4.8 身后
6 月 30 日,Anthropic 发布了 Claude Sonnet 5,称其为「迄今最具智能体能力的 Sonnet 模型」——能制定计划、操作浏览器和终端、长时间自主运行。同时宣布了 $2/$10 每百万 token 的入门定价,有效期到 8 月 31 日。
8 月 10 日,Anthropic 在 X 上宣布:。原定 9 月 1 日生效的 $3/$15 标准定价不再执行,$2 输入 / $10 输出留在定价表上不动了。
一条定价更新比任何 benchmark 都更能说明 Anthropic 对这款中端模型的判断:它不是为 Opus 4.8 引流的过渡品,而是今后日常智能体任务的默认引擎。
「有 Opus 八成功力,五分之一的价格」
发布当天,开发者的反应集中在同一个问题上:还要不要用 Opus?
给出了直接回答:Sonnet 5 在推理、工具使用、编码和知识工作方面「性能接近 Opus 4.8,价格更低」。早期体验合作伙伴的反馈更具体——Zapier 描述了一个场景:让模型同时更新 Salesforce 客户分级并给企业联系人发上线通知,之前的 Sonnet 版本会卡在半路,Sonnet 5 一次跑通。Lovable 联合创始人的评价直接得多:「一个知道什么时候该拒绝的模型,跟一个知道怎么构建的模型同样重要。」
独立开发者 Simon Willison 在发布当晚:新 tokenizer 让英文输入的 token 数多了约 1.4 倍,西班牙语约 1.33 倍,但简体中文几乎不变。英文用户面对的实际涨幅比标价大,中文用户性价比反而更高。
Hacker News 上的反应掺着疑虑。显示,开发者 phillipcarter 认为这是「workhorse 模型又一次扎实的增量更新」,日常编码已经不需要切回 Opus。另一位用户 mchusma 则指出模型在 $2/$10 促销价下很有吸引力,一旦升到标准价就打了折扣——这个担忧在 8 月 10 日被 Anthropic 亲手消解了。
从 Sonnet 3.5 到 Sonnet 5:智能体能力从旗舰下放为中端标配
Sonnet 这条线的演进,是 Anthropic 把智能体能力一步步往下沉的编年史。
Anthropic 官方博客回顾道,智能体 AI 时代从 Sonnet 级模型开始——Sonnet 3.5、3.6 和 3.7 是第一批在编码和工具使用上展现出真正技能的模型。但当时的叙事很清楚:要做智能体任务,Sonnet 勉强够用,Opus 才是正经答案。
2026 年 2 月, 上线,带来了 100 万 token 上下文窗口的 beta 版,编码和计算机使用能力继续提升,但智能体能力的天花板仍然明显低于 Opus 级别。
4 月, 把长任务执行、指令遵循精度和自我验证推到了一个新高度。智能体能力的差距不但没缩小,反而被拉大了——最明显的进步发生在旗舰线上。
6 月 30 日,Sonnet 5 打破了这个格局。Anthropic 官方博客写道:「对很多开发者来说,智能体 AI 时代从 Sonnet 级模型开始……但最近,智能体能力最明显的提升出现在 Opus 级模型上。Sonnet 5 缩小了这个差距。」
SWE-bench Pro 63.2%,知识工作反超 Opus
显示,Sonnet 5 对 Sonnet 4.6 是全方位的碾压,对 Opus 4.8 则是咬得很紧。
智能体编码(SWE-bench Pro)得分 63.2%,比 Sonnet 4.6 的 58.1% 高出 5.1 个点,比 Opus 4.8 的 69.2% 低 6 个点。差距还在,但已经从「两个级别」缩到了「同一竞争区间内选性价比」。
Terminal-Bench 2.1 上,Sonnet 5 拿到 80.4%,Sonnet 4.6 是 67.0%,一口气跳了 13.4 个点。OSWorld-Verified(计算机使用)得分 81.2%,比前代 78.5% 提升有限但稳定。
最意外的数字在知识工作 benchmark GDPval-AA v2 上:Sonnet 5 得分 1,618,Opus 4.8 是 1,615。中端模型在知识工作评测上以微弱优势反超了旗舰。
Humanity's Last Exam(带工具)得分 57.4%,几乎和 Opus 4.8 的 57.9% 打成平手。这条评测在发布时因 grader 更新而重新标定了 Sonnet 4.6 的分数(从原始发布的更低值上调至 46.8%),但即便用同一把尺子量,Sonnet 5 的跃升仍然超过 10 个点。
Sonnet 5 支持四个推理努力等级——low、medium、high、xhigh。在 xhigh 等级上,它在 BrowseComp 和 OSWorld-Verified 上可以匹配 Opus 4.8 的中高水平表现,但代价是成本可能反超 Opus。Anthropic 把这两个模型画在了同一张成本-性能曲线上,告诉用户:这不是二选一,而是一条连续的调节范围。
安全取舍:故意把网络攻击能力压到接近零
Sonnet 5 的安全评估透露出 Anthropic 的一个主动选择:这款模型被刻意训练得不太擅长网络安全。
在与 Mozilla 合作设计的 Firefox 147 漏洞利用测试中,Sonnet 5 和 Sonnet 4.6 从未成功开发出可用的漏洞利用程序(均为 0.0%),Sonnet 5 的部分成功率略高,但 Anthropic 将其归因于通用智能的提升而非专门的网络训练。与之对照,Opus 4.8 和 Mythos 5 在这项评测上表现出显著更强的能力。
与此同时,Sonnet 5 在拒绝恶意请求、抵抗提示注入攻击方面的表现好于 Sonnet 4.6,幻觉和迎合倾向也更低。Anthropic 的自动化行为审计显示其总体不良行为率低于前代,但仍高于 Opus 4.8 和 Mythos Preview。
网络防护默认开启,强度与 Opus 4.7/4.8 相同,但比 Fable 5 宽松——后者封锁了更广范围的网络安全任务。对于需要降低防护栏的安全研究场景,Anthropic 的建议是直接用 Opus 4.8。
中端模型的定义变了
Sonnet 5 改变了 Anthropic 产品线中「中端」二字的含义。
过去,中端意味着日常对话、简单编码、短文档处理。智能体任务、长时间自主运行、跨系统复杂工作流是旗舰模型的专属领地。
Anthropic 这次把 Sonnet 5 和 Opus 4.8 画在了同一张成本-性能范围图上,告诉用户两件事:第一,Sonnet 5 拿走了过去只属于 Opus 的大部分智能体任务;第二,Opus 4.8 的定位从「你唯一的选择」变成了「你遇到真正难题时的后备方案」。
这个定位和 Exodata 在发布当天给出的一致:默认走 Sonnet 5,只在错误成本很高或小模型已经失败的场景下切换到 Opus。「一个错误如果只是被人工审核发现并花 30 秒纠正——比如邮件草稿、工单摘要、代码框架——Sonnet 5 是显而易见的选择。」
定价永久化之后,这个框架变得更简单了。Sonnet 5 输出端 $10/百万 token,Opus 4.8 是 $25,价差 2.5 倍。Opus 4.8 仍然在 SWE-bench Pro 上领先 6 个点,但对绝大多数日常智能体负载来说,2.5 倍的价差已经足够让决策自动化——从 Sonnet 5 开始,不行再升 Opus。