AREX Feed Article
Claude Code high 档显示 10/100,Anthropic 称系服务端配置测试、性能未回退
8 月 22 日,Claude Code 的推理努力量(effort)争议在一天内走完了"用户发现异常、社区发酵、官方回应、用户反驳"的全过程。当天 13:08(UTC),开发者 称,Anthropic 在服务端把 Claude Code 2.1.236+ 的 Fable 5 会话纳入一个缩小 effort 刻度的实验,high 档显示 10/100,正是此前 low 档的数值。
当晚 19:32(UTC),Anthropic Claude Code 团队成员 :部分用户看到 high 显示"10",是一个正式发布前的 API 服务配置测试采用了不同数值映射所致;0-100 刻度本身没有意义,用户选定的努力量就是实际获得的努力量,团队已做深度评测确认不影响模型性能。这是官方单方面说法,没有独立验证。约一小时后,"所选即所得":high 档的 Fable 几乎不做推理,表现与一周前的 low 档无异。
high 被映射到 10/100,且发生在服务端
8 月 22 日 12:49(UTC),:"如果这周你觉得 Fable 变笨了,那不是你的问题。从 2.1.237 起,模型把 high 档的 effort 读作 10/100,正是 low 档此前的数值,而 changelog 只字未提。" 他写道,自己花了一下午以为 t3 code 和自己写的应用坏了,最后去翻实际发出的请求才找到原因。这条推文累计约 49 万次浏览、1462 个赞,附带一张 Claude Code 界面截图,显示 v2.1.239 的 Reasoning effort 设置里,high effort 标注为 "10 (on a scale where 100 is max)"。
约 19 分钟后他更新结论:异常在服务端,不在客户端。Anthropic 把 Claude Code 2.1.236+ 的 Fable 5 会话纳入一个缩小 effort 刻度的实验,旧版本和 Opus 5 不受影响;"大概是 A/B 测试,不是每个人都会看到。如果你觉得 high 像 low,你就在测试组里。" 这条更新推文约 5.8 万次浏览。
当天 14:58(UTC),科技分析师 。他发帖称 Fable 本周明显变笨,Claude Code 的 high 推理努力只有 10/100,"他们似乎没告诉用户就把 Fable 降智了"。这条推文累计约 22 万次浏览、85 次转发。
43 分钟改一个配置文件
当天下午,,159 分、149 条评论,链接指向 argofowl 的推文。评论区汇集了大量独立用户的抱怨与反证,均为用户侧观察,未经官方确认。
用户 pizzafeelsright 给出最具体的对比:同一任务"读取并用新数据更新配置文件",Opus 4.6 不到 2 分钟完成;Opus 5 花了 43 分钟拉容器、跑沙箱、建测试套件,还把评估范围扩大到整个仓库。"而两者都只是一次文件修改。"
用户 Foobar8568 称"Opus 5 在 xhigh 档连基础数学都做不好",并说自己昨天取消了订阅:"我本来是 $200 档用户,fable 的事之后降到了 $20 档,只在 Codex 额度用完时才用。" 也有用户报告相反体验:onion2k 说当天用 Opus 5 写 GLSL 分形渲染器"结果相当不错,它绝对会基础数学";onlyrealcuzzo 称 high 档体验"难以置信地糟糕",medium 档反而好得多。
Thariq 澄清:0-100 刻度没有意义,所选即所得
19:32(UTC),Thariq 以 Claude Code 团队成员身份回复 Chubby 的推文,随后又以 trq_ 的账号把同一段话重发到 Hacker News 讨论帖:
"We sometimes test API serving configs in Claude Code before rolling them out, and one running now maps the numerical effort value differently. That's why Claude may tell some of you it's at '10' on high. The scale isn't 0-100, the number isn't meaningful on its own, and the effort you selected is the effort you're getting. We've run in-depth evals to confirm this doesn't affect model performance."
他的要点是:Claude Code 有时会在正式推出前测试 API 服务配置,当前有一个测试把数值 effort 做了不同映射,所以部分用户看到 high 显示"10";刻度本身不是 0-100,数字单独看没有意义,用户选定的努力量就是实际获得的努力量;团队已做深度评测,确认不影响模型性能。他还表示,用户若看到明显回退,可用 /feedback 反馈并附上会话 ID,"会送 credits"。
六分钟后,:"high 仍然还是 high,内部评测显示没有性能回退。感谢澄清。但我还是要说,大多数模型现在用起来都明显变笨了,尤其是 Opus。" 他随即把矛头转向了更宽泛的模型质量问题。
"Opus 5 是个发挥很不稳定的模型"
19:43(UTC),:"感谢传播!模型这边什么都没有变,但我们在做一个让反馈和回退报告容易得多的功能。" 五分钟后,:Opus 5"现在感觉像一次明显的降级。它反复偷懒、犯粗心的错误……我每次抓到它犯错、它又不按指令做时,得到的回答永远是'你说得对,我漏掉了',一遍又一遍。与此同时它的解释还是极其冗长。Opus 4.6 是我最喜欢的模型,相比之下 Opus 5 感觉是真正的降级……我真心期待一个像 4.6 那样让人喜欢的 Opus 5.1。"
没有再谈 effort 实验,而是承认了模型本身的问题:"是的,我同意 Opus 5 是个发挥很不稳定的模型(a really spiky model),我们希望模型保持一致、温暖、'像 Claude'。我们正在努力改进,这是我们的巨大优先级。" 他没有给出修复时间表。
最初的质疑者没有接受配置测试的解释。20:36(UTC),argofowl 发推:"'the effort you selected is the effort you're getting' 是假的。high 档的 Fable 几乎不做推理,这正是我发现异常的原因。high 档的 Fable 和一周前 low 档的 Fable 表现完全一样,极快、不彻底。" 在 Hacker News 上,用户 cube00 则在 Thariq 的回复下提出更根本的问题:"为什么在付费用户不知情、也没有退出选项的情况下测试,被认为是可接受的?"
官方评测与用户体感之间的缺口
两边的说法在一个事实上没有分歧:确实有一个改变数值映射的服务端实验正在运行。argofowl 称之为"缩小 effort 刻度",Thariq 称之为"不同的数值映射"。真正的分歧在于这个实验是否实际降低了 high 档的推理强度:官方称深度评测确认无影响,argofowl 称 high 档行为与一周前的 low 档无异。
当晚 21:36,播客主持人 ,把这个缺口说得很清楚:"让人困惑的是,Anthropic 说所选 effort 仍然生效,而用户报告了明显的行为变化,这个差距需要解释。" argofowl 的反驳发布于 20:36(UTC),在 Thariq 当晚三条回复之后。这场争议就此停在无法对账的点上:Anthropic 说 high 还是 high,argofowl 说 high 表现得像 low。
参考链接
- _