AREX Feed Article
Fable 5.1 智能指数 66 登顶,实测每任务成本却比 Fable 5 贵约 20%
第三方独立评测机构 Artificial Analysis 的实测,给 Anthropic 新模型 Fable 5.1 算出了与官方「降价」口径不同的账:在 max effort(推理投入档位)下,Fable 5.1 在其智能指数(Intelligence Index)上拿到 66 分,超过 Claude Opus 5 的 63 分与 Fable 5 的 62 分,登顶榜单。
同一套评测任务里,Fable 5.1 每任务成本为 3.76 美元,比 Fable 5 贵约 20%。AA 给出的原因是:输出 token(词元)用量大增。
官方口径是另一本账。Anthropic 于 UTC 时间 9 月 1 日 18:03(北京时间 9 月 2 日凌晨 2:03)发布 Claude Fable 5.1(全面可用)与 Claude Mythos 5.1(面向经审核的网络安全与生命科学组织的受限版本),自称「世界最先进的编码与知识工作模型」,并把缓存读取价格从每百万 token 1.00 美元降至 0.25 美元。 按 VentureBeat 转述的官方说法,缓存降价让典型负载的有效成本降约 25%,高 agentic(智能体式)负载最高降约 45%(厂商口径)。
图片说明:Anthropic @claudeai 官宣视频的预览画面「Fable 5.1」,经 Latent Space AINews 页面转存。
HLE 59.1%,部分 agentic 评测与 Opus 5 打平
这批数据的底稿来自 Artificial Analysis 账号 @ArtificialAnlys 的评测,经 Latent Space 旗下 AINews 通讯(9 月 2 日发布)汇总:榜单上排在 Fable 5.1、Opus 5 与 Fable 5 之后的,是 GPT-5.6 Sol(max)与 Grok 4.6(high),同为 61 分;HLE 得分 59.1%,此前 AA 榜单的最佳是 Fable 5 的 55.5%。
AA 同时给了一条限定:在部分 agentic 知识工作评测上,Fable 5.1 与 Opus 5 实际打平,并非明显占优。作为对照,Anthropic 发布时的官方基准表(下图)把 Fable 5.1 与 Fable 5、Opus 5、GPT-5.6 Sol 并列:Terminal-Bench-Science 0.1 为 52.6%(Fable 5 为 24.7%),Terminal-Bench 4.0 为 55.8%(Fable 5 为 42.0%)。VentureBeat 标注这些是厂商自报结果。
图片说明:Anthropic 官方发布的 Fable 5.1 基准对比表,经 Latent Space AINews 页面转存。
省下的 1.40 美元,抵不过输出 token 的涨幅
两份口径的差异在计量对象:官方口径估的是缓存占比高时的有效成本,AA 的「贵 20%」按任务实际支出计量,把输出 token 的膨胀一并算入。AA 的拆分是:缓存降价在每个任务上省约 1.40 美元,而 Fable 5.1 的输出 token 用量约为 Fable 5 的 1.7 倍,多出的输出成本盖过了这笔节省。
AA 的数据还给了两组对照:Fable 5.1 在 xhigh effort 档下智能指数仍有 65 分,每任务成本 2.72 美元;Opus 5(max)指数 63 分,每任务 2.34 美元。同样按任务算,Fable 5.1(max)的 3.76 美元是三者里最贵的。
VentureBeat 引用 Financial Times 的支付数据,给出了企业侧背景:Fable 5 发布两个多月后,在 Ramp 覆盖的约 70,000 家公司里只占 Anthropic 模型支出的约 11%,更便宜的 Opus 5 与 Opus 4.8 拿走了份额。VentureBeat 判断,agentic 工作流的模型选型正越来越取决于「每完成一个任务的实际成本」。
官宣 26 分钟后,OpenRouter 上线 Fable 5.1
分发侧的动作几乎与官宣同步:UTC 时间 9 月 1 日 18:29,即 Anthropic 官宣 26 分钟后,模型 API 平台 OpenRouter 宣布 Claude Fable 5.1 已上线, 称它是「Fable 5 工作负载的直接升级」,增益最大的领域是 agentic 编码、长时工作流、视觉代码生成、金融与分析。公告中的价格与 Anthropic 官宣一致:每百万 token 输入 10 美元、输出 50 美元,缓存读取按 0.25 美元的新价执行。
缓存读取价对 OpenRouter 用户的价值,取决于任务里缓存读取的占比,这正是 AA 测算里被输出 token 膨胀抵消的部分。AINews 给这期综述起的标题,把官方价格表与第三方实测并列成了同一句话:缓存价降 75%,输出 token 多 70%。
约 4% 输出 token 走了降级路由
AA 的评测还有一个影响榜单解读的细节:评测走 Anthropic 默认的服务端降级路由(fallback),被安全机制标记的请求被转给 Claude Opus 4.8 或 Opus 5,这类输出约占智能指数评测全部输出 token 的 4%,即榜单上约 4% 的输出并非 Fable 5.1 自己生成,「跑出分数的到底是哪个模型」不再简单。
官方一侧的口径(VentureBeat 转述)是:两个名字指向同一个底层模型,Fable 5.1 带生产安全防护,Mythos 5.1 面向经审核组织放开部分通常受限的能力。
社区在此基础上继续追问机制:@eliebakouch 称两者「完全是相同的权重」(“EXACT same weights”),他描述的流程包含内部激活分类、危险请求升级到更大分类器、必要时转给 Opus 4.8;@nrehiew_ 认为差异「很可能只是安全分类器的阈值」。AINews 把这些归入「可能成立但尚未完全证实」,并指出 Artificial Analysis 证实了评测中的降级路由行为,却没有直接证实「同权重」一说。
这套「同权重、不同安全策略」的理解如果成立,官方基准表里 Fable 与 Mythos 的分栏就只是同一模型在不同安全路径下的成绩;按 AINews 的梳理,企业以为在两个模型之间做选择,实际可能是在同一模型的两种策略之间做选择。
参考链接
- _