AREX Feed Article
Anthropic 发布 Fable 5.1 与 Mythos 5.1,Cursor 同日上线
美东时间 9 月 1 日下午(北京时间 9 月 2 日凌晨),Anthropic 官方 X 账号 宣布推出 Claude Fable 5.1 与 Claude Mythos 5.1,自称「世界最先进的编码与知识工作模型」。官方基准口径下,Fable 5.1 在 Terminal-Bench-Science 0.1 得分 52.6%,是 Fable 5 的两倍以上;在 Terminal-Bench 4.0 得分 55.8%,Fable 5 为 42.0%;缓存读取价格下调 75%。同日上线,给出完整基准表、定价与安全细节。
Fable 5.1 与 Mythos 5.1 是同一个底层模型,只是防护等级不同。Fable 5.1 即日起全面可用;Mythos 5.1(面向网络防御者与生命科学家)只经受信访问计划提供。Anthropic 同步推出面向企业客户的 Enterprise Frontier Safeguards(EFS),宣称提供与零数据留存同等的隐私,秋季起分阶段上线。同一天,Cursor 官方账号 宣布 Fable 5.1 已在 Cursor 中可用,称这是其在 CursorBench 3.2 上运行过的最强模型,max effort 下得分 73.4%。以上数字均出自 Anthropic 与 Cursor 的官方公告。
Mythos 5.1 与 Fable 5.1 同源,只走受信通道
Fable 5.1 即日在所有平台可用,包括 Amazon Web Services、Google Cloud 与 Microsoft Azure,开发者可通过 Claude API 的 claude-fable-5-1 模型接入。
Mythos 5.1 走两条受信通道。Cyber Verification Program(CVP)面向防御性网络安全工作,Anthropic 称该计划近期才会纳入 Mythos 类模型;Life Sciences Verification Program(LSVP)与美国政府合作开发,已招收首批参与者,计划向更广的生命科学界开放。
目前 Mythos 5.1 仅对部分美国组织可用,Anthropic 正与美国政府协调扩大范围。代码漏洞扫描产品 Claude Security 也已改用 Mythos 5.1 驱动。
Mythos 5.1 用开源蛋白设计与折叠工具设计结合剂,在 EGFR、Nipah G、15-PGDH 三个靶点上的结合亲和力比 Adaptyv Bio 蛋白设计竞赛的最佳提交高 10 倍。
12 个靶点的整体命中率接近 50%,而蛋白设计领域目前的典型命中率只有 10%~15%,设计样本送交两个外部机构做了实验验证。
其他科学任务包括:基于 NASA Magellan 任务 30 多年前的雷达影像训练神经网络,生成金星三分之一表面的新高程图,分辨率从 10~20 公里细化到 2~3 公里,高程精度最高提升 25%。
这张图以 Creative Commons 协议发布,供 NASA VERITAS 与 ESA EnVision 任务参考。
模型还为七个开源深度学习模型编写 GPU kernel,把推理速度最高提升 2.5 倍且输出完全一致;Anthropic 估算基因组规模分析可省 30%~60% 的 GPU 成本,并称优化代码将开源。
基准全线刷新,低 effort 档还更便宜
Anthropic 给出的核心对比数字:Terminal-Bench-Science 0.1 上 Fable 5.1 得 52.6%,Anthropic 复测的 Fable 5 为 24.7%(该基准公开榜单为 21.4%);Terminal-Bench 4.0 上 Fable 5.1 为 55.8%(Fable 5 为 42.0%),防护更宽松的 Mythos 5.1 达到 60.9%。
知识工作基准 GDPval-AA v2 从 1,723 分升至 1,853 分;Humanity's Last Exam 无工具 60.9%、带工具 65.0%;AutomationBench 从 17.1% 升至 31.4%。
Fable 5.1 设 Low、Medium、High、xhigh、max 等 effort 档位,在 Claude Code 默认 High,在 Claude Cowork 与 Claude.ai 默认 Medium。Anthropic 称,调到 Low 或 Medium 时,能以低得多的成本取得与 Fable 5 相近或更好的结果。
基准图表的注脚交代了测量口径:评估都在生产防护开启下进行,防护介入的任务记 0 分(OSWorld 2.0 与 AutomationBench 上均有出现),Anthropic 承认这可能压低了模型分数。
缓存读取降到 0.25 美元,典型负载省约 25%
Fable 5.1 的输入输出定价与 Fable 5 相同:每百万输入 token 10 美元、输出 50 美元。降价只发生在缓存读取(cache reads,模型读取已处理并存储的输入)上:每百万 token 0.25 美元,比 Fable 5 低 75%。
Anthropic 用 2026 年 8 月四周的实际用量做了指数化对比(Fable 5 = 100):典型负载下 Fable 5.1 为 75,即成本降约 25%;高 agentic 负载为 55,即最高降约 45%。典型负载口径覆盖 Claude Enterprise、Claude Code 与 API。
Cognition 联合创始人兼 CPO Walden Yan 称,团队会在发布当天就把 Devin 里的 Opus 5 流量迁到 Fable 5.1,「新缓存读取定价让 Fable 级模型终于在我们原本留在 Opus 上的负载上变得经济,先从代码审查开始」。
Every 创始人兼 CEO Dan Shipper 的概括是「Fable 级智能、Opus 级价格、Sonnet 级速度」,称测试中 Fable 5.1 约为 Opus 5 的两倍速度、一半 token。
Cursor 同日上线,称其尤其擅长验证自身工作
Cursor 的公告与 Anthropic 的发布几乎同时落地:Claude Fable 5.1 现已在 Cursor 中可用。
Anthropic 博客的基准表中,CursorBench 3.2.0 一栏同样给出 73.4%(Fable 5 为 70.5%、Opus 5 为 70.0%),与 Cursor 公布的数字一致。
Cursor 称 Fable 5.1「尤其擅长验证自身工作(verifying its own work)」,能够从零到一承担困难编码任务。
Anthropic 博客里 Millennium 的测试案例与此对应:投资公司 Millennium 内部系统有一个约百万分之一概率触发的罕见崩溃,团队工程师与其他模型多年未能解释;Fable 5.1 反汇编了外部供应商库、与 core dump 对照,把崩溃定位到该库的一个 bug。
Jane Street 量化研究主管 Craig Falls 的评价是,Fable 5.1 在内部基准中解决的编码问题比 Fable 5 与 Opus 5 都多,且「长时间、多步骤任务中仍保持可读」。
EFS 把数据留在客户云上,防护误标率降 60%
与模型一同发布的是 Enterprise Frontier Safeguards(EFS)。机制上,EFS 把客户数据存放在客户自己控制的云基础设施上,而非 Anthropic 的系统;任何人工审查默认由客户自己完成。Anthropic 称这与零数据留存协议提供同等隐私,同时保持业界领先的对抗性滥用防护。
EFS 与 100 多家客户(覆盖金融、医疗、制造、电信、法律、零售与公共部门)及 AWS、Google Cloud、Azure 合作开发,将支持 Claude Code、Claude Enterprise、Claude Platform、Amazon Bedrock 与 Microsoft Foundry 等平台。
EFS 秋季起分阶段推出;在 EFS 就绪前,合格客户可先用零数据留存模式使用 Fable 5.1 与 Fable 5。
防护本身也在收紧精度。网络安全方面,Anthropic 称最新防护对良性请求的误标率降低约 60%,具体口径是 Claude Code 用户每会话来自网络防护的干预平均减少约 60%。
同时 Fable 5.1 现在被允许用于发现软件漏洞,但不允许开发漏洞利用;渗透测试、漏洞利用生成、二进制漏洞扫描等双用途任务仍会转给 Opus 模型。
生物学方面,基础生物学与医学问题的良性请求 fallback 率较 Fable 5 上线时降低约 85%,但生命科学研发类问题仍转向 Opus。这次「解禁」止步于漏洞发现与基础问答:渗透测试、漏洞利用生成与生命科学研发等能力,仍留在 Opus 模型与 Mythos 的受信通道里。