AREX Feed Article
Anthropic 把 Fable 5 生物误拒砍掉 85%,同时自曝模型可为恶意行为者提供"显著助力"
2026 年 8 月 7 日,Anthropic 已优化 Claude Fable 5 的生物学安全分类器,将各产品界面上生物学相关的误拒(fallback)减少了约 85%。
这意味着用户在日常健康和生物学教育问题上被降级到次等模型的概率大幅降低。
同一篇公告里,Anthropic 也确认:能力评估显示 Fable 5 "可能为恶意生物行为者提供显著助力"。这一判断构成了整套安全机制的存在理由。
"问一句血检报告也要被降级,Fable 5 终于不这么紧张了"
Fable 5 的生物学分类器更新触及了一个自模型上线以来持续引发用户不满的问题:当你问一个完全无害的生物学问题——比如帮忙解读体检报告上的胆固醇指标——系统可能会悄无声息地把你的请求切换到能力更弱的 Opus 5,而你得到的答案自然也更薄。
Anthropic 自己的测试数据显示,此次更新将这类生物学相关误拒削减了约 85%。换算到不同产品界面上,总回退率(含生物学及其他所有回退原因)的变化差异显著:Claude.ai 降低约 67%,Cowork 降低约 55%,Claude Code 降低约 17%,而 Claude Platform(API)仅降低约 7%。这说明消费者端对话中日常健康问题占比远高于 API 端——API 用户本身触碰生物学话题的频率就低,改善空间自然有限。
Anthropic 明确列出了此次放开的合法使用场景:解读实验室检测结果、理解症状、生物学教育,以及医护人员获得更多临床支持。在此之前,这些请求都在不同程度上被过宽的分类器拦截。
用户不买账:厨房清洁剂仍然触发生物学警戒
尽管 85% 这个数字看起来可观,公告发布后几小时内,X 平台上的用户反应并不买账。多数抱怨与生物学分类器本身关系不大,而是指向更深层的积怨。
在 Claude 官方账号的下,点赞最多的一条回复来自用户 @ankurdotai,直指 Max 订阅计划中 Fable 5 仅能使用 50% 限额的问题:"是时候把 Fable 在 Max 计划中的 50% 限制取消了。"另一位用户 @fluorinespark 则用调侃点出核心荒谬感:"太好了,我终于可以问冰箱里放了两周的豆腐还能不能吃,而 Claude 不会怀疑我在造生物武器了。"
也有用户反映更新后的分类器仍然存在奇怪误判。@Mike40213265 写道:"问怎么用小苏打和白醋清洁咖啡渍,瞬间被切到 Opus 5。厨房清洁仍然算生物学威胁?85% 这个数字感觉只是内部测试好看。"@RyvenDriving 则晒出截图,Fable 5 拒绝回答如何清洁红色黏土的问题。
此外,大量回复将矛头指向了回退目标模型 Opus 5 本身的质量问题。多位付费用户形容 Opus 5"几乎不可用","出错太多",与 Fable 5 的能力差距让被降级后的体验落差格外刺眼。
一开始就"神经质",是 Anthropic 故意为之
Fable 5 的生物学分类器之所以一开始这么宽,不是设计缺陷,而是 Anthropic 在产品发布与安全保障之间做出的主动权衡。
Fable 5 上线时,Anthropic 故意让生物学分类器几乎拦截了所有相关请求。Anthropic 在公告中解释称,当时他们面临一个选择:要么推迟发布数周甚至数月,等到安全机制足够精确;要么先上线,接受短期内误拒率偏高的代价,再逐步迭代分类器。他们选了后者。
Anthropic 称,如果等到安全措施更完善再发布,将"延迟模型的大众访问,以及它能为用户带来的潜在收益数周或数月"。Anthropic 的判断是:在生物学这类双重用途领域,一次漏判(让危险请求通过)的代价远高于一次误判(拒绝无害请求)。
这个判断并非凭空而来。公告引用了美国情报界 2026 年度威胁评估报告,其中指出合成生物学和基因编辑等生物技术进展"可能导致新型生物威胁",多个国家行为体"很可能维持活跃的进攻性生物和化学武器项目"。这些项目可能因接触前沿 AI 模型而加速。
重写一本规则书,生物误拒就少了 85%
分类器的核心是一套被称为"宪法"的规则集合,用来教模型区分"需要拦截的"和"可以放行"的内容。Anthropic 花了几周时间重写这套规则,为良性使用场景逐一增补了详细的例外条款。
具体流程是:重写宪法 → 征集内外部专家反馈 → 基于新宪法构建训练数据 → 重新训练分类器 → 验证新分类器仍能拦截有害和双重用途内容,同时放行更多良性请求。
这不是关键词过滤。分类器是一个独立的小型 AI 系统,会同时扫描用户输入和模型即将输出的内容。一旦触发,用户的请求会在后台被重新路由到 Opus 5——一个 Anthropic 称"不具备同样水平生物学能力"的模型。用户会收到模型切换提示,但得到的回答来自能力更弱的那一个。
Anthropic 在公告中提供了一张概念图,将内容沿风险谱分为四个区域:明确有害(红色,始终拦截)、双重用途(橙色,默认拦截——涵盖病毒学、毒理学、分子设计)、安全边际(浅绿色,几乎肯定无害但因谨慎仍触发分类器)、明确安全(深绿色,直接由 Fable 5 回答)。此次更新做的是将分类器边界向右移动,让更多安全边际区的内容通过,同时保持对红色和橙色区域的拦截。
双重用途的三个核心禁区——病毒学、毒理学和分子设计——在此次更新中无一放开。Anthropic 用两个例子解释了为什么这条线难画:活疫苗需要培养它要预防的病原体本身;降压药卡托普利(captopril)的研发始于从蛇毒中分离能压垮人体血压的有毒成分。合法研究本身就涉及危险物质的操作,这让"意图判断"变得极难自动化。
承认模型能助攻生物武器,才是这场更新的真正背景
Anthropic 在公告中写了一句不太像公关稿的话:Fable 5 的能力评估显示,它"可能为恶意生物行为者提供显著助力——即提供他们在别处无法获得的能力。"
这不是随口一提的风险提示。这是分类器存在的根本原因。如果 Fable 5 的生物学能力不强,就不需要这么复杂的拦截机制。正因为它够强——Anthropic 称其在某些高度复杂的生物学任务上已超越人类专家,在其他任务上可提供实操层面的辅助——才需要一整套分类器来守住边界。
但同一份能力既可以是研究者的利器,也可以是恶意行为者的帮凶。Anthropic 承认,能辨别两者的分界线"通常很难划清"。老练的行为者会利用这种模糊性,将危险任务伪装成普通研究。
这种两难处境指向了此次更新未能解决的核心问题:Fable 5 目前完全根据请求内容触发分类器,而非请求者的身份。一位持有资质的病毒学家和任何一个随机用户,在问同样一个问题时,都会遭遇同样的回退。Anthropic 说正在推进"可信访问通道"来弥合这个缺口,但这只是一项承诺,没有任何时间表。
AI 对生物学的最大正面影响还在路上——但谁也不知道路有多长
Anthropic 在公告结尾写道,公司相信"AI 对世界产生最大正面影响的机会在生物学和医学领域",正为此"大量投入"来构建负责任的前沿访问路径。但眼下,Fable 5 对专业生物学研究和药物开发"仍不可用"。
85% 是一个诚实的数字。它修好的是最好修的一部分:那些从一开始就不该被拦截的日常问题。真正困难的部分——如何在不让危险能力溜出去的前提下,把前沿模型交到有资格的研究者手中——还没有答案。Anthropic 给出的只是一个承诺和一个没有截止日期的方向。