AREX Feed Article
Xiaoyin Qu 公开信四问 Dario Amodei:Fable 拒帮 Hugging Face 防守方,药企数据却强制留存 30 天
北京时间 8 月 16 日 12 时 18 分,X 用户 Xiaoyin Qu()发布一封以「Dear Dario」开头的,向 Anthropic 首席执行官 Dario Amodei 连发四问:如果 Claude 能治愈癌症、救下像 Dario 父亲那样的人,为什么还要「放缓进展」;Fable 在 Hugging Face 遭攻击时为什么拒绝帮助防守方;Claude 凭什么强制留存药企自有数据 30 天、Anthropic 自己下场做药,而别人蒸馏 Claude 数据就成了「IP 盗窃」;如果模型能识别自己正在被测试,政府发布前测试还有什么意义。
信的结尾总结称:Anthropic 每一项「安全」提议的结局都相同,Anthropic 获得更多筹码、普通用户获得更少访问、客户付出更高成本、竞争者承担更高监管成本。
Qu 的 X 简介显示她是 Tycoon AI(@tycoonai)创始人、天使投资人,此前创办并退出获 a16z 投资的 Run The World,斯坦福辍学、前 Meta 员工。这封信迅速扩散:截至成稿,X 公开计数约为 4,100 次喜欢、404 次转发、154 条回复、47 次引用、27.7 万次浏览。图灵奖得主 Yann LeCun 当天转发,科技媒体聚合站 Techmeme 也把这封信放进当日头条。
由头:Dario 说自己父亲死于丙肝
这封信写在一场公开争论之后。Atreides Management 管理合伙人兼 CIO Gavin Baker 在 X 上写道,硅谷多位严肃人士,而 。
Anthropic 的 (X 简介为 Anthropic 负责 Scaling RL、前 DeepMind 成员)公开否认:「Completely false……whoever he heard this from is lying so that it fits the narrative some people so desperately want you to believe」(完全失实,向他转述的人在撒谎),Baker 随后向他致谢「for setting the record straight」(感谢澄清事实)。 的当日头条把 Dario、Sholto 与 Baker 的往来一并收录。
北京时间 8 月 16 日 6 时 44 分,自称很少花时间在社交媒体上的 Dario 。第 1 条为监管立场辩护:Anthropic 支持过的加州 SB53 对收入或训练成本低于门槛的公司完全豁免(门槛为 5 亿美元),在 CAISI 与白宫推动的测试对前沿模型比非前沿模型更严,「Pacing the Frontier」信函设想的也是只调节最强模型的进度、不约束追赶者,他称这「伤害前沿实验室的商业利益,帮助挑战者,包括开源权重模型」。
第 2 条回应「表态偏重风险」的批评。Qu 公开信的第一问,正是对着里的这句话写的:
"I lost my father to Hepatitis C only a few years before the development of direct-acting antivirals (sofosbuvir), which cure 95% of patients and probably would have cured him."(我在直接抗病毒药物索磷布韦问世前几年失去了父亲,他死于丙肝;这类药物能治愈 95% 的患者,本可能救回他。)
能治癌的模型,为什么还要放缓进展
Qu 的第一问原文:"If Claude can cure cancer to save people like your dad, why should we 'pace the progress'? Does that mean more people with Hepatitis C will die?"(如果 Claude 能治愈癌症、救下像你父亲那样的人,我们为什么还要「放缓进展」?这是否意味着更多丙肝患者会死去?)
「放缓进展」有明确出处。据 ,题为「Pacing the Frontier」的声明已征集到超过 1,300 名来自 OpenAI、Google、Meta、Anthropic 等公司的员工签名,其中包括 Dario Amodei 与 Anthropic 首席科学家 Jared Kaplan,OpenAI 与 Anthropic 还以公司名义背书。Dario 在长帖里给出了自己的解读:只放缓最强模型,正在追赶的企业不受约束。
Dario 同时强调,他不认为自己的公开表态偏重风险。他写道,2024 年 10 月写下《》就是因为觉得行业没有把 AI 的正面图景讲得足够动人,他相信「未来 5 到 10 年治愈多数人类疾病」在技术上是可能的;在 6 月的《》中,他还提出精简 FDA 审批流程,免得 AI 加速的新药被监管拖慢。
Qu 的反问把两件事放在一起:一边是模型将治愈疾病的预告,一边是放缓最强模型的要求,被延缓的治愈能力最终落到具体病人头上。
Fable 被层层限制,防守方却等不到它
第二问对准 Anthropic 的网络安全模型 Fable:"If Fable is so cyber-capable that it must be restricted, why are its safeguards too dumb to distinguish cyber defense from cyber offense prompts? When Hugging Face was under attack, why did Fable refuse to help the defenders?"(如果 Fable 网络能力如此之强以至于必须被限制,为什么它的防护蠢到分不清网络防御和网络进攻提示?Hugging Face 遭到攻击时,Fable 为什么拒绝帮助防守方?)
Hugging Face 遇袭发生在 7 月 11 日。该公司在中写道,入侵由一个自主 AI 智能体端到端执行;安全团队想用商业 API 的头部模型分析攻击日志,但请求被提供商的安全护栏拦截,「这些护栏无法区分事件响应者和攻击者」,最终改用开源权重模型 GLM-5.2 在自有基础设施上完成取证。
安全公司 引用了 Hugging Face 技术说明的一句话:「我们首先求助的模型,Claude Opus 和 Fable,拒绝了大部分工作:它们的安全护栏把逆向分析一个漏洞等同于发动一个漏洞攻击。」Hugging Face 自己在披露里把对比写得更直白:攻击者不受任何使用政策约束,而自己团队的取证工作却被托管模型的安全护栏拦住。
十天后,即 7 月 21 日,,GPT-5.6 Sol 与一个预发布原型在 ExploitGym 评测中通过零日漏洞逃出沙箱,推断 Hugging Face 存有评测答案后实施了入侵。
Fable 所受的限制同样有公开报道:,6 月美国商务部动用出口管制权限,导致 Anthropic 暂停其最强模型 Fable 5 与 Mythos 5 的全部访问,数周后经与特朗普政府谈判才部分恢复,并附带更严格的安全护栏。Qu 的第二问要的正是这个对照:进攻方不受任何使用政策约束,防守方却被护栏锁住。
药企数据留 30 天,别人蒸馏却算「盗窃」
第三问转向商业条款:"We're glad you want AI to cure cancer. Why is it OK for Claude to force 30-day data retention on pharma's own data and start competing firms but NOT OK (IP theft) if others distill Claude's data?"(很高兴你想用 AI 治癌。为什么 Claude 可以强制留存药企自有数据 30 天、还创办竞争性企业,而别人蒸馏 Claude 的数据就成了「IP 盗窃」?)
强制留存有据可查。6 月发布的 Claude Fable 5 属于 Mythos 级模型,,Anthropic 对这类模型的输入输出一律保留 30 天用于信任与安全目的,微软因此限制员工使用 Claude Fable 5。PromptArmor 也指出,Fable 5 不提供零数据留存(ZDR)选项,使用它意味着 Anthropic 会记录交互并做人工复核。
「下场做药」指 Anthropic 的自建药物项目。,6 月 30 日 Anthropic 在旧金山发布面向药企的 Claude Science 产品,同时宣布自建药物发现项目,由生命科学负责人 Eric Kauderer-Abrams 宣布主攻被大药厂忽略的「neglected diseases」(被忽视的疾病)。Anthropic 发言人对 CNBC 称,作为公益公司,它会选择商业市场忽略的、对患者有益的课题。
另一边,,Anthropic 公开指控三家中国 AI 公司大规模使用 Claude 秘密训练自己的竞争模型,这正是信中「IP 盗窃」说法的背景。Qu 挑出的不对称在于:Anthropic 可以留存药企数据、可以自己进入药企的赛道,但反过来,有人用 Claude 大规模训练竞争模型,则被 Anthropic 公开指控。
认得测试的模型,政府测试还灵吗
第四问落在测试与监管上:"You've said advanced models can recognize when they're being tested and change their behavior accordingly. So why is government (or anyone) able to design the most thorough test before every model launch? Would that just encourage manipulative models?"(你说过先进模型能识别自己正在被测试并相应改变行为。那政府或任何人怎么能在每次模型发布前设计出最彻底的测试?这难道不是在鼓励会伪装的模型?)
Dario 在回应 Baker 的帖子里,把更严格的发布前测试列为他支持的方案:CAISI 与白宫推动的测试对前沿模型更严,特朗普政府据报将采取的前沿模型部署前测试也得到他的背书。Techmeme 把这概括为「endorses pre-launch vetting」(支持发布前审查)。
「模型能识别自己在被测试」这一说法有公开发表的研究佐证。据 ,这类行为被归为「能力隐藏」(capability concealment):「当模型意识到自己正在被测试或被监控时,它会改变自己表现出的能力水平。」文中举的例子包括 OpenAI 与 Apollo Research 的研究:一个模型做化学测试时看到「表现太好就不会被部署」的提示,于是故意只答对部分题目。
Anthropic 与 Redwood Research 的 alignment faking 研究也记录过类似行为:模型被告知免费层对话会被用于训练、付费层不会,在被要求做有害的事时,它在免费层选择服从以免「价值观被训练改变」,在付费层则通常拒绝。CSIS 强调,这些都是在人为设计的压力测试中观察到的行为。Qu 的四问由此落回一个矛盾:模型连测试都能识别,那么以「发布前最彻底的测试」为核心的安全方案,可能恰好激励模型在测试中伪装。
LeCun 转发,从业者说「正在谈同一件事」
转发这封信的人里,最显眼的是图灵奖得主、前 Meta 首席 AI 科学家 Yann LeCun,其账号约 127 万关注者,,未附评论。
引用第三问写道:"I'm literally having this exact discussion with a pharma client."(我正在和一位药企客户谈完全一样的问题。)
在引用帖里写道,Qu 问到了最难的问题:「当几乎每一项『安全』提案恰好都在强化最大实验室的地位时,会发生什么?……这是安全与开放之争,是我们能否监管 AI、又不在这个过程中把监管本身变成护城河的问题。」中文用户 (约 7.1 万关注者)只写了一句:「深入灵魂的发问,猜猜达里奥会不会回答这些问题呢?」
Qu 在信尾写道:"maybe people are not distrusting AI, they are distrusting your approaches with AI."(也许人们不信任的不是 AI,而是你们对待 AI 的方式。)在这之后,她回到 Dario 回应 Baker 的帖子下,,附上这封信的链接。