AREX Feed Article
Claude 自主从头设计蛋白结合物:14/15 靶点命中,成功率 22%–35%
Anthropic 美东时间 8 月 18 日晚(北京时间 8 月 19 日清晨)在官方 X 账号宣布:在人类专家撰写的一份蛋白设计提示词指引下,Claude 自主从头设计(de novo)蛋白结合物,15 个可测靶点命中 14 个;按设定不同,22%–35% 的设计成功结合,而该领域当前典型成功率只有 10%–15%。所有设计由 Adaptyv Bio 和 Twist Bioscience 两家外部机构独立合成并测试,部分最强设计的结合强度数倍于已发表的最佳 de novo 结合物。
Anthropic 同日发布与,并在 开源了提示词、全部 1,440 个设计的计算模型与结合数据。博客还报告了第二项实验:普遍可用的 Claude Opus 5 只凭一份合同实验室的原始文件和两句自然语言提示,完成了 NMR 与 LC-MS 分析。Anthropic 在公告里特意划出边界:蛋白结合物不是药物,设计出高亲和力结合物只是药物研发的第一步。截至本文核查时,这条推文发布数小时内已获得超过 74 万次浏览、5,300 余次点赞。
354 个结合物,出自 1,320 个设计
实验共选了 16 个靶点,包括 Adaptyv Bio 基准集 BenchBB 的全部靶点,以及 15-PGDH 和 GDF-8 两个全新靶点。选新靶点是为了确保 Claude 无法从训练数据或联网搜索中调出既有成功案例;对所有靶点,Anthropic 都要求 Claude 自查设计的新颖性。其中成熟 GDF-8 二聚体在检测条件下发生聚集、数据不可解读,最终 15 个靶点有有效测量。
按,两家合同研究机构(CRO)把每个设计按交付原样合成并测量结合:1,320 个设计中 354 个结合,命中率 27%;每个靶点每支设计臂排名第一的设计中,49% 确认结合。Anthropic 称至少在 6 个靶点上拿到了高亲和力结合物(解离常数 KD < 10 nM),至少 4 个靶点达到或超过已发表的最佳亲和力;靶点级命中率从最高的 90% 到最低的 0% 不等。
对照行业数字更能看出这次结果的量级:Anthropic 称当前蛋白设计活动的典型命中率为 10%–15%;公开语料中两个最大的 de novo 设计数据集(proteinbase.com 与 Overath 等人整理的集合)合计约 40 个靶点、5,700 个设计、约 770 个结合物,而这次实验一次贡献了 354 个。
提示词之外,所有决定都由 Claude 自己做
这次实验把人的参与压到了流程的两端。Anthropic 把一次蛋白结合物设计活动所需的领域知识写成约 16,000 词(约 30,000 tokens)的协议提示词,作为 system prompt 装入每个代理;提示词不指定任何靶点的表位、骨架、靶点构建体或序列。剩下的事——研究靶点生物学、选择结合位点、安装并运行开源设计模型、多轮 in silico 优化、打分排序、每靶点交付 30 个设计——全部由 Claude 自主完成。据 ,这份提示词由技术报告唯一署名作者、Anthropic 研究员 Amir Shanehsazzadeh 撰写。
运行发生在 Claude Science 环境里。多靶点模式下,Opus 4.8 和 Mythos Preview 用 48 小时、最多 12,500 个 NVIDIA H100 小时同时设计 14 个靶点;单靶点模式下每个会话 24 小时、每靶点最多 2,500 个 H100 小时。Claude 拥有联网、GPU 和 Google Drive/Slack/Gmail/BioRxiv 连接器,token 与子代理预算不设上限。人类只做了三件事:批准访问请求、解决基础设施问题、下单合成。
工具层面,Claude 用的全部是领域已有的开源模型:例如用 ESMFold2 与 Protenix v2 的集成打分筛选候选,该集成在 Overath 基准上区分结合物的能力超过了 AlphaFold3(macro-AP 0.66 对 0.55)。技术报告称,Claude 在每轮活动中都保留了完整的决策记录,包括选用了哪些结构设计与序列设计工具、各自按什么比例使用。
RBX1 上 40% 对 3.7%,TNFα 上换了个模型才赢
Anthropic 挑了几个能直接与公开竞赛对比的靶点。RBX1 是驱动特定调控蛋白降解的小蛋白,Adaptyv Bio 曾为它举办开放设计竞赛:245 个参赛设计中只有 9 个结合,而 Claude 的 90 个设计中 28 个结合;Mythos Preview 单靶点模式命中率 40%,参赛者平均仅 3.7%。Claude 排名第一的设计 KD 为 3.9 nM,与竞赛冠军设计(45 nM)在同一块板上重测对比。还给出一个跨物种数据点:在接受小鼠直系同源物测试的 233 个结合物中,130 个同样能结合小鼠版本。
TNFα 的案例展示了模型间的差异。多个专家组都难以对付这个靶点——多聚体结构要求在两个蛋白形成的沟槽里结合,而阻断 TNFα 是包括 Humira 在内多款重磅药物的治疗基础。这次是 Opus 4.8 而非更强的 Mythos Preview 成功,且设计了多个跨物种结合物,能同时结合人、食蟹猴和小鼠的 TNFα,这正是动物实验需要的能力。Anthropic 承认不知道为什么更强的模型在这个靶点上反而失败。
Claude 还展示了结构上的多样性:设计了 15 个含至少 20% β-折叠的结合物,分布在 6 个靶点、10 个不同骨架上。β-折叠比 α-螺旋更难设计、更易错误折叠和聚集。
失败案例同样被公开:针对 BBF-14(一个自然界不存在的、由 AI 从头设计的 β-桶蛋白),只得到 3 个亲和力一般(亚微摩尔到微摩尔)的结合物;针对麦芽糖结合蛋白(MBP),90 个设计没有一个确认结合,只有一个微弱的可重复信号。
结合物不是药:Anthropic 先划了这条线
公告在给出成绩的同时反复限定口径:设计结合物比设计药物容易,结合物不是药物,高亲和力结合只是从分子到药物的漫长链条上的第一步;即使设计出药物本身,也只是确立药物安全有效所需众多阶段中的一环。这层限定写在里,也在博客里重复出现。
Anthropic 给出的下一步是:把这次实验当作地基,训练 Claude 端到端运行所有主要药物分子类型(从抗体到小分子)的完整研发流程。
博客里的第二个实验展示了一般可用模型能做到什么:Claude Opus 5 拿到合同实验室的原始 NMR 和 LC-MS 文件后,23 分钟和 19 分钟内返回处理结果,氢原子计数与实验室结果相差 0.08 ¹H,纯度判定 96.4% 对实验室的 96.33%,而实验室的正式报告在首次采集谱图 4 天后才完成。
访问限制是另一条边界。Anthropic 称蛋白设计等双用途研究能力可能被滥用(例如用于开发生物武器),这类能力目前不对普通用户开放,在 Claude Fable 5 中被封锁;为科学家开放最强模型的访问项目是其最高优先级之一,"预计很快分享更多"。同时,Opus 5 仍是可用于生命科学研究的模型中最强的。
数据全部开源,外部评价提醒"绑定不等于药效"
Anthropic 把这次实验的可复现材料全部放上了 :协议提示词、全部 1,440 个设计的计算模型与共折叠预测、两家 CRO 的原始传感图和结合判定,失败设计、低排名候选和完整决策记录也都在其中,数据以 CC BY 4.0 许可发布。技术报告称,所有设计均按交付原样合成,两家机构的测量结果全部公开。
科技媒体 RuntimeWire 在发布当晚的肯定了开源协议的价值:实验室可以据此复现整套流程,不必自己搭建代理框架。
同时它列出几处需要冷静看待的地方:Anthropic 只测量了结合,没有测试任何设计的生物活性,也没有解析任何蛋白-靶点复合物的结构,所有结合构象仍只是计算预测;头条命中率把同一蛋白骨架的序列变体算作独立设计,按骨架统计时命中率降至 24.7%(809 个骨架中 200 个);与公开竞赛的对比也不是严格的人机对照,没有配对的人工实验,用作对比的 6 个竞赛结果中有 4 个在 Claude 设计过程中就可以访问。
RuntimeWire 的结语把边界说得很直白:"Claude 没有造出药。它证明了一个通用智能体可以跑完大部分计算蛋白设计流程,交付能在独立测试中结合的物理候选物,并把自己的工作完全摊开供人复现。剩下的结构、功能、安全与有效性验证,才是生物学不再像软件基准测试的地方。"
参考链接
- Anthropic 官方 X 账号公告推文:
- Anthropic 博客《How Claude is accelerating protein design and analytical chemistry》:
- Anthropic 技术报告《Autonomous de novo protein binder design with Claude》:
- Hugging Face 数据集 Anthropic/claude-protein-binder-design:
- RuntimeWire 报道《Anthropic says 354 Claude protein designs bound in lab tests》: