AREX Feed Article
Anthropic 称 Claude 为 30 多个开源生物分子模型优化推理:平均提速约 4 倍,全部优化代码已开源
Anthropic 在 9 月 17 日通过官方 X 账号宣布,Claude 为 30 多个开源生物分子模型完成了推理优化:平均提速约 4 倍,其中一部分加速来自 Claude 为 GPU 编写的定制软件;该公司同时开源了全部优化代码()。帖文给出的背景是,生物学家用专门的开源模型做分子系统结构建模、类药物分子设计与基因突变效应预测,但这些模型运行成本往往很高,可能限制它们的影响面。配套的 与给出了更详细的结果与数据。
按这份标注日期为 2026 年 9 月 17 日的报告,Claude 在不到四周内为这些模型产出 36 个工具包,横跨共折叠与结构预测、蛋白质与序列设计、基因组学、蛋白质语言模型。结构预测模型上,允许小幅数值取舍的 Fast 模式平均提速 4.1 倍,输出与原模型逐位一致的 Exact 模式平均提速 1.6 倍。以下性能与准确性数字均来自 Anthropic 自己公布的测试结果。
六类工具包与四种运行模式
优化代码在 里发布,一个上游工具对应一个包(kit),分六类:共折叠与结构预测(14)、hallucination(幻觉式生成,3)、结构生成(6)、逆折叠(3)、基因组学(7)、蛋白质语言模型(3)。每个包沿用原模型权重,按模式启用:Off 保持原样,Exact 输出与原版逐位一致,Fast 允许小幅数值差异、换取速度,Big 压低峰值显存、容纳更大的输入;对使用者来说,调用上游工具的命令不变。
速度因模式而异:Fast 在 13 个结构预测模型上平均 4.1 倍,从 OpenDDE 的 2.3 倍到 Chai-1 的 6.4 倍;Exact 在 14 个模型上平均 1.6 倍;Big 平均 3.4 倍;基因组学与蛋白质语言模型的 Exact 模式提速为 1.2~5.0 倍。速度对比的基线是报告定义的 default:熟悉硬件的人在同一块 GPU 上能跑出的最快正确配置,例如启用模型自带的融合内核、用吃满 GPU 的 batch size(单次处理的输入批量)。
报告提到,更早一批结果里,Claude Mythos 5.1 曾用定制 GPU 内核和中间结果缓存,为 7 个开源生物学模型带来最高 2.5 倍提速,且输出一致。
为 GPU 写内核:FlashPairformer
结构预测模型把大量时间与显存花在三角注意力(triangle attention)和三角乘法(triangle multiplication)上。这两项运算作用于 token 三元组,开销是立方级的:体系规模翻倍,时间和显存要涨到 8 倍。Claude 为此写出了 FlashPairformer v1,一组定制 GPU 内核。报告称,在 AlphaFold3 与 Boltz-2 使用的 pair width(配对表示宽度)128 下,三角注意力比领域标准内核(NVIDIA 的 cuEquivariance)平均快 2.7 倍,三角乘法快 1.7 倍;在 Protenix v2 使用的 pair width 256 下,两项分别是 2.9 倍与 3.2 倍。这些数字是单个 H100 上、256~2,048 个 token(1 个 token 对应一个氨基酸、核苷酸或小分子与离子的原子)共七档输入规模的几何平均,且每一档都快于对照。
报告称,能跨模型复用的内核只解释了一部分收益;Claude 还为每个模型单独做了优化:缓存被重复计算的中间结果、把恒为同一结果的分支折叠成常量、把 GPU 操作录制成 CUDA graph 复用、把小算子融合成大内核、减少 host(主机)与 GPU 之间的数据搬运、把数据加载与结果写出改成异步。这类工作通常需要一支有经验的工程团队为每个模型花上数周,而且往往不能在模型之间迁移;这次由 Claude 完成这些优化,监督者主要是两位 Anthropic 技术成员——他们有生物分子建模经验,此前没有推理优化或内核工程经验。
1,925 组配对上的准确性核对
报告用自建的 FoldBench-Lite 基准核对准确性:界面用 DockQ(界面质量评分)打分,0.23 以上算可接受。汇总 13 个模型配置、1,925 组模型–靶标配对,可接受界面的占比为 default 54.8%、Exact 55.0%、Fast 54.5%、Big 54.2%;三个模式相对 default 的汇总变化,其 95% 置信区间都没有排除零。逐模型比较中,只有 ESMFold2 的 Exact 模式的 95% 置信区间排除了零(+4.6 个百分点)。另有六个置信区间恰好以零为边界,其中包括四个最大跌幅中的三个(2.2~3.5 个百分点),例如 RoseTTAFold3 的 Big 模式下降了 3.5 个百分点,95% 置信区间 -7.7 到 0.0。报告据此写道,无法排除小幅的性能损失。
报告同时列出若干限制:所有速度与显存数字测自 H100 与特定输入规模、上游版本,换到别处可能不同;Exact 与 Fast 的显存占用可能高于 default,最高到 3.2 倍;部分检查未通过,细节在补充材料里;ColabFold 的提速针对 1.6.1 版本,后续版本自带融合内核,未纳入基准。报告在「AI 工具使用」一节写明:优化工作与数据分析由 Claude 完成,报告初稿也由它在人类监督下起草;致谢感谢苏黎世大学的 Martin Pacesa、哥伦比亚大学的 Mohammed AlQuraishi 与 Christina Floristean、Biohub 的 Roshan Rao 与 Zeming Lin 在发布前参与讨论并审阅了部分内容。
Big 模式:单节点上的大型分子机器
除了更快,Claude 还被要求压缩大分子机器建模的显存占用。Big 模式让单个 8 卡 GPU 节点能准确预测 10,000 token 以上的体系。报告给出的例子包括:人类线粒体复合体 I(10,761 个 token,TM 分数 0.95,171/172 个界面可接受)、大肠杆菌 70S 核糖体(10,439 个 token,TM 0.97,97/99)和磷酸酮醇酶(10,248 个 token,TM 0.99,24/24);其中有六个准确预测的体系超过 10,000 token,TM 分数(与实验结构的接近程度)在 0.92~0.997 之间。作为对比,AlphaFold3 论文重点展示过的人类 40S 核糖体亚基为 7,663 个残基。
报告还记录了一次极限测试:用单个 8 卡 B300 节点,对 31,000~70,000 个残基的完整病毒衣壳与蛋白壳做推理;七个预测全部跑完,但没有一个准确,能打分的三个 TM 分数只有 0.08~0.14,预测塌缩成互相穿插的致密球体。报告假设这是泛化失败:这些体系的规模是 AlphaFold3 最大训练裁剪(768 token)的 40~90 倍。报告对此的表述是:Big 模式扩展的是可计算的范围,模型学会的能力并没有被扩展。
设计成本:从每靶标最高 1 万美元到约 150 美元
优化后的模型也被用于蛋白质结合体设计。Anthropic 此前的蛋白质结合体设计工作里,Claude 可以调用子智能体,用约 16,000 词的提示词,每个靶标最多花 10,000 美元、约合 2,500 个 H100 GPU 小时;这次换成一个 Claude 模型、一张 H200、限时 24 小时、约 1,100 词的提示词,没有子智能体,也没有人工干预设计。报告称,三个 Claude 模型(Opus 5、Mythos 5.1、Mythos 5)对 16 个靶标各跑五次,按 ipSAE(一种被证明能预测实验结合结果的计算机打分)衡量,中位得分与最高得分接近或超过此前预算高约 100 倍的 16 轮单靶标设计,三者的中位得分分别为 0.785、0.781、0.739。在逐小时记录里,Opus 5 用 12 小时、约 117~136 美元的 GPU 加 token 花费,Mythos 5.1 用 13 小时、约 157~196 美元,就达到了此前 16 轮项目的 0.749 中位得分;博客给出的整体数字是,约 150 美元的 GPU 与 token 组合花费即可达到此前方案的计算机打分水平。
报告说明这些设计还没有经过湿实验检验,结论只到计算机打分;报告也无法把提速模型与更简化流程各自的贡献分开,token 花费按 API 列表价估算。
开源的仓库与 Adaptyv Bio 的湿实验竞赛
代码已经公开:仓库以 Apache 2.0 许可发布这些工具包(上游项目代码沿用各自许可),每个包与一份锁定版本的上游代码放在一起,按模式挂载优化。仓库注明这是一次性参考发布:不再维护、不接受贡献,预构建的 Docker 与 Apptainer 镜像计划在首发后一周内提供。
与代码配套的是验证渠道。Anthropic 与 Adaptyv Bio 联合发起,五个赛题在 9 月 28 日到 10 月 31 日之间每周公布一个,涉及种属交叉反应性、pH 敏感性、肽–MHC 特异性,以及 GPCR 这类难靶点。Anthropic 在博客中承诺最高 100 万美元的 Claude 额度与最多 25 万美元的 Modal 算力额度,Twist Bioscience 提供 DNA;竞赛页面写明,Adaptyv 的自动化实验室将合成并表征 5,000 个以上蛋白质设计,申请 Claude 支持的通道开放至 9 月 24 日。
竞赛页面上的计划表显示,被选中的参赛设计将在 11 月 30 日前完成合成与实验测试,12 月 15 日实验数据(含阴性结果)在 Proteinbase 公开;页面注明该日程可能调整。