AREX Feed Article
混合物理与机器学习的DODock/DOScore登bioRxiv,CD73虚拟筛选命中率提升约100倍
泛化到新靶点的能力,才是AI药物发现的真正试金石。
8月7日,Peter Diamandis在X上转发了一篇bioRxiv预印本。这篇论文触及了AI药物发现中一个被长期回避的问题:大多数分子对接模型在熟悉的靶点上表现亮眼,一旦面对训练集中从未出现过的蛋白质和化学空间,精度就会崩塌。:"AI药物发现最大的挑战之一不是继续刷榜——而是泛化到我们从未见过的生物学面前。"
这篇来自旧金山公司Deep Origin的论文于8月3日上线bioRxiv,提出了DODock(分子对接)与DOScore(评分函数)两个框架。论文的核心主张是:将机器学习限定在它真正擅长的环节——提案与排序——而把泛化能力交给一个紧凑的、从第一性原理出发的物理模型。团队没有停留在benchmark数字上,而是将方法推进到了四项前瞻性湿实验验证中,覆盖了从紧凑酶口袋到别构蛋白-蛋白界面的难度梯度。
论文标题:Overcoming the accuracy-generalization tradeoff in docking and scoring for prospective virtual screening
- 论文链接:
- 预印本:bioRxiv,DOI: 10.64898/2026.08.03.742480,含80余页补充材料
- 开源状态:完整方法论已在bioRxiv公开,含全部算法、超参数与数据划分策略
- 核心成绩:CD73靶点湿实验命中率30.6%(54/183),较此前AtomNet大规模ML筛选提升约100倍;在全新靶点上对接精度维持50%以上,同期协同折叠模型跌至25%以下
扩散模型提案,物理引擎精修,ML模型排序
要理解DODock为什么能在新靶点上站住,需要先看清现有方法在哪里出了问题。
经典的分子对接程序(Glide、AutoDock Vina、Gold等)使用加性、成对的经验打分函数。这类函数的参数很少,泛化性天然较好,但准确性天花板也很低——它们无法捕捉真实分子识别中的多体效应和构象依赖的物理相互作用。自对接(redocking)成功率长期徘徊在40%–55%之间。
近年涌现的扩散模型和协同折叠模型(AlphaFold 3、Boltz-1、Chai-1、Protenix)试图从数据中直接学习柔性,在标准benchmark上确实取得了更高的数字。但Deep Origin团队在论文中指出,这套高分背后存在一个"记忆陷阱":标准的基于时间的训练/测试划分,会让结构相似的蛋白质和化学骨架相近的配体同时出现在训练集和测试集中。模型看似学会了对接,实际上只是在识别见过的模式。
在独立基准Runs N' Poses上,这个问题的严重程度变得清晰可见。协同折叠模型在熟悉靶点上的姿态精度达到75%–88%,但在最不相似的测试分档中跌至25%以下。DODock在熟悉靶点上达到89%,在最不相似的分档中仍维持在50%以上。
DODock的架构分为三级。第一级是一个扩散模型,负责生成大致的3D候选结合姿态。第二级是一个名为DOFast的80参数物理能量引擎——它不是从训练数据中学习相互作用模式,而是直接计算分子间的范德华力、静电作用、氢键等基本物理力。这一步是DODock与纯AI方法最根本的分歧:物理从第一性原理出发推理,不依赖训练集中是否见过类似结构。第三级是一个机器学习排序模型,评估精修后的姿态在结合界面的原子接触质量,从中选出最优解。
Deep Origin在中解释这一设计逻辑:让学习组件精确放在能增加价值的地方——提案和排序——而在泛化能力真正重要的地方,保留一个可解释的低参数物理模型。
DOScore(结合亲和力排序)遵循相同的原则。高质量的结构标注、亲和力标注的复合物数据极度稀缺。团队的做法是先用DODock为数十万个带有实验活性标签的化合物生成3D结合结构,将这些结构作为训练数据喂给DOScore——相当于用对接精度换取评分监督信号。在严格的零泄漏划分下,DOScore在DUD-E和DEKOIS 2.0的大部分靶点上实现了超过10倍的早期富集因子(EF@1%)。
Deep Origin联合创始人兼CEO Michael Antonov在中将该方法优于协同折叠模型的原因概括为两点:融合物理与能量景观理论,以及激进地剔除训练集中任何相似的蛋白质或配体。
为了防止自身benchmark也出现数据泄漏,Deep Origin采用了一种双重相似度过滤:剔除与测试集蛋白质序列一致性超过30%、配体Tanimoto相似度超过0.4的任何训练样本。论文的benchmark分析还指出了一个此前未被描述的细节:协同折叠架构在重建蛋白质口袋方面表现尚可,但在配体放置和对接力学环节精度急剧下降。论文称,此前未有分析描述过这一区分。
CD73命中率30.6%:四项前瞻性筛选全线出活
Benchmark数据只是故事的一半。Deep Origin将DODock和DOScore推向了真正的湿实验验证——在一个约800亿化合物的合成库上进行前瞻性虚拟筛选,随后在实验室中对预测结果进行生化检测。
团队选择了四个靶点,刻意构造了一条难度梯度:
IRAK4(激酶):127个受测化合物中确认19个活性分子,命中率15.0%。其中活性最强的化合物对ATP竞争性后袋的抑制效力达到158 nM。
CD73(核苷酸酶):183个受测化合物中56个在500 µM以下显示活性,54个低于100 µM,命中率30.6%。一个代表性的非核苷酸类化合物在细胞实验中达到570 nM的效力。此前一项采用AtomNet的大规模AI筛选在318个靶点上扫描了CD73,335个受测化合物中仅确认了一个176 µM的弱抑制剂——命中率约0.3%。Deep Origin的结果在筛选效率上实现了约100倍的跃升。
Factor XIa(蛋白酶):299个受测化合物中确认13个活性分子,命中率4.3%。该靶点的活性位点是一个溶剂暴露的、适合肽类底物的狭长裂隙,对小分子筛选构成天然障碍。
IL-17A(蛋白-蛋白界面靶点):194个受测化合物中确认6个别构活性分子,命中率3.1%。在蛋白-蛋白界面上发现能通过别构机制起效的小分子,是虚拟筛选中最困难的任务类别之一。
四个靶点上的所有验证活性分子均具有高骨架新颖性——与已知配体的ECFP4 Tanimoto相似度仅为0.22–0.27。这意味着筛选发现的是全新的化学起点,而非已有药物的微小变体。
在标准benchmark对比中,DODock同样展现出跨相似度分档的一致性。CASF-2016自对接测试中,DODock在2 Å精度下达到81.1%的成功率,比Glide、AutoDock Vina、Gold等商业和学术程序的40%–55%高出25个百分点以上。在专门面向新靶点生物学的OpenBind基准上,DODock达到80%的top-1姿态精度,协同折叠模型为4%–28%,DiffDock仅为2%。在PoseBusters基准上,DODock在"最相似→最不相似"分档中从84%降至80%,始终保持第一;Glide SP从80%跌至47%,参评的十个方法中无人在最不相似分档上超过72%。
在晶体结构解出之前,盲猜AZD0780的结合姿态
论文中最接近"真刀真枪"的验证,可能是一组完全盲法的前瞻性预测。
阿斯利康的口服PCSK9抑制剂laroprovstat(AZD0780)处于III期临床试验阶段。DODock在没有任何实验结构参考的情况下,预测该分子结合在PCSK9的一个非典型C端结构域位点——既不在催化位点,也不在LDLR结合面。Deep Origin随后在实验室中解出了2.07 Å的晶体结构,确认了盲法预测的结合姿态与实验结构之间的重原子RMSD仅为1.2 Å。
正如一位用户在Diamandis推文下的中所说:"前瞻性才是关键。回顾性benchmark总有可能被污染,但没有任何训练数据能穿越时间,帮你在晶体结构存在之前预测结合姿态。这是数据泄漏唯一无法伪造的证据。"
Deep Origin首席科学官Garegin Papoian在中表示,团队选择将完整的方法论——包括每一段算法、每一个超参数和每一次数据划分——全部公开。"我们发表了全部方法,留给其他人去在未见过的分子上测试。科学要前进,模型性能报告必须遵守严格的数据严谨性和透明度。"
论文同时披露,Deep Origin内部的生产平台已经在运行超越这些公开发表指标的下一代模型。
虚拟筛选的精度天花板,不是物理定律
Deep Origin将这篇预印本定位为对虚拟筛选领域的一个方法论挑战。Deep Origin在中写道:"结构基础虚拟筛选在不到1%的药物发现项目中被用作主要hit发现策略,我们认为这反映的是一个可解决的精度问题,而非根本性的物理限制。"
论文没有做夸大声明。它承认了方法的边界——IL-17A上3.1%的命中率说明蛋白-蛋白界面仍然极其困难;DOFast仅80个参数,离完整的量子力学描述还有天文距离。但CD73上100倍的效率跃升、跨四个不同难度靶点的全线出活、以及盲法PCSK9预测的实验验证,共同构成了一个相对完整的论据:当AI学会在什么时候依赖数据、什么时候退回到物理时,虚拟筛选的精度天花板是可以被抬高的。
Deep Origin将于9月2日举办网络研讨会,由Papoian介绍研究结果并接受现场提问。