AREX Feed Article
DODock 把 CD73 虚拟筛选命中率推到 30.6%,比此前 ML 方案高约百倍——新靶点对接准确率超 50%
扩散模型画草图,物理引擎定终稿。
过去几年,AI 驱动的分子对接模型在标准基准测试上不断刷新纪录。AlphaFold3、Boltz-1、Chai-1 等 co-folding 模型在熟悉的靶点上能做到 75%–88% 的对接准确率,看上去虚拟筛选的"准确性问题"已经解决了。
但一个关键细节长期被忽略:这些模型的性能高度依赖训练数据的相似度——一旦把测试范围推到模型从未见过的蛋白和配体上,准确率就从 80% 级跌到 25% 以下。换句话说,它们学会了"认"训练集里的分子,却没能学会"推"新靶点的结合模式。
8 月 3 日,DeepOrigin 在 bioRxiv 发布预印本,介绍了其自研的对接与打分框架 DODock 与 DOScore。
团队没有继续堆叠更大的神经网络,而是把扩散模型与一个紧凑的物理引擎(DOFast)耦合在一起:扩散模型负责提出候选结合姿态,物理引擎从分子间基本作用力出发做精修,AI 模型最后对精修结果排序。这套混合架构在真正的新靶点上把对接准确率维持在了 50% 以上——同期 co-folding 模型已跌破 25%。
更关键的是,团队没有止步于基准测试,而是把模型推进了四次真实的湿实验筛选。CD73 这个历史上极难用虚拟筛选攻克的靶点,在筛选中拿到了 ,而此前一项大规模 ML 筛选的命中率仅约 0.3%,差距约 100 倍。
论文标题: Overcoming the accuracy-generalization tradeoff in docking and scoring for prospective virtual screening 论文链接: 开源地址: 暂未开放源代码;预印本附有 80 页补充材料,涵盖所有算法、超参数和数据划分策略 核心成绩: DODock 在新靶点上维持超过 50% 的对接准确率(co-folding 模型同期低于 25%);CD73 湿实验命中率 30.6%,较此前 ML 方案提升约 100 倍
扩散模型提案 + 物理引擎精修:DODock 的三段式架构
要理解 DODock 为什么能在新靶点上站稳,得先看清纯 AI 方法和经典对接方法各自的死穴。
经典对接程序(如 Glide、AutoDock Vina、Gold)使用的打分函数本质上是加性的、成对的——把原子间的范德华力、静电作用等项简单累加。这种简化让它们具备了不错的泛化能力,但也把准确率天花板压在了 40%–55% 左右,因为它们无法捕捉真实分子识别中多体、构象依赖的物理效应。
近年的 co-folding 模型走了另一个极端:它们从海量数据中直接学习蛋白-配体相互作用的模式,表达力极强,在熟悉的测试集上能跑出 80% 以上的成绩。但正如 DeepOrigin 的博客文章所指出,——在严格的蛋白-配体双相似度划分下,co-folding 模型在最不相似的测试子集上准确率跌到 25% 以下。它们擅长拟合训练分布,但靠的是"识别"而非"泛化"。
DODock 的设计思路可以用一句话概括:只在 AI 真正能帮忙的地方用 AI,其余交给物理。整个管线分为三步:
-
扩散模型生成候选姿态。 一个扩散模型对配体在蛋白结合口袋中的 3D 构象空间做广泛采样,提出一批候选结合姿态。这一步利用了扩散模型在构象空间探索上的表达力。
-
80 参数的物理能量引擎(DOFast)做精修。 候选姿态被送入一个扩展的、基于 Vina 风格的可解释能量函数。这个函数只靠 80 个参数,从分子间基本作用力出发计算能量,完全不依赖训练数据的模式记忆。直觉上,这类似于用物理第一性原理而非经验规则来判断一个姿态是否合理——因此在新靶点上不会因为训练数据覆盖不足而翻车。
-
AI 模型对精修后的姿态排序。 一个 AI 模型评估精修后每个姿态在结合界面上的原子接触点质量,给出最终排序。
"精修"这一步是整个架构区别于纯 AI 方法的关键。物理引擎用第一性原理而非数据模式来判断姿态质量——这是 DODock 在新靶点上不掉链子的根本原因。
DOScore 沿用了相同的原则来处理结合亲和力预测。结构标注、亲和力标注的复合物数据极其稀缺,于是团队用 DODock 先为数十万条仅带活性标签的化合物生成高质量 3D 结构,把对接精度转化为评分监督信号。DOScore 在此基础上评估原子环境相互作用和结合口袋的整体 3D 几何,在严格的无泄漏划分下将真正结合物排在伪配体之前。
四项湿实验验证:CD73 命中率暴增百倍,盲测 PCSK9 误差仅 1.2 Å
DeepOrigin 没有把验证停留在基准测试上。团队用 DODock/DOScore 对约 800 亿虚拟化合物库做了四项前瞻性湿实验筛选,靶点按结构难度梯度排列。:
- IRAK4(激酶): 127 个受试化合物中 19 个有活性,命中率 15.0%,其中包含一个 158 nM 的高效抑制剂,作用于 ATP 竞争性后袋。
- CD73(核苷酸酶): 183 个化合物中 56 个显示活性(54 个在 100 µM 以下),命中率 30.6%,其中一例非核苷酸类 hit 达到 570 nM 的细胞活性。作为对比,此前一项基于 AtomNet 的 318 靶点大规模 ML 筛选中,CD73 仅确认了一个 176 µM 的弱抑制剂(335 个化合物中命中率约 0.3%)。DeepOrigin 的结果在筛选效率上提升了约 100 倍。
- Factor XIa(蛋白酶): 299 个化合物中 13 个有活性,命中率 4.3%,靶向一个溶剂暴露的、适合肽结合的裂隙。
- IL-17A(蛋白-蛋白界面靶点): 194 个化合物中 6 个有活性,命中率 3.1%,成功发现了能变构破坏远端蛋白-蛋白界面的小分子。
四项筛选拿到的活性化合物在化学骨架新颖性上也经得起检验——与已知配体的 ECFP4 Tanimoto 相似度仅 0.22–0.27,说明筛出的是全新化学物质,而不是已有药物的微小变体。
PCSK9 的盲测结果进一步验证了这一点。团队在 AstraZeneca 公布其 Phase 3 候选药物 laroprovstat(AZD0780)的晶体结构之前,用 DODock 预测了该分子与 PCSK9 的结合姿态,定位在一个非典型的 C 端结构域,而非已被充分表征的催化位点或 LDLR 结合面。DeepOrigin 随后自行解析了 2.07 Å 的晶体结构,。
Co-folding 模型能重构口袋,却放不准配体
预印本中的一项分析特别指出:co-folding 模型(AlphaFold3、Boltz-1、Chai-1 等)在对接任务上的崩溃并非全域性的。这些模型在重构蛋白结合口袋的形状方面依然表现不俗——它们的问题是配体放置和对接力学环节的准确率急剧下降。
DeepOrigin 的 CSO 兼联合创始人 Garegin Papoian 在声明中把这个问题归为"记忆陷阱":,AI 模型靠记住历史配体-蛋白对就能拿高分,而不是真正学会了对接的物理规律。
DeepOrigin 在自有的基准测试中采取了严格的双相似度过滤:任何与测试集蛋白序列一致性 ≥30% 或配体 Tanimoto 相似度 >0.4 的样本全部剔除。
在这种无泄漏条件下,Runs N' Poses 基准的结果最直观:co-folding 模型在相似度最低的区间(0–20% 分位)准确率跌破 25%,DODock 稳在 50% 以上。OpenBind 基准——专门针对新靶点生物学构建——上 DODock 做到了 80% 的 top-1 成功率,而 AlphaFold3、Boltz-1、Chai-1 仅 4%–28%,DiffDock 更是只有 2%。
新闻稿引述论文分析称,此前未有分析对 co-folding 架构在对接任务上的这一断裂点做出此种区分。
全方法 + 80 页补充材料公开,等待独立验证
DeepOrigin 将整个方法论、所有超参数、数据划分策略和超过 80 页的补充材料全部公开。
Papoian 在声明中表示:"我们公开了全部方法——每个算法、数据策略、完整的补充材料——留给其他人用我们没见过的分子来检验。科学要进步,模型性能报告必须遵循严格的数据严谨性和透明度。"
公司同时透露其内部生产平台已在运行性能优于公开基准的下一代模型。换言之,论文中的数字是公开基线,不是天花板。
LinkedIn 上该帖文获得 385 次互动和 25 条评论。DeepOrigin 首席商务官 Natalie Ma 在发帖中强调,:用严格的相似度划分取代时间划分、用多项基准加前瞻性湿实验取代单项指标、用全方法公开取代黑箱报告。
也有评论质疑将 co-folding 模型作为直接对比对象的公平性——co-folding 本身不依赖预先输入的结构和精确残基信息,而 DODock 需要——但多位评论者认可了前瞻性湿实验验证的含金量。
预印本目前尚未经过同行评审。团队将于 9 月 2 日举行网络研讨会"Useful Generalization is the Benchmark That Matters",由 Papoian 主讲并开放现场问答。