AREX Feed Article
Insilico 更新 DDD 基准:Opus-5 临床预测称王,285 项评测无一模型通吃
8 月 6 日,Insilico Medicine 更新了其 门户,首次将 OpenAI 的 GPT-5.6-Sol 和 Anthropic 的 Claude Opus-5 两个前沿模型纳入评测。Claude Opus-5 以 Insilico Score 65.4 的总分登上榜首,但排行榜传递的最清晰信号是:在药物发现这条从靶点识别到临床预测的长链路上,没有一个模型能在所有环节通吃。
Opus-5 总分登顶,但三大模型各据不同赛道
此次更新后, 覆盖 9 个模型、285 项独立评测、横跨 8 个科学类别。Claude Opus-5 以综合 Insilico Score 65.4 排名第一。拆开来看,总分背后是截然不同的能力剖面:
- Claude Opus-5 在临床试验预测和药物吸收(ADME)相关评测中全面领先,Spearman 相关系数在 LogD 预测上达到 0.72(R² = 0.50,MAE = 0.692),明显优于其他前沿模型。
- GPT-5.6-Sol 在治疗性大分子(包括抗体可开发性预测)维度占优,在多步合成规划 URSAbench 上排名 LLM 第一、总榜第三,仅次于两个专用逆合成规划器。
- Grok 4.5 在长寿(Longevity)类别中拿下第一名,覆盖衰老预测、甲基化年龄、NHANES 死亡率分类等多项子任务。
Insilico 在更新公告中直言:"令人惊讶的结果是——没有一个模型在所有类别中胜出。"("The surprising result: there is no single winner across all categories.")
临床、大分子、长寿:三家如何划出自己的优势区
Claude Opus-5:临床预测与 ADME 维度建立领先
DDD Benchmark 包含超过 300 项评测,其中 ADME(吸收、分布、代谢、排泄)与临床前安全性预测是衡量一个 AI 模型是否具备制药实用性的硬指标。Opus-5 在这批评测中表现的系统性优势最为突出。
Insilico 生成式生物制剂产品经理 Andrew Aiginin 指出,Opus-5 在口服药物吸收预测上"做了出色的工作,超越了其他前沿模型"()。对于一个口服药来说,能否穿过肠壁进入血液,是决定它能否替代注射给药的关键一步。Opus-5 在 Caco-2 渗透性、MDCK-MDR1 渗透性、血浆蛋白结合率等子项上均交出领先的 Spearman 相关系数。
Insilico AI 模型负责人 Vladimir Aladinskiy 发布的 LogD 预测对比数据显示,("a clear step-change")。
GPT-5.6-Sol:大分子与合成规划的双重壁垒
GPT-5.6-Sol 在大治疗性分子类别中建立了自己的壁垒。Aiginin 此前曾对比 GPT-5.6 家族三款模型(Sol、Terra、Luna)在抗体可开发性预测上的表现,Sol 以最高推理算力投入换取最好成绩,而 Luna 以远低于 Sol 的价格拿到了接近的水平。
在化学合成规划方面,Sol 的表现更具说服力。在多步逆合成基准 URSAbench 上,,仅落后于微软的 RetroChimera 和阿斯利康的 AiZynthFinder——两个为逆合成任务专门构建的专家系统。通用模型正在快速逼近专业工具。
Grok 4.5:长寿赛道的领跑者
Grok 4.5 在长寿类别中获得第一,涵盖衰老预测、甲基化年龄回归、NHANES 死亡率分类等多项子评测。免疫学家 Derya Unutmaz 对此评论道:",让我们看看 Grok 4.6 能否在其他药物发现基准上与 GPT-5.6 Sol 和 Opus 5 竞争。"
长寿研究是 Insilico 的核心战略方向之一。该公司创始人兼 CEO Alex Zhavoronkov 近年反复强调"productive longevity"(高效长寿)的愿景,Grok 4.5 在这一特定方向的胜出,为 xAI 的模型在生物医学垂直领域打开了一个切入点。
专家模型仍然把控关键阵地
Insilico 更新公告中分量最重的判断是:在多个类别中,前沿模型尚未超越专家模型("in many categories, frontier models have not yet surpassed specialist models")。
URSAbench 是最直观的例子。微软的 ,阿斯利康的 AiZynthFinder 紧随其后。GPT-5.6 Sol 代表的通用 LLM 虽然进步迅速,但在需要精确化学推理的逆合成规划任务上,专门为化学空间设计的系统仍然有明显优势。
Aladinskiy 在引用 DDD Benchmark 的"全谱图"(Full-Spectrum map)时写道:"。"
一个"去污染"的基准为什么重要
DDD Benchmark 的设计逻辑建立在一个具体判断之上:大多数公开 AI 基准存在严重的数据污染,模型通过记忆训练数据中见过的测试题拿到虚高的分数,面对真实的候选药物决策时却失灵。
Insilico 的应对方案是把基准锚定在自己的真实药物发现项目上。,自成立以来,Insilico 已提名 31 个临床前候选化合物(PCC),获得超过 10 项 IND 批件,将 PCC 提名周期从传统方法的 2.5 至 4 年以上压缩到约 12 至 18 个月。其核心管线 Rentosertib(ISM001-055)是一个完全由 AI 发现和设计、已进入 III 期临床的 first-in-class TNIK 抑制剂,适应症为特发性肺纤维化。
DDD Benchmark 包含两套评测组合——Drug Discovery Foundations(300+ 项基于专有分布外测试集和严格去污染公开数据的评测)和 Drug Candidate Essentials(考察模型从苗头化合物到 PCC 提名的端到端决策能力)。任何通过标准 chat-completions API 服务的模型都可以接入评测。
AI 投资者 Bradley Woolf 在参观了 Insilico 实验室后指出,该公司已对外出售或许可了 11 个药物项目,其模式""(fundamentally how new biopharmas will operate)。
多模型管线正在成为现实
DDD Benchmark 此次更新的隐含推论比排行榜本身更有指向性:如果药物发现的不同环节天然适配不同的模型架构,那么未来的 AI 驱动药物研发管线不会是"选一个最强模型",而是"在每个环节使用最适合的模型"。
Insilico 已经在实践这一思路。其 Pharma.AI 平台包含三个核心模块:PandaOmics(靶点发现)、Chemistry42(生成化学)和 inClinico(临床试验预测),各自可以接入不同的底层模型。此次 DDD 基准更新后开放的模型评测 API,让外部团队也能验证自己的模型在具体环节上的表现,而非仅仅追求一个综合排名。
GPT-5.6 家族内部的性能-成本梯度(Sol > Terra > Luna)、Opus-5 在 ADME 维度上的专长、Grok 4.5 在长寿领域的特定优势——三者的互补性已经足够清晰。问题不再是"哪个模型最好",而是"你的分子此刻应该调用哪个模型"。