AREX Feed Article
OpenEvidence 称 Darwin 成为首个 MedQA 满分的医疗 AI 模型
据 9 月 8 日报道,医疗 AI 公司 OpenEvidence 宣布其新模型 Darwin 成为该公司所称「史上首个在 MedQA 基准上取得 100% 满分的 AI 系统」,并以 72.8% 登顶 MedXpertQA、82.7% 登顶 HealthBench Professional、87.2% 登顶 NOHARM。
这份成绩单出自 OpenEvidence 。家族共四款模型,以现代医学奠基人物命名;其中三款当天起向通过认证的临床医生免费开放,而拿下满分的 Darwin 因双重用途(dual-use)风险仍处于研究预览(research preview)阶段,仅限申请访问。上述基准数字均为 OpenEvidence 自述口径,目前没有独立第三方核实。
660 道题全对:MedQA 上的满分从哪来
MedQA 收录美国医师执照考试(USMLE)风格的题目。据 报道,Darwin 答对了其中全部 660 道题;OpenEvidence 公布的次优成绩里,Claude Fable 5 为 99.7%,Gemini 3.7 Flash 为 99.2%,GPT-5.6 Sol 为 99.1%。
四项基准考的能力并不相同。按 公布的对比表:MedQA 考执照考试式选择题,MedXpertQA 考专家级专科题目,HealthBench Pro 按医生撰写的开放式评分标准打分,NOHARM 则采用按危害加权的评分。Darwin 的领先幅度从 MedQA 的 0.3 个百分点到 NOHARM 的 13.2 个百分点不等。新闻稿还提到,OpenEvidence 随成绩公布了 Darwin 对每一道题答案的解释。
Osler 五秒作答,Snow 花五分钟读文献
四款模型的分工由响应时间决定。按:Osler 约 5 秒作答,面向诊室节奏,接替现有模型成为平台默认;Sackett 约 30 秒,会主动向临床医生追问更多临床背景,用于证据权重决定答案的问题;Snow 约 5 分钟,接替原有的 Deep Consult 功能,先并行检索医学文献,再写出报告。
Osler、Sackett、Snow 三款模型当天起在 openevidence.com 和 iOS、Android 应用上线。OpenEvidence 创始人兼 CEO Daniel Nadler 在新闻稿中说:「家族里每一个模型都以同一个临床准确性标准衡量。不同的只是时间:模型思考多久,检索有多深。」
为什么满分的模型只对申请者开放
Becker's 报道,OpenEvidence 把 Darwin 的申请制归因于病毒学、免疫学和遗传学等领域的双重用途风险。目前,国家罕见病组织(National Organization for Rare Disorders, NORD)等机构合作伙伴和经过认证的学术研究者可以访问该模型。
OpenEvidence 在里解释:「这种级别的能力在医学上是把双刃剑,所以 Darwin 处于研究预览阶段、仅限申请访问,同时其安全防护措施正与 NORD 等伙伴一同验证。」公司计划在安全防护措施经验证后,把 Darwin 的能力扩展进生产模型。
自述满分之外,公司自己承认的局限
OpenEvidence 自己也给这份成绩单加了一个限定:按 TechTarget 转述其博客文章,这些基准测的是模型单独作答、没有人类在环的表现,「这与今天临床决策支持工具的实际使用方式并不相符」。公司援引 Feng 等人 2026 年提出的标准:答案好不好,要看它能否帮医生做出更好的决定。
估值 120 亿美元,半年三次上新
Becker's 提到,OpenEvidence 截至 1 月的估值为 120 亿美元。TechTarget 盘点其今年上半年的动作:先后上线答案质量分级功能、可预测患者是否患结构性心脏病的 AI 工具,以及编码建议功能。 于 9 月 3 日报道了此次模型发布。
悬而未决的有两件事:Darwin 何时进入生产模型,取决于安全防护措施与合作伙伴的验证进度;而 660 道题全对的成绩,目前仍只有 OpenEvidence 一家的数字。