AREX Feed Article
OpenAI Foundation 宣布推出第二个科学项目 Public Data for Health,初始资助逾 1.25 亿美元
9 月 15 日,OpenAI Foundation 在其官网发布,推出第二个科学项目 Public Data for Health。该基金会称,将向「初始一批」非营利组织与大学提供超过 1.25 亿美元的资助,用于创建和保存高质量的生命科学数据集,并让这些数据向研究人员广泛开放。
公告列举了三个示例项目:OpenADMET 将构建开放数据集与基准,并举办盲测竞赛,检验 AI 模型能否预测小分子在体内的吸收与分布;CTD Commons 将保存并公开失败药物开发项目的监管档案;北卡罗来纳大学(UNC)将建立 Initiative for Generative Immunotherapy,生成公开的多模态数据,服务于个性化癌症疫苗。Public Data for Health 是该基金会继 4 月启动 AI for Alzheimer's 之后推出的第二个科学项目;当时称,正努力在当月敲定逾 1 亿美元、覆盖六家研究机构的资助。
图为 OpenADMET 近期为 ADMET 预测挑战参赛者举办的活动,演示主题为「衡量 ADMET 预测的进展」。图片来源:Naomi Handly/OpenAI Foundation 公告。
资助重点:连接的数据、稀缺的数据、直接的数据
公告解释了这个项目的出资逻辑:有些数据集公共价值巨大,却可能永远不会被创建或共享,因为没有任何单一机构有足够的动力或能力去资助它们。它还预计,许多预防和治疗疾病的突破,将来自把新模型的智能与更多对世界的观测配对,也就是更多数据。公告说,这批资助横跨多个数据层面,「从分子,到流行病学,到监管知识」。
Public Data for Health 项目的官方图片。图片来源:OpenAI Foundation 公告。
公告称,其最初的关注点是三类数据;获资助的数据集通常具备其中一到两项,少数同时具备三项。公告特别提到,这一部分对希望获得该基金会未来资助机会的研究者尤其相关:
- 连接的数据(connected data):生物学在不同尺度上展开,多数数据集只捕捉其中一个切面:细胞图谱测量成千上万个细胞里的分子,单分子成像却只跟踪一个细胞。这些数据集通常各自独立生成,要弄清不同结果如何相互关联,可能得花数年跟进研究。基金会想支持研究团队在不同尺度之间有意移动,生成层与层互相印证的丰富数据集。
- 稀缺的数据(scarce data):再强的 AI 也无法回到特定时刻重新观测:比如没有可靠生命统计的国家里的死因与疾病负担,或者过去某一时刻的患者样本内容。基金会尤其关注在机会消失前收集或保存数据,以及把永远不会被重新创造的私有数据集在尊重隐私与知情同意的前提下公开。
- 直接的数据(direct data):生物学长期在测量容易或便宜测量的东西:单细胞数据多于人类临床数据,RNA 表达多于蛋白质。这些代理指标有用,但可能与理解生物学、预防和治疗疾病的目标脱节。基金会希望给研究者资源,去组装测量真正要紧的东西的数据集;如果测量「生物学真相」所需的仪器尚不存在,或大规模使用时成本过高,它也希望同时支持新数据与新工具两类工作。
OpenADMET:用公开盲测检验 ADMET 预测
公告在介绍这个项目时给出了一个数字:90% 的药物候选物在临床试验中失败,而这常常源于难以预测它们会如何被吸收、如何在体内移动,即 ADMET 性质。它认为这类尚未解决的预测难题适合交给 AI,前提是配上有质量的数据,用来检验不同模型的预测准确度。
公告还给出了先例:AlphaFold2 借助 Protein Data Bank 的数据,并在 CASP 组织的竞赛中与其他建模方法比拼,改变了蛋白质结构预测;如今这项能力已进入许多药物发现流程,未来很可能让患者受益。OpenADMET 团队走的是类似的路径:构建高质量数据集,为新的预测模型提供依据,并举办全球研究者可参加的公开挑战赛。
公告说,对加州大学旧金山分校(UCSF)的资助将让 OpenADMET 团队测量数万个化合物的关键分子性质与相互作用,再把这份广谱测量数据与两个视角联系起来:一是转运蛋白与选定分子结合的实验结构,二是测定这些转运蛋白与分子之间如何功能互作。最后,团队会在部分化合物上用人血脑屏障模型测试,并与动物体内的测量结果对照。按公告的说法,这种采集方式将形成一份异常完整的记录,说明是什么决定了药物在体内的移动。
「药物发现充满了普遍性问题,没有哪家致力于治愈某种特定疾病的公司或学术实验室能独自解决这些问题,」OpenADMET 理事会成员、UCSF 生物工程与治疗科学系教授兼系主任 James Fraser 说。「OpenADMET 的建立,就是为了以开放、且便于机器学习使用的方式应对这些问题。我们很兴奋能够构建这一基础层,让 AI 大幅加速新疗法的开发。」
CTD Commons:在项目失败、公司关闭前保存监管档案
CTD 是一种通用技术文档(Common Technical Document),汇编一种在研药物的完整历程,从动物毒理、生产细节,到与 FDA 的往来函件。但公告指出,其中只有一小部分内容会出现在已发表的论文里。
CTD Commons 将测试一种可能性:从失败或搁置的药物开发项目中获取这些档案,并把它们公开,供所有人研究和分析。公告把这项工作归入「稀缺的数据」:失败项目的档案会随着公司关闭而消失,而这类记录无法回头重建。
公告描述了它的用途:短期,帮助早期药物开发团队了解监管者曾对类似产品提出过什么要求,而不是通过昂贵的试错去学习;长期,这些文件可以成为机器学习系统的资源,用来发现药物为何失败或成功的模式,进而改进监管方式或试验策略,让患者更早用上新疗法。
「每一份提交给 FDA 的材料,都代表着研究者、审评人员和研究参与者的努力与牺牲。即使这些努力失败了,它们产生的宝贵信息也不应被浪费,」CTD Commons 的主要组织者、1Day Sooner 主席 Josh Morrison 说。「CTD Commons 将减少重复和成本,并最大化临床研究的影响。」
UNC:直接测量肿瘤表面蛋白与患者的 T 细胞反应
公告说,今天的「新抗原」(neoantigen)癌症疫苗属于少数为每位患者计算设计的药物:对肿瘤细胞测序,预测哪些肿瘤特异性靶点被呈递在细胞表面。但测序本身是对现实的代理:直接测量细胞表面的靶点既困难又昂贵,检查患者免疫系统对每种蛋白的反应有多强,同样如此。
据公告,UNC 将建立 Initiative for Generative Immunotherapy,由 UNC Lineberger 与 UNC Health 的团队在数百个肿瘤、多种癌症类型上补齐这些缺失的环节,直接测量肿瘤细胞的表面蛋白与患者的 T 细胞反应,形成该领域首批训练与评估数据集之一;数据经去标识化后向全球研究者公开。公告称,这类测量成本高昂,这次一次性做全并开放,是希望未来所有癌症疫苗工作都能受益。
图为北卡罗来纳大学从事个性化癌症疫苗研究的实验室成员。图片来源:UNC/OpenAI Foundation 公告。
「个性化癌症疫苗终于开始显现临床疗效的迹象,但在传统的疗法开发模式下,仍有一些缺口可能需要几十年才能补上。高质量数据能帮助我们更快地弥合这些缺口,」UNC 医学院遗传学助理教授 Alex Rubinsteyn 说。「我们很兴奋能压缩这一时间线,帮助让普遍有效的个性化免疫疗法成为现实。」
数据开放的条件:预印本、持续共享与隐私边界
公告称,在所有资助中,它都会确保结果数据集尽可能向世界各地的研究者开放;涉及人类数据时,同时维护个人隐私与知情同意。开放不止是发布原始数据:公告鼓励受资助方通过预印本发表分析、定期而不是仅在项目结束时共享数据;如果数据集不属于「连接的数据」,还要与数据使用者一起评估它在有生物学价值的问题上的效用。
公告对此的解释是:科学史上很长一段时间里,检验假说曾是发现的主要瓶颈。可投入问题的「智能」总量有限:数量固定的研究生与职业科学家,围绕一个问题既生成数据、也分析数据;AI 在编码与数据分析上的持续进展正在打破这个假设,分析数据可能变得高度可扩展,洞见会从数据生成时难以预见的合作中涌现。基金会的使命是「确保通用人工智能(AGI)惠及全人类」。
四个在招岗位与公开邮箱
公告说,以上只是该基金会的「初步方向」,会随着科学与 AI 的进展、以及与研究社区的交流持续更新。想为 Public Data for Health 提想法,可以发邮件至 ;该基金会正在为「生命科学与治愈疾病」(Life Sciences and Curing Diseases)团队招聘四个岗位。
公告以「几个示例」介绍所支持的项目,受资助方的完整名单、各机构金额与时间表都没有出现在公告里。