AREX Feed Article
Google DeepMind 称借助 AlphaGenome Atlas 锁定 DNM1 突变并获实验室验证,UK Biobank 罕见遗传信号检出提升 22% 以上
Google DeepMind 9 月 17 日在 X 上发布的推文串称,Broad Institute、埃克塞特大学(University of Exeter)等机构的研究者已在使用 AlphaGenome Atlas 识别潜在致病的 DNA 变异并解释其作用()。推文串列出三项结果:Broad Institute 的研究者借助 Atlas 在一例未解罕见病中锁定 DNM1 基因上的一个关键突变,该突变已在实验室得到确认和验证;与埃克塞特大学合作分析 54,000 多名 UK Biobank 参与者的数据,罕见遗传信号检出提升 22% 以上,并发现影响蛋白 PLA2G7 丰度的新 DNA 变异;与 Stowers Institute for Medical Research 合作,绘制出 2,500 多个调控模式。
推文串给出的数据库入口,指向 DeepMind 9 月 8 日发布的;更完整的机制、姓名与数字,来自这篇博客及其中链接的论文、Atlas 官方页面,以及 Stowers Institute 的新闻稿。
DNM1:一例未解罕见病和一个剪接位点错误
推文串中关于 DNM1 的一条()写道,Broad Institute 的科学家在寻找未解罕见病病例的病因,但可能的突变清单极其庞大。
DeepMind 博客补充了这项工作的路径:研究者与 GREGoR Consortium 合作,用 Atlas 的 AVI 分数为此前被遗漏的候选变异排出优先级;Broad Institute 的 Laura Covill、Anne O'Donnell-Luria 与同事由此发现了一个影响 DNM1 的变异,该基因与癫痫性脑病(epileptic encephalopathy)密切相关。按博客的说明,AlphaGenome 预测这个变异制造了一个错误的剪接位点,使生成的蛋白质异常延长;实验筛选验证了这一预测,并在附近找到了具有类似效应的变异。Google 官方博客对这一案例的表述是:这些预测「为成功解决该病例提供了关键支持证据」()。
埃克塞特大学:按预测的分子效应给罕见变异分组
推文串中关于埃克塞特大学的一条()把 PLA2G7 称作「与代谢健康相关」的蛋白;博客对同一蛋白的表述是「与衰老相关」。博客记录了这项分析的过程:埃克塞特大学的 Gareth Hawkes(Medical Research Council fellow)把这套工具用于 UK Biobank 参与者的全基因组数据。
罕见非编码变异与性状的关联极难识别,因为大量无害变异构成统计噪声;Hawkes 按预测的分子效应给罕见变异分组后,多找到 22% 的非编码遗传关联,这些关联原本无法从噪声中检出。他由此定位到驱动 PLA2G7 与 EGLN1(一种细胞氧感受器)丰度的调控变异,并在体质指数(BMI)上沿用同样思路,只取 Atlas 预测影响力最高的 1% 非编码变异,识别出 19 个相关遗传区域。
Stowers Institute:「基因组单词」与两类转录因子
推文串中关于 Stowers Institute 的一条()称,人体细胞内每秒都有数以百万计的「基因组开关」在决定细胞如何运作与适应;与 Stowers Institute 合作,Atlas 找出了这些开关背后的 DNA 序列,它们在数百种细胞类型中调高或调低基因活性。
按博客的解释,这些「调控模式」指的是 Atlas 收录的一套「基因组单词」:在基因组中反复出现的 DNA 短序列(motif)及其位置。Stowers Institute 的 Julia Zeitlinger 与 Melanie Weilert 用这套资源把转录因子(控制基因开关的蛋白)分为两类:只改变 DNA 可及性的,以及还能直接激活或抑制基因的。
Stowers Institute 在 9 月 8 日的中确认了这项合作:Zeitlinger 与由 Google DeepMind 科学副总裁兼首席科学家 Žiga Avsec 领导的团队合作,Weilert 是该项目的领衔作者之一。新闻稿称,若用实验方法在数千个位点、多种细胞类型上做同样的分析,需要耗费巨量时间与资源;Atlas 把全基因组预测集中到一个可检索的资源里,让团队能识别更广范围的基因调控模式。Zeitlinger 在新闻稿中说:「这些 motif 以碱基对分辨率绘制在基因组上、覆盖许多细胞类型,等于给了我们一本可检索的非编码 DNA 词典。」
90 亿条预测与 1 PB 的数据集
按 DeepMind 博客的介绍,AlphaGenome Atlas 于 9 月 8 日正式发布:DeepMind 用 AlphaGenome 模型预计算人类基因组全部 90 亿种可能的单核苷酸变异(即单个 DNA 字母的改变)的分子效应,构成 1 PB(拍字节)的数据集,博客称其规模超过 AlphaFold Database 的 30 倍。Atlas 建立在 AlphaGenome 之上:这是一个能预测遗传变异如何影响生物过程的人工智能模型,Atlas 通过预计算把它的预测扩展到整个基因组。Atlas 引入的 AVI 分数(AlphaGenome Variant Impact)把 AlphaGenome 与 AlphaMissense 的预测合成一个数字,供研究者快速排序变异;每个分数还带有特征归因,指出该变异最可能扰动的分子过程(如 RNA 剪接或基因表达)。博客称,DeepMind 的测试显示,AVI 在多项变异致病性与罕见病基准上表现「同类最佳」,对编码区(约占基因组 2%)与非编码区(约 98%)同样适用;每个变异还带有跨数百种人类与小鼠细胞类型和组织的数千条分子效应预测。博客把平台细节指向一份。
免费开放,但不包括临床决策
推文串最后一条()称,这些发现「只是开始」,AlphaGenome Atlas 免费开放,供各地研究者解码疾病的遗传成因。
可核对的访问条件更具体:博客称 Atlas 自 9 月 8 日起通过网站面向非商业用途开放;基础模型已通过 GitHub 与 AlphaGenome API 面向学术用途提供。写明:输出仅限非商业使用,不得用于训练其他机器学习模型;预测只服务于理论建模与研究目的,「不得用于临床决策」,也不能作为医疗或其他专业建议的依据;网站支持在浏览器中零代码查询单个变异。博客同时声明,AlphaGenome 尚未针对任何临床用途经过验证,也未获批准用于临床。Stowers Institute 的新闻稿把这类工具的边界写得更直白:Atlas 不取代实验室研究,它解决的是先查哪个变异、先问哪个问题。
博客称 Atlas 的商业使用将上线 Google Cloud,时间表述为「即将」(soon)。