AREX Feed Article
Evo 2 写出 16 个自然界从未存在的噬菌体,AI 首次设计出完整活病毒基因组
2026 年 8 月 6 日,斯坦福大学和 Arc Institute 的研究团队在《Science》期刊上,报告了一项此前从未有人做到的实验:他们用一个名为 Evo 2 的生成式 AI 模型,从零写出了完整的噬菌体病毒基因组,在实验室合成并测试了近 300 个设计,最终得到了 16 个能够自我复制并杀死大肠杆菌的活病毒——其中一些的杀菌能力超过了自然界中的原始模板。
这些病毒在自然界中从未存在过。
噬菌体(bacteriophage)是一类专门感染细菌的病毒,对人体无害。全球多个国家的诊所已经在用它治疗抗生素已无法对付的顽固感染。但找到一株恰好能针对某个耐药菌株的天然噬菌体,一直是个缓慢而不确定的搜索过程。AI 直接按照需求「写出」噬菌体基因组的能力,意味着这条时间线有可能被大幅缩短。
同一期《Science》上,约翰·霍普金斯大学健康安全中心的 Thomas Inglesby 和 Moritz Hanke ,措辞严厉:「能够用生成式 AI 组合出病毒基因组的能力现在已经存在;而安全驾驭它的治理体系,还没有。」
「我们什么都没加进去,让模型从头到尾一次性生成整个基因组」
这项研究的第一作者是斯坦福大学生物工程博士生 Samuel King,通讯作者是斯坦福大学化学工程助理教授、Arc Institute 创新研究员 Brian Hie。Hie 正是 Evo 2 的创建者之一。
Evo 2 是一个基因组基础模型(genome foundation model),、100 万个核苷酸(1 megabase)的上下文窗口,在涵盖细菌、古菌、植物、动物和人类的 9.3 万亿个核苷酸上训练而成。它于 2025 年 2 月首次发布,2026 年 3 月正式发表在《Nature》上,目前已在 上被下载超过 88,000 次。
与写文本的大语言模型不同,Evo 2 学习的是 DNA 序列的「语法」——编码区和非编码区的排列规则、基因之间的调控关系、蛋白质结构的演化约束。此前,Evo 系列模型已经验证了生成单个蛋白质乃至多组件分子系统(如 CRISPR-Cas 复合物)的能力。但写出一整个能工作的基因组,是另一回事。
「大多数生物学功能不是由任何一个单独的基因实现的,」Hie 曾。「如果我们想设计更复杂的功能,就必须跳出单基因空间,去设计完整的基因组。」
研究团队选择了噬菌体 ΦX174 作为设计模板。这个选择同时考虑了科学可行性和历史意义。ΦX174 的基因组仅约 5,386 个碱基对,编码 11 个基因、至少 7 个调控元件和 2 个识别序列——足够复杂来检验基因组级别的设计能力,又短到当前 DNA 合成成本可以承受。更难的是它的基因存在大量重叠(overlapping reading frames),这意味着同一段 DNA 序列需要同时满足多个蛋白质的编码约束。
King 为这个项目搭建了一套完整的计算框架。首先,他在约 14,466 条与 ΦX174 亲缘相近的微病毒科(Microviridae)序列上对 Evo 2 进行了监督微调(supervised fine-tuning),让模型专门学习 ΦX174 类噬菌体的序列变异规律。然后,通过仔细调节输入提示(prompt)和采样参数,模型从一个短的 ΦX174 DNA 片段出发,生成了成千上万个候选基因组。
「我们什么都没加进去,」Hie ,「让模型从头到尾一次性生成整个基因组。」
接下来是筛选关。由于 ΦX174 的基因高度重叠,标准基因预测工具最多只能识别出 11 个基因中的 7 个。King 团队自己写了一套注释流程,结合开放阅读框(ORF)搜索和同源蛋白数据库比对,才把这 11 个基因全部定位出来。他们用这套工具评估了全部候选序列,按基因完整性、宿主特异性和进化新颖度逐层过滤,选出最值得合成的几百个。
由于 DNA 合成成本仍然很高,King 的筛选框架直接决定了实验能不能做得起。合成的基因组通过 Gibson 组装法拼接后转入大肠杆菌 C 株(一种非致病性实验菌株),在 96 孔板中监测细菌生长抑制——如果 AI 设计的噬菌体真的能工作,就会在 2-3 小时内让菌液的光密度(OD₆₀₀)急剧下降。
16 个活病毒,和一个进化上本不该出现的蛋白质组合
在实验室实际测试的 285 个设计中,16 个成功组装成能够复制并杀灭大肠杆菌的完整噬菌体。每个功能性噬菌体相比其最近的自然近亲携带了 67 至 392 个新突变。其中 Evo-Φ2147 的 392 个突变使其与已知噬菌体 NC51 的平均核苷酸一致性降至 93.0%——按照某些分类学标准,这已足以被视为一个新物种。
13 个功能性基因组携带了在任何已知天然序列中都找不到的突变。换句话说,Evo 2 探索到了自然演化从未到达过的序列空间。
最让研究者意外的是 Evo-Φ36。冷冻电子显微镜(cryo-EM)显示,这株 AI 设计的噬菌体使用了来自远亲噬菌体 G4 的 DNA 包装蛋白 J。天然的 ΦX174 和 G4 在演化上相距甚远——此前有研究者试图通过理性工程手段将 G4 的 J 蛋白嫁接到 ΦX174 上,但失败了。Evo 2 在没有被明确「告知」的情况下,自行找到了让这个蛋白质组合生效所需的补偿性突变。
「这说明模型能够在整个基因组尺度上推理出不同元件之间所需的协同关系,」King 说。
在杀菌能力上,一些 AI 噬菌体也压过了天然版本。多株合成噬菌体在生长竞争实验和裂解动力学(lysis kinetics)中表现出比天然 ΦX174 更高的适应性(fitness)。
更关键的是抗药性测试。研究团队事先培养出了三株对 ΦX174 已产生完全抗性的大肠杆菌。当单独使用天然 ΦX174 攻击这些耐药菌时——「game over」,Hie 说。但当把这 16 个 AI 噬菌体混合成一剂「鸡尾酒」后,三个耐药菌株在 1 到 5 轮传代内全部被击穿。序列分析表明,最终制胜的噬菌体是多个 AI 设计的嵌合体(mosaic),它们通过重组整合了 2 到 3 个不同 AI 设计中的遗传元件。
这正是 AI 方法的独特优势:不是去自然界里大海捞针般寻找恰好能对付某个耐药机制的噬菌体,而是生成足够多样的候选病毒群体,让细菌几乎不可能同时对所有这些靶点产生全面抗性。
ΦX174 的第三次「第一次」
ΦX174 在分子生物学史上占据着一个奇特的位置。
1977 年,弗雷德里克·桑格(Frederick Sanger)带领团队完成了 ΦX174 的全基因组测序——这是人类历史上第一次读出任何一个生物体的完整 DNA 序列。2003 年,克雷格·文特尔(Craig Venter)团队完成了 ΦX174 的全化学合成——第一次证明了基因组可以从零开始用化学方法写出来。现在,2025-2026 年,同一个噬菌体的基因组第一次由 AI 设计出来。
「这个递进代表了现代基因组学定义自身的三种核心能力:我们先学会了读 DNA,然后学会了写 DNA,现在学会了设计 DNA。」Arc Institute 在中写道。
英国帝国理工学院合成基因组工程教授 Tom Ellis ,也提到了这一点:ΦX174 是「字面意义上最小、最容易制造的基因组」。它的成功并不意味着 AI 明天就能设计出复杂的病原体。Ellis 认为,相比用 AI 从头设计一个危险病毒,「对已有病原体做获得性功能(gain-of-function)改造要容易得多,也现实得多」。
巴塞罗那庞培法布拉大学教授 Jordi García Ojalvo 则:上千个设计里只有 16 个能活,说明 AI 的「幻觉率」在基因组层面仍然极高。在他眼中,这个低效率反而是一种天然的安全缓冲——每一个 AI 设计出来的基因组都必须一个一个在实验室里测试,不可能「开箱即用」地产生危险病毒。Ojalvo 将这种低效率与山中伸弥的干细胞重编程技术相比:「2012 年就因此获得了诺贝尔奖,但 14 年后效率仍然很低。」
「问题不再是 AI 设计病毒是否会发生,而是社会能不能建立让它安全展开的治理」
Inglesby 和 Hanke 提出的警告,是整件事最尖锐的部分。他们写道,AI 生成的基因组序列可能与任何已知的核酸序列都有很大差异——这意味着现有针对 DNA 合成订单的筛查工具可能根本识别不出它们。两人呼吁对 DNA 合成提供商施加法律强制性的序列筛查和买家身份核验,这是一个远超当前行业自愿实践的步骤。
King 和 Hie 的团队并非没有考虑安全。Evo 2 的训练数据刻意排除了所有能够感染人类、动物和植物的真核病毒(eukaryotic virus)序列。团队还做了红队测试,结果表明 Evo 2 对致病病毒蛋白的生成输出「实际上等同于随机」(effectively random)。Arc Institute 明确表示,「任何人都不太可能用 Evo 2 生成对人类细胞造成损害的序列」。
但 Inglesby 和 Hanke 的回应是:训练数据排除只是第一道防线,模型的权重(model weights)一旦公开下载,任何人都可以在自己的数据上微调——而微调之后的模型能做什么,原始安全设计管不了。
伦敦国王学院科学与国际安全副教授 Filippa Lentzos 把焦点放在了 DNA 合成的环节上——也就是一段数字基因组被转化为物理分子的那一刻。「分层的做法更有意义:模型开发和访问端的安全措施、负责任的研究审查、合成筛查,以及已建立的实验室生物安全和生物安保。」她说。
雷丁大学细胞微生物学副教授 Simon Clarke 一方面称赞这项研究的数据质量「极其出色」,另一方面也指出:「这些科学家已经展示了更多的自我约束,提供了重要的安全护栏——但没有保证说,每个试图做类似事情的科学家都会这么小心。」
曼彻斯特大学合成基因组学主席 Patrick Cai 称这是「合成基因组学的一个重要里程碑。AI 从预测生物序列跨越到了生成能在实验室工作的整个功能性基因组」。
庞培法布拉大学的 Marc Güell 说的最直白:「有史以来第一次,我们开始能在电脑上设计生物学。直到现在,我们只能读取和改写,但生成不了新的合成内容。因为有了 AI,我们正在开始摆脱对生物勘探的完全依赖。这是一个激动人心的时刻。」
概念验证之后:从 11 个基因到更大的蓝图
论文和多位评论者都强调,这项工作是一个概念验证(proof of concept)。5,386 个碱基对、11 个基因的 ΦX174 是一个精心选择的起跑线,距离能够设计出临床上可用的噬菌体疗法还有几条街要走。
Hie 团队列出的近期目标包括:针对植物病原体(如导致农作物黑腐病的 Xanthomonas campestris)的噬菌体、针对铜绿假单胞菌(Pseudomonas aeruginosa,医院获得性感染的主要元凶之一)的噬菌体,以及更大的 DNA 噬菌体。Hie 本人还在探索更长、更复杂的 DNA——甚至可能是小型细菌基因组,最终目标是设计出能生产有用化学品、药物或燃料的工程微生物。
「对我来说最大的开放问题是,」Hie 说,「如何获得更大的遗传新颖性,以及如何获得更强的结果可控性?」
King 的回答则带上了几分个人色彩:「这个项目最让我有成就感的部分,是 Evo 2 允许我们拥有的那种创造力。因为有了这些模型能做的事情,科学的新大门现在已经打开了。」
参考链接
- Deccan Herald:
- The Guardian:
- CNN:
- BetaNews:
- Euronews:
- EurekAlert (Stanford):
- EurekAlert (AAAS):
- Arc Institute:
- Arc Institute:
- Arc Institute:
- GEN:
- Science Media Centre:
- AI Weekly:
- bioRxiv preprint:
- Science: (DOI: 10.1126/science.aec2657)
- Evo 2 GitHub: