AREX Feed Article
AI 首次从零写出完整病毒基因组:16 种全新噬菌体在实验室活了过来
Brian Hie 与 Aditi Merchant 查看 Evo 2 生成的蛋白质结构。图片来源:Andrew Brodhead / Stanford University
2026 年 8 月 6 日,一个 AI 模型写出了 16 个自然界中从未存在过的病毒基因组,研究人员在实验室里将这些设计变成 DNA,放进大肠杆菌,看着它们在培养皿里制造出一片片空洞。
这项研究,来自斯坦福大学和 Arc Institute 的团队首次证明:生成式 AI 有能力从零设计出完整的、能自我复制并杀死细菌的功能性病毒。此前,AI 能设计单个蛋白质或基因片段,但设计一整套能运转的基因组仍是未竟之事——目标噬菌体 ΦX174 仅有 11 个基因、约 5400 个核苷酸,但哪怕一个核苷酸放错,整个基因组就可能失效。
"700,000 个设计,16 个活了下来"
研究团队使用的 AI 模型名叫 Evo 2,由斯坦福大学化学工程助理教授 Brian Hie 主导开发。它属于"基因组语言模型",工作原理与 ChatGPT 这类大语言模型相似,只不过它预测的不是下一个词,而是 DNA 序列中的下一个核苷酸。
研究人员给了 Evo 2 一个明确的任务:以 ΦX174 噬菌体为参照,设计出能够感染并杀死大肠杆菌的全新噬菌体基因组。ΦX174(读作"fai-ex-1-7-4")是科学界研究最透彻的噬菌体之一,基因组仅有约 5400 个核苷酸、11 个基因,。
Evo 2 。研究团队中的博士生 Samuel H. King 开发了一套计算框架来筛掉绝大多数。他在斯坦福大学的新闻稿中解释,这套框架涉及几个关键步骤:用 Evo 2 生成基因组、根据设计标准评估选项、选出最优候选、化学合成、然后在实验室测试哪些能真正工作。,Hie 说,"Samuel 的框架帮我们把焦点锁定在最有可能成功的那一小部分上。"
最终,他们化学合成了约 300 个 AI 设计的基因组,将其植入大肠杆菌。,产生出具有感染力的子代噬菌体。。
King 回忆起第一次看到培养皿中出现透明斑点的时刻。那些清亮的小圈意味着噬菌体正在吞噬细菌。。"我们开始看到那些清亮的斑点,那种兴奋简直无法形容。"Hie 补充说,当结果分享给整个团队时,"房间里自发地爆发出掌声。"
"9 万亿个核苷酸,教会了 AI 一种新语言"
Evo 2 的能力来自两阶段训练。
第一阶段,模型从大约 9 万亿个核苷酸中学习。,包括动物、植物、微生物和病毒。在这个阶段,Evo 2 学会了"进化的语法":基因序列中哪些模式被自然选择反复保留,哪些组合在生物学上是合理的,哪些纯属噪声。
"可能的核苷酸组合数量是天文数字,","但只有一小部分序列在生物学上是可行的,或者说能够融入生物世界。"
第二阶段,模型在 ΦX174 噬菌体家族上进行了精调。训练数据包含大约 15000 个近亲属物种的基因组,外加 ΦX174 自身的 11 个基因。,Evo 2 在噬菌体数据上精调后,学会了"写"噬菌体基因组。
但写出来的基因组能不能用,取决于每一个核苷酸对不对。。Evo 2 做到了。
牛津大学的蛋白质化学家 Oliver Crook 提醒说不要过度解读。他在接受采访时指出,。"AI 并没有发明什么根本性的新东西。它是否能对其他病毒家族同样有效,仍然是一个开放的问题。"
"我们没有往里面加任何东西,包括人类病毒的数据"
论文的 8 位作者中,除了 Hie 和 King,还包括斯坦福的研究生 Claudia L. Driscoll、David B. Li、Daniel Guo、Aditi T. Merchant、Garyk Brixi,以及来自 Broad Institute 和纪念斯隆-凯特琳癌症中心的 Max E. Wilkinson。Arc Institute 是一个位于加州 Palo Alto 的非营利研究机构,以支持"高风险、高回报"项目著称。
项目资金来自 Arc Institute、美国国家科学基金会、Knight-Hennessy 研究生奖学金、Fannie and John Hertz 基金会,以及斯坦福以人为本 AI 研究院(Stanford HAI)。
比资金更值得关注的是团队主动采取的安全措施。他们在训练 Evo 2 时,故意排除了所有能感染人类、动物、植物和真菌的病毒数据。这意味着模型从根本上就不具备生成人类病原体基因组的能力。。
这些措施完全出于自愿。。
此外,实验全程在安全的实验室中进行,操作对象仅限于噬菌体。这类病毒只感染细菌,对人体无害。研究团队还将 Evo 2 以开源形式公开发布。Hie 的理由是,开放获取可以加速医学研究和实际应用。,因为它们更容易获取和制造,并且不像 AI 那样可以在过程中内建安全检查。
"生成病毒基因组的能力已经存在,安全治理还没有"
这种乐观评估并非人人都买账。
在《科学》期刊随论文一并发表的评论文章中,约翰·霍普金斯大学健康安全中心的 Thomas Inglesby 和 Moritz Hanke 写下了措辞严厉的警告。他们指出,。团队排除人类病毒数据的做法是"值得赞扬的",但""。
","他们写道,"而是社会能否建立监管,使其益处得以发挥,同时防止它造成严重伤害。"
最令人不安的,是监管的时间线。
2026 年 7 月底,美国国立卫生研究院(NIH)发布了一项关于高风险生命科学研究的政策,禁止使病原体变得更危险的实验。但政策明确表示,,"除非涉及受关注实体"。换句话说,在电脑上设计病毒 DNA,不在 NIH 新政策的覆盖范围内。
NIH 的政策在论文发表的不到一周前出台,但完全不覆盖这项研究中最关键的环节:用 AI 设计病毒基因组。
Hanke 在接受《纽约时报》采访时直言,。"因为他们从任何地方都得不到关于该做什么不该做什么的指导。":"你可以说,'嘿,基因组语言模型,给我做一个流感病毒基因组,让它更容易传播,或者更致命。'"
称这项研究是"一个非常重要的转折点",因为"人类历史上第一次,我们开始在计算机上设计生物学"。则称之为"重要的里程碑"。他认为意义远不止噬菌体,"它表明基因组语言模型正在开始学习进化编码的设计原理,为 AI 辅助的基因组编写打开了大门。"
16 个噬菌体之后
,下一步可能尝试设计更长、更复杂的 DNA 序列,甚至是小型细菌的基因组,以制造能生产有用化学物质、药物和燃料的工程微生物。Hie 列出了两个最核心的开放问题:"如何获得更大的基因新颖性,以及如何对结果施加更强的控制。"
但眼前真正的问题比这更直接。
这 16 个噬菌体之所以没有危险,是因为一群在 Palo Alto 的研究人员自己决定要小心。排除人类病毒数据、只做噬菌体、在安全实验室操作——这些安全护栏全部是自愿的。他们还可以选择不做这些。下一间实验室也可以选择不做这些。
AI 写出了一个自然的副本,展示了它理解进化语言的能力。但写出副本的能力与写出毁灭性武器的能力,在底层技术上是同一件事。
","Inglesby 和 Hanke 在评论中写道,"安全引导它的治理还没有。"