AREX Feed Article
Stanford 的 AI 写出了 16 个自然界不存在的噬菌体基因组,Johns Hopkins 警告:生物安全远未就绪
2026 年 8 月 6 日,Stanford 大学与 Arc Institute 的研究团队在《Science》期刊发表论文,首次用生成式 AI 模型从头设计出完整的病毒基因组,并在实验室中合成了 16 个具备感染和复制能力的全新噬菌体。同期刊出的 Johns Hopkins 大学健康安全中心评论文章直言,这项成果提出了"紧迫的生物安全与生物安保问题"(urgent biosafety and biosecurity questions)。
11 个基因,5,400 个碱基,AI 如何写完一个完整基因组
此前的 AI 生物学突破集中在蛋白质层面。2024 年诺贝尔化学奖便颁给了 AI 蛋白质设计。但设计蛋白质与设计整个基因组之间存在数量级的复杂度差异。蛋白质是一条氨基酸链,而基因组包含多个基因、调控元件和识别序列,这些组件必须协调运作,单个突变就可能导致整个基因组报废。
Stanford 团队使用了名为 Evo 1 和 Evo 2 的基因组语言模型。Evo 2 由 Arc Institute 与 Stanford 联合开发,在 9.3 万亿个 DNA 核苷酸上完成训练,覆盖 128,000 种生物的基因组数据。与 ChatGPT 预测文字序列类似,Evo 模型预测的是 DNA 碱基序列。
团队选择了ΦX174 噬菌体作为设计模板。ΦX174 是分子生物学的经典模型:1977 年 Frederick Sanger 测序的第一个完整 DNA 基因组就是它,2003 年 Craig Venter 团队首次化学合成完整基因组也是它。其基因组仅约 5,400 个碱基对,包含 11 个基因和至少 7 个调控元件。
直接让基础模型生成噬菌体基因组效果有限。Evo 2 生成的序列中仅 34% 至 38% 被病毒分类工具 geNomad 识别为病毒序列。团队随后在约 15,000 个 Microviridae 科(ΦX174 所属的病毒家族)基因组上对模型进行了监督微调,并开发了三层计算过滤流程:序列质量控制、宿主趋向性筛选、进化多样性筛选。
经过生成和过滤,团队从数千个候选基因组中选出 302 个进行化学合成,其中 285 个成功组装,最终仅 16 个"启动"(boot up)成为具备感染能力的活病毒。这 16 个 AI 噬菌体的基因组每个携带 67 至 392 个新突变,核苷酸序列一致性最低仅 93.0%。至少一个噬菌体与任何已知物种的基因组相似度低于 95%,按噬菌体分类学标准已可划为新物种。
比野生型更能打:AI 噬菌体在实验室里做了什么
16 个 AI 噬菌体不仅活了,其中一些表现得比天然ΦX174 更强。在一个竞争实验中,团队将所有 AI 噬菌体与野生型ΦX174 混合投入 E. coli 培养液,通过测序追踪各菌株的消长。名为 Evo-Φ69 的 AI 噬菌体增殖至起始水平的 65 倍,多个 AI 噬菌体在裂解动力学上也超过野生型。
Evo-Φ36 的设计更值得注意。该噬菌体的 J 基因被替换成了远缘噬菌体 G4 的同源基因。此前实验已证明,这种替换会使噬菌体丧失功能。但 AI 模型在基因组其他位置自动做出了补偿性调整,使整个系统恢复了活力。冷冻电镜进一步揭示,其中一个 AI 噬菌体使用了演化距离极远的 DNA 包装蛋白来构建衣壳。
在模拟病原体耐药性的实验中,团队用 AI 噬菌体混合物攻击了三株已对ΦX174 产生抗性的 E. coli。天然ΦX174 单打独斗无法突破抗性,而 AI 噬菌体鸡尾酒迅速压倒了所有三株耐药菌。
凌晨的透明斑点,和一屋子自发的掌声
Brian Hie 是 Stanford 大学化学工程系助理教授、演化设计实验室(Laboratory of Evolutionary Design)负责人,也是本研究的通讯作者。他此前参与领导了 Evo 2 模型的开发。
论文第一作者 Samuel King 是 Hie 实验室的博士后研究员。其他合著者包括 Claudia L. Driscoll、David B. Li、Daniel Guo、Aditi T. Merchant、Garyk Brixi 和 Max E. Wilkinson,来自 Stanford 大学多个系以及 Memorial Sloan Kettering 癌症中心。
Hie 向 BBC 描述了实验成功的那一刻:"我们把结果分享给整个团队时,房间里自发响起了掌声。" King 回忆,他们在凌晨看到培养皿上出现透明斑点,那是噬菌体正在吞噬细菌的标志:"我们开始看到这些清亮的斑点,那一刻极其令人兴奋。"
Hie 向 IFLScience 解释实验逻辑时说得更直白:"这最终成了一个相当快的系统,因为如果细菌死了,噬菌体大概就是管用的,对吧?液体浑浊说明有很多细菌,液体清了就说明细菌大概死了。"
一个说"上行收益远超风险",一个说"不应追求设计致病病毒"
与论文同期发表在《Science》上的评论文章中,Johns Hopkins 大学健康安全中心的 Thomas Inglesby 博士与 Moritz Hanke 博士写下了一个尖锐的判断:核心问题已不再是"生成式病毒基因组设计是否会存在",而是"能否在不造成严重伤害的前提下使用它"。他们明确主张,不应追求设计具有致病潜力的新病毒。
研究团队的安全措施包括三项:训练数据中排除了可感染人类、动物和植物等复杂生物的病毒序列;实验对象仅限噬菌体;所有实验在安全实验室中进行。Hie 向 BBC 表示,现有防护措施"在很大程度上可以确保技术被用于善途"。
但 Inglesby 和 Hanke 的担忧有更深层的理由。Evo 2 完全开源,训练代码、推理代码、模型参数和训练数据全部公开。动机充分的行为者理论上可以用人类病毒数据重新训练模型。HIV 基因组约 10,000 个碱基,冠状病毒约 30,000 个碱基,尺寸并非遥不可及。
西班牙 Pompeu Fabra 大学合成生物学实验室的 Marc Güell 教授称该研究为"一个非常重要的转折点",因为"历史上第一次,我们开始在计算机上设计生物学"。曼彻斯特生物技术研究所合成基因组学主任 Patrick Cai 教授认为其意义"远超噬菌体。它表明基因组语言模型正在开始学习进化编码的设计原理,为 AI 辅助基因组编写打开了大门。"
新西兰 Waikato 大学噬菌体疗法研究组负责人 Simon Jackson 指出,自然界中合适的噬菌体有时极难找到,"生成式 AI 可以减少对自然发现的依赖,生成自然界中稀有或不存在的有用特性。" Canterbury 大学微生物学家 Heather Hendrickson 则提醒,自然界本身就在不断制造"有希望的怪物",绝大多数变异体最终无法存活。
监管追不上一个开源模型和一台 DNA 合成仪
当前的生物安全监管框架主要针对物理实验室中的已知病原体操作。Inglesby 和 Hanke 的评论指向一个结构性缺口:AI 在计算机上生成完整病毒基因组,这一行为本身即落在现有规则的覆盖范围之外。他们提出的核心问题是,生成式病毒基因组设计现在已经存在,而能够安全驾驭这一能力的治理体系并不存在。
Hie 对 IFLScience 的回应直截了当:"我认为潜在的上行收益远超风险。我们当然需要负责任且安全地推进,但如果我们继续推进这些模型的技术,它们将对人类产生重大的积极影响。"
从ΦX174 的 5,400 个碱基到最简单的活细胞基因组的 50 万个碱基,再到人类基因组的 30 亿个碱基,AI 基因组设计还有很长的路要走。但 1977 年 Sanger 测出ΦX174 时,从 5,375 个碱基到 30 亿个碱基的跨越同样看似不可逾越。这个跨越在四分之一世纪内完成了。