AREX Feed Article
AI 写出完整病毒基因组,16 种全新噬菌体首次在实验室中活了过来
2026 年 8 月 6 日, 发表了一篇论文。论文背后有一个凌晨:Stanford 大学一间实验室里,Samuel King 盯着 Petri 皿上培养的大肠杆菌层,看见透明斑点正在扩散。那是噬菌体在吞吃细菌留下的空洞。他对 回忆那一刻:"我们开始看到这些透明斑点,太让人激动了。"导师 Brian Hie 随后补充,当结果传给整个团队时,"房间里自发地爆发出掌声。"
那些斑点来自 16 种自然界中不存在的全新病毒。它们的完整基因组由 AI 模型 Evo 1 和 Evo 2 从头生成,未经人类编辑,随后在实验室中化学合成、转化进大肠杆菌,成功复制并杀死宿主。这是人类首次用生成式 AI 设计出完整的、可复制的病毒基因组。
Evo 写了一整本遗传密码,不加一字
基因组语言模型的工作原理与大语言模型相似,只不过它预测的不是文字,而是 DNA 碱基序列。Evo 1 和 Evo 2 由 Stanford 大学和 联合开发,训练数据涵盖病毒、细菌、植物和人类的基因组。Evo 2 的训练规模达到 9.3 万亿个核苷酸,横跨生命之树的全部域。
这一次,研究团队选择了一个经典对象作为设计模板:噬菌体 ΦX174。这个病毒只有约 5,400 个碱基对、11 个基因,但基因之间存在大量重叠阅读框,一处突变就可能同时影响多个蛋白质——对 AI 的设计精度构成严苛考验。选择 ΦX174 还有历史意味:它是 1977 年 Frederic Sanger 测序的第一个完整基因组,也是 2003 年 Craig Venter 完成化学合成的第一个完整基因组。"我们想续写这个故事,用 AI 来设计它,"论文第一作者、Hie 实验室博士生 Samuel King 在 Arc Institute 博客中写道。
团队首先将 Evo 模型在 14,466 条 Microviridae 科序列上进行监督微调,使其专精于生成 ΦX174 样基因组。微调后,模型在给定启动序列的条件下,一次性从左到右生成完整基因组。Hie 对 强调:"我们没有添加任何东西。"
模型生成了约 70 万个候选设计。King 开发了一套计算筛选框架,从序列质量、宿主特异性和进化多样性三个维度过滤。最终选出约 300 个最有希望的基因组进行化学合成,通过 Gibson 组装法拼装后转化进大肠杆菌 C 株,在 96 孔板中监测细菌生长抑制。其中 285 个设计成功合成并进入实验测试。
16 个成功了。命中率约 5.6%。
这个数字本身就说明问题:AI 能生成看起来合理的基因组,却无法自行判断哪一个真能运转。这就是为什么几百个设计都必须造出来、放进去、盯着看。
392 个突变,一个新物种
16 个功能噬菌体中,每一个相较其最接近的天然近亲都携带 67 到 392 个新突变。其中 Evo-Φ2147 携带 392 个突变,与已知噬菌体 NC51 的平均核苷酸一致性仅 93.0%,按照部分分类学标准,这已构成一个新物种。13 个基因组的突变不在任何已知天然序列中出现过,意味着 Evo 探索了自然演化从未触及的序列空间。
最令人意外的是 Evo-Φ36。这株噬菌体的 DNA 包装蛋白 J 来自远缘噬菌体 G4(比 ΦX174 自身的 J 蛋白短:25 个氨基酸 vs 38 个)。此前,研究人员曾尝试用传统理性工程方法把 G4 的 J 蛋白装进 ΦX174,失败了。但在 AI 生成的基因组语境下,它竟然工作了。团队做了冷冻电镜,发现 G4 的 J 蛋白在衣壳内采用了一种不同的空间取向。论文并未明确是哪些周边突变促成了这种兼容。但它说明了一个更大的道理:零件的功能取决于系统,AI 学到的正是系统级的约束,而非单个元件。
Hie 对 Stanford 新闻稿说:"实验中有几株 Evo 设计的噬菌体,适应性比天然 ΦX174 还要高。"
用 AI 生成的多样性绕开细菌耐药
研究团队没有止步于造出活的噬菌体。他们做了一件更有说服力的事:测试 AI 设计的噬菌体能否解决天然噬菌体解决不了的问题。
他们首先在实验室中定向进化出了三株对 ΦX174 耐药的大肠杆菌突变株,耐药机制集中在 waa 操纵子,该操纵子修饰细菌表面受体。随后用 16 种 AI 噬菌体的混合 cocktail 攻击这些耐药菌株。三株耐药菌全部在 1 到 5 个传代内被 cocktail 攻克,而天然 ΦX174 完全无效。
更关键的是,序列分析显示最终获胜的噬菌体是嵌合体——来自 2 到 3 种不同 AI 设计的基因组片段在实验中自然重组,表面暴露区域集中突变。AI 提供了多样性原料,自然选择完成了剩下的工作。
抗生素耐药每年在全球导致数十万人死亡。噬菌体疗法长期被视为替代方案,但一直受限于只能从自然界已存在的噬菌体中筛选。此次研究表明,AI 可以系统性地生成多样性噬菌体群,令细菌更难发展出全面耐药。
"制造基因组的能力已经存在,安全治理没有"
同一天,《Science》配发了一篇由 Johns Hopkins 大学健康安全中心的 Thomas Inglesby 和 Moritz Hanke 撰写的 。两人研究生物安全多年,措辞直接。据 :"问题已不再是生成式病毒基因组设计会不会存在。问题是社会能否建立起监管,让它的益处得以发挥,同时阻止它造成严重伤害。" 引述的另一句更直白:"用生成式 AI 编写病毒基因组的能力已经存在;安全引导它的治理不存在。"
Inglesby 和 Hanke 承认研究团队采取了审慎的自我约束:刻意从训练数据中排除了可感染真核生物的病毒序列,全程使用仅攻击细菌的噬菌体,实验在专门的生物安全柜中进行,设备从未离开隔离区。但 Hanke 在接受《纽约时报》采访时指出了一个关键漏洞:没有任何规定要求他们必须这样做,也没有任何保证未来的使用者会同样小心。ABC News 援引他的话说,科学进步的速度与配套法规之间存在"巨大的脱节"。
Evo 2 是开源的,任何人都可以下载使用。Hie 的立场是:开源能加速研究、更快产生实际疗效,现有病原体比 AI 可能设计的更危险——因为它们更容易获取和生产,自然演化也没有内置安全检查。他在 Stanford 新闻稿中说,AI 工具反而能为人类提供对抗自然流行病的优势,以及更好的生物防御能力。
但管制的裂缝比模型本身更令人在意。7 月 28 日,白宫发布了《停止高风险生命科学研究政策》,明确禁止联邦资金支持危险的增益功能(gain-of-function)研究,并附带了执行机制。然而,据 对政策原文的逐条分析,该政策同时写明:"纯粹的计算(in silico)研究,包括开发计算模型和软件,或使用此类手段设计新型生物制剂,不在本政策禁止之列,除非涉及受关注实体。"取而代之的监管措施是:白宫科技政策办公室将召集一个跨部门工作组来"监测"生物学与人工智能交叉领域的进展。
这意味着:AI 生成 70 万个病毒基因组,在现行规则下不算违规;真正需要用钱订购 DNA 序列、组装、转化的那一刻才触动监管。而 Inglesby 和 Hanke 在评论中指向的正是这个裂缝。
从 5,400 到 50 万碱基对
ΦX174 的基因组约 5,400 个碱基对。已知最小活细胞基因组长约 50 万个碱基对,接近 100 倍的差距。人类基因组是 30 亿个碱基对。
Hie 对 BBC 表示,尝试一些简单生物体"工作量会很大,但并非不可能",团队"肯定有兴趣朝这个方向推进"。西班牙 Pompeu Fabra 大学合成生物学教授 Marc Güell 称这项研究是"一个非常重要的转折点",因为"有史以来第一次,我们开始用计算机设计生物学"。曼彻斯特生物技术研究所合成基因组学主任 Patrick Cai 说:"意义远超噬菌体,它表明基因组语言模型正在学会演化编码的设计原理,为 AI 辅助基因组写作打开了大门。"
论文作者在结论中自己把风险写得很清楚:"进行未来全基因组设计工作的团队,应在整个项目周期内同时咨询安全和安保专家。"但截至文章发表,没有强制机制保证这一点。
Samuel King 对 说过一句话:"即使在全基因组尺度上,模型也能推理基因组中需要协同工作的各个元素,从而创造出有功能的东西。"他说得没错。接下来的问题不是 AI 能不能设计更复杂的东西,而是设计出来之后,谁能决定它被拿去做什么。