AREX Feed Article
斯坦福用 Evo2 造出 16 种全新噬菌体,《科学》同期评论警告"紧急生物安全风险"
8 月 6 日,斯坦福大学研究人员在《科学》期刊上发表,宣布使用 AI 模型 Evo1 和 Evo2 成功设计出 16 种自然界从未出现过的全功能性噬菌体病毒。这些病毒被合成后在实验室中成功感染并杀死了大肠杆菌。其中部分 AI 设计的版本,杀伤力甚至超过了它们的天然模板 ΦX174。
同一期《科学》上,约翰·霍普金斯大学健康安全中心的 Thomas Inglesby 和 Moritz Hanke 发表了一篇,称这项工作提出了"紧急的生物安全和生物安保问题",并呼吁对合成核酸订单实施法定筛查。这是人类首次用生成式 AI 从零设计出完整的、可复制的病毒基因组。
302 份设计稿,16 个活了下来
研究由斯坦福大学化学工程助理教授 Brian Hie 与生物工程博士生 Samuel King 主导。团队选定的设计模板是 ΦX174——一种感染大肠杆菌的微噬菌体,基因组仅约 5,400 个碱基对,包含 11 个基因和若干调控元件。它是分子生物学历史上被研究得最透彻的病毒之一:1977 年 Frederick Sanger 测出了它的完整序列,2003 年 Craig Venter 团队在 14 天内完成了它的化学合成。
但这回不一样。过去人类合成 ΦX174,是照着自然的图纸抄;这一次,AI 自己画了图纸。
Hie 和 King 用 14,266 个 Microviridae 科噬菌体基因组对 Evo1 和 Evo2 做了微调(fine-tuning),然后以一个仅 4 到 8 个核苷酸的保守序列作为"提示词"(prompt),让模型从左到右一次写出完整基因组。模型吐出了数千条候选序列。研究团队接着用计算框架逐层筛选,筛出 302 个最有希望的候选,委托合成后实际拿到 285 条,再将这些人工合成的 DNA 植入大肠杆菌。最终,只有 16 个"启动"成功,制造出了可感染、可复制的活病毒。
King 对 BBC 回忆,他在凌晨观察到培养皿上出现透明斑点——那是噬菌体正在裂解细菌的信号。"我们开始看到这些透明斑点,那一刻真是极其兴奋。" Hie 补充说,当结果分享给全组时,"房间里自发爆发出掌声"。
AI 修好了一条人类修不好的基因
在 16 个存活的 AI 噬菌体中,Evo-Φ36 最值得单独拿出来说。它携带了 11 个基因,与野生 ΦX174 数量相同,但其中一个关键基因 J 被替换成了来自远缘噬菌体 G4 的版本。此前的人类实验已经证明,这个替换会直接废掉噬菌体的功能:G4 的 J 蛋白比 ΦX174 的短得多,放进 ΦX174 的基因组里就是一场灾难。但 Evo 模型偏偏把它做成了:AI 在生成基因组时,对整个序列上下文进行了"协同适配"(coadaptation),改写基因组其余部分来迁就这个短版 J 蛋白,最终产出了一个活的功能性病毒。
这不是人类工程师靠理性设计能做到的事。至少目前做不到。
在竞争实验中,团队把 16 种 AI 噬菌体和野生 ΦX174 一起丢进大肠杆菌培养液里,让它们争夺宿主。一个叫 Evo-Φ69 的变体表现突出,其数量增至起始水平的 65 倍。 部分 AI 噬菌体与已知噬菌体的基因组相似度不足 95%,按噬菌体分类学标准,这已经够得上一个新物种的门槛。
另一个具有实际意义的发现是:将 16 种 AI 噬菌体混合成"噬菌体鸡尾酒"后,它们成功压制了两株对天然 ΦX174 已产生耐药的大肠杆菌。这正是噬菌体疗法一直想解决的难题:细菌很容易对单一噬菌体产生抗性,但面对基因构成各异的噬菌体混合攻击,就很难全身而退。
约翰·霍普金斯专家:筛查机制追不上 AI 设计速度
Inglesby 和 Hanke 把矛头指向了现有安全体系的漏洞。他们写道,问题的关键已经不再是"生成式病毒基因组设计会不会出现",而是"社会能不能建立起监管,让它的好处得以发挥,同时阻止它造成严重伤害"。
他们的核心关切之一,是当前合成核酸的筛查机制不足以应对 AI 生成的全新序列。目前 DNA 合成提供商对客户订单的筛查在美国属于自愿性质。Inglesby 和 Hanke 主张将其升级为法定要求:必须对订单序列进行安全筛查,同时核实买家身份。他们还特别指出,AI 生成的基因组可能与任何已知序列差异巨大,现有的序列比对筛查方法"迫切需要升级"。
Hie 团队自身也采取了安全措施。Evo2 的训练数据刻意排除了真核生物病毒(即可能感染人类、动物、植物的病毒)。团队的"红队"测试表明,模型对致病病毒蛋白的输出"实际上是随机的"(effectively random)。 所有实验均在安全实验室中进行,且全程使用仅感染细菌的噬菌体,不涉及任何可感染复杂生物的病毒。King 等人在论文中也写道,未来从事全基因组设计工作的团队"应在整个项目周期内咨询安全和安保专业人士"。
开源的两面
Evo2 是完全开源的。模型权重、训练代码、推理代码和训练数据全部公开在 GitHub 和 HuggingFace 上。Hie 在斯坦福大学的新闻稿中表示,开放对于加速研究和产生真实世界成果至关重要。他的另一个论点是:自然界已有的病原体比 AI 可能设计出来的任何东西都更容易获取、更容易制造,而且大自然不会自带安全检查。
但这个逻辑并非没有漏洞。伦敦帝国理工学院的 Tom Ellis 对《卫报》指出,ΦX174 是"字面意义上最小、最容易制造的基因组"。他同时表示,对基因数据的获取施加简单限制,仍然可以产生实质性的防护效果。
更棘手的是,即使基础模型排除了人类病毒数据,一个拿到开源权重的攻击者仍可以自行微调。HIV 基因组大约 10,000 个碱基,新冠病毒约 30,000 个,都比 ΦX174 大,但并非遥不可及。C&EN 在报道中引述 King 的说法,称这项工作是一份"概念验证"。 概念验证的意思是:路已经走通了。
从 5,400 到 30 亿
噬菌体的 5,400 碱基只是起点。最简单的活细胞基因组约 50 万碱基,人类基因组是 30 亿。Hie 对 BBC 表示,尝试设计一些简单生物体"可能需要大量工作,但不是不可能",他的团队"绝对有兴趣朝这个方向努力"。
外部科学界给出了高度评价,但措辞各有侧重。西班牙庞培法布拉大学合成生物学实验室的 Marc Güell 教授称这项研究是"一个非常重要的转折点",因为"历史上第一次,我们开始在计算机上设计生物学"。曼彻斯特生物技术研究所合成基因组学主席 Patrick Cai 称之为"重要里程碑":"其意义远超噬菌体本身——它表明基因组语言模型正在学会进化编码的设计原则,为 AI 辅助的基因组编写打开了大门。"
Hie 自己则把目光放在更实际的问题上。在斯坦福新闻稿中,他列出了两个"最大的开放问题":如何获得更大的遗传新颖性,以及如何获得更高的结果可控性。