AREX Feed Article
Stanford 用 Evo 2 从零写出 16 种活病毒,Johns Hopkins:现有筛查全部失效
8 月 6 日,Stanford 大学与 Arc Institute 的研究团队在《Science》期刊发表了一项成果:他们用基因组语言模型 Evo 2,从零设计了完整的噬菌体基因组,其中 16 个在实验室中成功组装为功能性病毒,感染并杀死了大肠杆菌。
同一期《Science》上,Johns Hopkins 大学健康安全中心的生物安全专家发表评论,明确指出现有 DNA 合成筛查体系无法检测这类 AI 生成的全新序列。原因是这些基因序列不匹配任何已知数据库,恰好落在筛查逻辑的盲区里。
论文第一作者 Samuel King 是 Stanford 生物工程博士生,通讯作者 Brian Hie 是 Stanford 化学工程助理教授兼 Dieter Schwarz 基金会 Stanford 数据科学教职研究员,也是 Evo 2 的创建者。研究得到了 Arc Institute、美国国家科学基金会、Knight-Hennessy 研究生奖学金、Fannie and John Hertz 基金会以及 Stanford 人本 AI 研究所的资助。
这五个结论,一个比一个棘手
一是 AI 可以端到端写出完整、功能性的病毒基因组。此前生成式生物学的工作主要集中在设计单个蛋白质或短序列,Evo 2 做到了从起始片段出发,一次性从左到右生成完整的 5,386 碱基对基因组,不作任何人工干预。
二是这些 AI 设计的病毒在自然界中不存在。16 个功能性噬菌体基因组与任何已知天然序列都有显著差异。其中一个叫 Evo-Φ36 的噬菌体携带了来自远缘噬菌体 G4 的截短 J 蛋白。此前研究者曾尝试通过传统基因工程将这段蛋白导入野生型 ΦX174,失败了。
三是 AI 生成的噬菌体"鸡尾酒"能让耐药菌无处可逃。三种对天然 ΦX174 已产生免疫的大肠杆菌菌株,在 1 到 5 轮传代内被 AI 设计的噬菌体混合物全部攻克,天然 ΦX174 则完全无效。
四是当前全球 DNA 合成筛查均基于序列相似性比对,把订单序列跟已知危险序列名单做匹配。AI 生成的序列不匹配任何名单,筛查对它透明。
五是美国国会正在审议的《生物安全现代化与创新法案》(S.3741)同样依赖序列相似性筛查,没有强制要求对序列的功能风险进行评估。截至 8 月 7 日,该法案尚未通过。
"一次从左到右的完整书写,我们没有添加任何东西"
Evo 2 是一个自回归基因组语言模型,架构上跟 GPT 类文本模型同源,只是训练数据不是语言而是 DNA。它的底层架构叫 StripedHyena 2,混合了 Transformer 层与状态空间模型,上下文窗口可达 100 万碱基对,在单核苷酸分辨率下运行。模型在跨越全部三个生命域的 12.8 万个完整基因组、总计 9.3 万亿个核苷酸上完成了预训练。
在这项实验中,Hie 和 King 将 Evo 2 在约 14,000 个 Microviridae 科病毒基因组上做了监督微调。Microviridae 正是 ΦX174 所属的家族。ΦX174 是科学史上第一个被完整测序的 DNA 基因组,1977 年由 Fred Sanger 完成;2003 年,Craig Venter 团队在实验室中首次全化学合成完整基因组,用的也是它。现在,这个 5,386 碱基对、编码 11 个基因的小病毒,成了第一个被 AI 从头设计的基因组模板。
研究团队刻意将所有能感染人类、动物、植物或真菌的病原体排除在训练数据之外。Hie 在接受 采访时说:"这对我们来说是全新的领域。"
给 Evo 2 一段 ΦX174 基因组的短起始片段作为提示(prompt),模型便从一个核苷酸到一个核苷酸地预测下一个碱基,一次性从左到右写完整个基因组。"在这个例子里,我们想让模型端到端生成整个基因组,什么都不加,"Hie 在 中解释,"在实验室测试中,Evo 给出的几个建议比天然 ΦX174 的适应性还高。"
302 个候选,16 个活了下来,有些比天然祖先更能打
从模型生成到实验验证,中间有一道关键的过滤工序。Evo 2 产出大量候选基因组,但 DNA 合成成本高昂。King 开发了一套计算框架,从基因组架构、宿主范围预测和进化新颖性三个维度筛选候选序列。团队最终挑选并化学合成了约 302 个基因组。
这 302 个合成基因组被分别导入大肠杆菌宿主细胞,在 96 孔板中监测细菌生长抑制。结果 16 个基因组成功产生出功能性噬菌体:它们感染了大肠杆菌,在菌体内复制,最后裂解细胞释放子代。经过筛选后的候选基因组中约 5% 最终可存活。与天然 ΦX174 的直接竞争实验中,部分 AI 设计的噬菌体展现出更快的裂解动力学,几个甚至战胜了它们的生物学祖先。
16 个功能性基因组各自携带 67 到 392 个相对于最近天然基因组的突变。Evo-Φ2147 带有 392 个突变,与最近天然噬菌体的平均核苷酸一致性仅 93.0%,按某些分类标准已够得上一个新物种。13 个基因组含有在任何已知天然序列中都找不到的突变。
最令人意外的是 Evo-Φ36。它的 DNA 包装蛋白 J 来自远缘噬菌体 G4,比 ΦX174 自身的 J 蛋白短了 13 个氨基酸(25 对 38)。此前研究者试图通过传统基因工程将 G4 的 J 蛋白植入 ΦX174,失败了,因为缩短的 J 蛋白需要基因组其他位置的补偿性突变配合。Evo 2 在一次生成中同时完成了这些协调突变,冷冻电镜显示 G4 的短 J 蛋白在衣壳结构中采用了独特的取向。Hie 团队在 中写道,这表明 AI 有能力协调复杂的补偿性突变,让新的蛋白质组合变得可行。
一杯"鸡尾酒"让三种耐药菌株全部沦陷
把这 16 个 AI 设计的噬菌体做成混合制剂,天然 ΦX174 单打独斗攻不下的菌株,混合物在 1 到 5 轮传代内全部攻克。研究团队事先培养出三种对 ΦX174 已产生抗性的大肠杆菌菌株,突变发生在 waa 操纵子上,改变了细菌表面受体。天然 ΦX174 无法感染这些菌株。
论文中直接展示了这一机制:如果只使用单一噬菌体,细菌一旦进化出对该噬菌体的抗性,"药物治疗就结束了,"Hie 说。但如果使用多种遗传上互不相同的噬菌体混合物,细菌就必须同时对付多个攻击向量,大大降低了全面抗性形成的概率。Arc Institute 的 进一步揭示,成功的噬菌体来自 2 到 3 个不同 AI 设计的重组嵌合体,突变集中在与细菌受体互作的表面区域。AI 生成的多样性为快速适应提供了多条进化路径。
抗生素耐药性每年直接导致超过 100 万人死亡,约 500 万人的死亡与此有关。《柳叶刀》全球抗生素耐药研究(GRAM)和全球抗生素耐药研究项目预测,2025 至 2050 年间耐药感染将造成 3900 万人死亡,大约每分钟三人。
噬菌体疗法——使用专门猎杀特定细菌的病毒——自 1910 年代被发现以来一直被视为抗生素的潜在替代方案,但关键在于能否足够快地找到、多样化并定制噬菌体以跑赢细菌进化。Hie 和 King 设想将类似方法用于结核分枝杆菌、耐甲氧西林金黄色葡萄球菌(MRSA)以及铜绿假单胞菌,后者是医院获得性耐药感染的主要病原体。
筛查靠"对名单"——AI 设计的序列不在任何名单上
目前全球 DNA 合成公司的生物安全筛查机制全部基于同源性比对:客户下单合成 DNA,系统将订单序列与已知病原体基因组、毒素编码序列或受控病原体名单逐一比对。这种逻辑对已知威胁有效,但对从未存在过的序列完全无效。这正是 Evo 2 刚刚展示的序列类型。
在同期《Science》发表的评论中,Johns Hopkins 大学健康安全中心的 写道,这项研究提出了"紧迫的生物安全与生物安保问题"。他们呼吁通过立法强制 DNA 合成公司在打印序列的同时筛查客户身份。目前美国没有任何联邦法律作此要求。他们还建议,应立法禁止将此类生成技术应用于感染人类、动物或农作物的病原体。
Hanke 在接受《》采访时说:"你可以说,'嘿,基因组语言模型,给我做一个流感基因组,让它传播性更强或致死性更高。'"目前没有任何国家要求合成 DNA 订单必须经过强制筛查,也没有法律禁止将生成式 AI 应用于人类病原体设计。
Evo 2 本身是开源且免费的,任何有足够算力的研究者都可以从 或 平台下载,Apache 2.0 许可证。Hie 的立场是,开放恰恰是防御:自然界的病原体无法被过滤或安全检查,它们自由进化且随手可得;而开源 AI 工具可以在训练数据中内置护栏。"AI 工具也给了研究者对抗自然大流行更快的响应能力,以及在设计防御性对策时的优势。"
法案在国会,但漏洞还在
美国参议员 Tom Cotton(共和党,阿肯色州)和 Amy Klobuchar(民主党,明尼苏达州)于 2026 年 1 月提出了 S.3741《生物安全现代化与创新法案》,要求商务部长制定法规,强制基因合成提供商对订单序列和客户身份进行筛查,并在 NIST 设立生物安全沙盒测试新工具。该法案得到 Johns Hopkins 健康安全中心、核威胁倡议组织(NTI)以及 Twist Bioscience 和 Integrated DNA Technologies 等主要合成公司的支持。
但 S.3741 的筛查框架本质上仍然基于序列相似性,跟当前筛查体系共享同一个结构性盲区。法案文本确实在 Sec. 4(b)(3) 中指示 NIST"研究和原型化序列到功能模型以补充该系统",但这是研究任务,不是筛查要求,没有时间表,没有专项拨款,也没有强制将功能评估整合进操作框架的条款。EA Forum 上的一篇 指出,该法案还遗漏了对台式合成仪使用端的持续监管:法案覆盖了合成仪的销售端,但设备买回去之后合成什么,没有约束。
威胁被夸大了吗?
Imperial College London 合成基因组工程教授 提供了一个重要的比例感。ΦX174 的基因组只有 5,386 碱基对。SARS-CoV-2 的基因组约 3 万个碱基对,大约六倍。"但模型做更大东西的复杂度会呈指数级增长,所以大六倍的东西大概要难 100 倍,"Ellis 说。他指出,操控天然存在的病毒——在环境中随手可得、容易培养、已经适应宿主——构成比 AI 设计的新型病原体更直接也更紧迫的威胁。
Pompeu Fabra 大学系统生物学教授 Jordi García Ojalvo 称这项突破"意义重大"。同校合成生物学实验室的 Marc Güell 教授则说这是"一个非常重要的转折点",因为"历史上第一次,我们开始在计算机上设计生物学"。Manchester 生物技术研究所合成基因组学主席 Patrick Cai 认为这项研究是"重要里程碑":"意义远超噬菌体。它表明基因组语言模型开始学习进化编码的设计原则,为 AI 辅助的基因组写作打开了大门。"
论文自身的成功率也提供了一个参照。Evo 2 生成了大量候选基因组,经过计算筛选后约 302 个被合成,16 个成功,大约 5% 的产出率。AI 还不能按需可靠地产出活病毒。
但 Inglesby 和 Hanke 的警告指向的不是今天的成功率,而是今天的监管空白:任何人都可以在网上下单定制 DNA 序列,有时每碱基对不到 10 美分,几天后收到一瓶合成 DNA,没有任何联邦法律要求提供商核实序列内容或买家身份。这个缺口无论 AI 是否参与设计都已经存在。