AREX Feed Article
一次 AI 引导胜过七轮定向进化,ProteinGuide 统一框架登 Nature Biotechnology
把实验数据变成生成模型的方向盘,且无需重新训练。
2026 年 7 月 29 日,UC Berkeley 的 Jennifer Listgarten 与 David F. Savage 联合团队在 上发表 ProteinGuide——首个无需重新训练即可将实验数据条件化到蛋白质序列生成模型的方法。该方法在湿实验验证中,仅用一轮 AI 引导设计出的腺嘌呤碱基编辑器(ABE),编辑活性便超过了此前七轮定向进化所达到的水平。
论文标题:Property guidance for protein sequence generative models with ProteinGuide 论文链接: 开源地址: 核心成绩:一轮 AI 引导的碱基编辑器设计,活性超越七轮定向进化;同时支持稳定性、酶分类、折叠类别和多属性 Pareto 优化的即插即用引导。
一个统一框架,打通四种生成模型
蛋白质工程中有一个长期缺口:现有的序列生成模型——无论是 ESM3、ProteinMPNN 还是基于扩散的 MultiFlow——在训练完成后就被"冻结"了。如果想让它生成的序列偏向某种特定属性(比如更高的热稳定性、更强的催化活性),通常只能重新训练整个模型,成本极高。
ProteinGuide 的做法不同。它发现了一个此前未被充分利用的统计等价性:掩码语言模型(MLM,如 ESM3)、任意阶自回归模型(AO-ARM,如 ProteinMPNN)、离散扩散模型和离散流匹配模型——这四种看起来完全不同的生成模型,在训练目标上其实是等价的。它们都可以被统一到同一个离散状态空间的扩散/流匹配框架下。
这个等价性意味着,此前仅适用于扩散模型的引导(guidance)方法,现在可以直接搬用到 MLM 和 AO-ARM 上。具体来说,ProteinGuide 在采样过程的每一步,利用贝叶斯公式将预训练生成模型的信息与一个属性预测模型的信息融合,从而在不修改生成模型权重的前提下,让采样结果偏向目标属性。
技术实现上,ProteinGuide 提供两种引导算法:TAG(Taylor-Approximate Guidance)通过一次前向+反向传播给出近似引导,速度快;DEG(Discrete-time Exact Guidance)则通过推导出的 AO-ARM 采样等价形式实现精确引导。用户只需准备一个属性预测器(分类器或回归器),即可对任意支持的生成模型进行即插即用的条件化。
图:ProteinGuide 将 MLM、AO-ARM、离散扩散和流匹配模型统一到同一框架下,通过属性预测器在采样过程中引导序列生成。来源:Xiong et al., Nature Biotechnology (2026)
五项任务:从计算机模拟到活体实验
团队用 ProteinGuide 在五项任务上进行了验证,涵盖了从纯计算机模拟到真实湿实验的完整光谱。
稳定性引导的逆折叠。 研究人员用大规模实验折叠稳定性测量数据训练了一个回归模型,然后用它引导 ProteinMPNN 生成氨基酸序列。在八个蛋白质的测试中,ProteinGuide 持续产生既正确折叠(RMSD ≤ 2 Å)又比野生型更稳定(ΔΔG ≤ 0)的序列,成功率在所有方法中最高。相比之下,无引导的 ProteinMPNN 生成的序列大多稳定性不如野生型。
酶分类引导。 用 CLEAN 酶分类器引导 ESM3,从完全掩码(即从头设计)到 50% 掩码(半重新设计)的不同难度下,ProteinGuide 都能让生成的序列准确落入目标酶类别,且保持较高的 pLDDT 折叠置信度。
折叠类别引导。 将引导拓展到结构 token 空间——引导 ESM3 生成属于特定 CATH 折叠类别的骨架结构。对于常见折叠类别,ProteinGuide 的成功率与针对该类微调模型的效果相当,但完全省去了微调步骤。
多属性 Pareto 优化。 在 PbrR 转录因子的设计中,团队同时引导模型增强铅离子结合能力并降低锌离子的脱靶结合——两个目标彼此冲突。ProteinGuide 生成的序列成功越过了实验数据的 Pareto 前沿,证明该方法能够处理真实蛋白质工程中常见的多目标权衡。
碱基编辑器活体实验。 这是最关键的验证。团队以野生型 TadA(一种活性极低的 ABE)为起点,先用 FMIF 和 ESM3 联合生成第一轮 2000 个变体文库,通过细菌筛选实验测定活性。随后用这批实验数据训练分类器,再以 ProteinGuide 引导生成第二轮 2000 个变体。结果明确:第二轮文库的平均对数富集度为 0.66 ± 0.02,远超第一轮的 −0.28 ± 0.01,且第二轮中出现了比第一轮所有变体活性都更高的序列——一轮 AI 引导,胜过七轮定向进化()。
为什么"不重新训练"这件事很重要
ProteinGuide 的价值不仅在于某个 benchmark 上的数字。它解决的是一个工程流程问题。
在真实的蛋白质工程中,设计-构建-测试-学习(DBTL)循环是常态:每一轮湿实验产生新数据,研究人员需要将这些数据反馈到下一轮设计中。如果每次都要重新训练生成模型,时间和计算成本会迅速膨胀。ProteinGuide 让这一步变成了"换一个预测器即可"——生成模型保持不变,只需用新实验数据更新属性预测模型,然后重新引导采样。
论文第一作者 Junhao Xiong、Ishan Gaur、Maria Lukarska 和 Hunter Nisonoff 等人在代码开源之外,还发布了 ,将 ProteinGuide 及其他文库设计流程封装成简洁的 API。在 ProteinGen 中,切换生成模型(如从 ProteinMPNN 换到 ESM3)或切换引导算法(从 TAG 换到 DEG)只需改几行导入语句。所有实验数据和预训练模型权重也已上传至 。
从"能否生成"到"能否按需生成"
ProteinGuide 的出现标志着一个转向:蛋白质 AI 设计的核心问题正在从"能不能生成蛋白质"变成"能不能按需生成特定属性的蛋白质"。
论文的局限同样值得注意。引导的效果取决于属性预测器的质量——如果预测器在训练数据覆盖范围之外泛化能力不足,引导效果也会打折扣。对于稀有 CATH 折叠类别的引导,成功率明显低于常见类别,说明生成模型自身的结构生成能力仍是天花板。此外,目前的方法适用于离散 token 序列,对连续空间的生成模型尚不适用。
但 ProteinGuide 已经证明了这条路走得通:在不触及生成模型本身的情况下,用实验数据做方向盘,让它开往更值得去的地方。对于药物发现、工业酶设计和基因编辑工具开发来说,这是一个实实在在的加速器。