AREX Feed Article
社区还在教 AI 背 ATGC,NVIDIA 直接让它预测 DNA"意味着什么"了
过去两年,基因组基础模型(Genomic Foundation Model,GFM)社区沿着一条越来越可预测的路径前进:更大的模型、更多的物种数据、更长的上下文窗口。从 DNABERT-2 到 Nucleotide Transformer v3,从 HyenaDNA 到 Evo2,每一代模型的核心训练目标几乎从未变过——Masked Language Modeling(MLM)或 Next Token Prediction(NTP),本质都是让模型预测"这里缺了哪个碱基"。
问题在于,基因组不是自然语言。ATCG 四个字母的排列组合固然重要,但 DNA 真正关键的信息藏在更长程的调控逻辑里:一个增强子如何影响两千个碱基之外的启动子,一段非编码区的突变如何改变基因表达——这些都不是靠"猜字母"能学到的。
2026 年 7 月 23 日,NVIDIA 在 Hugging Face 上放出了 JEPA-DNA 的三组模型权重,分别基于 DNABERT-2、Nucleotide Transformer v3 和 HyenaDNA。它不替换原有的语言模型目标,而是在其上叠加了一个 Joint-Embedding Predictive Architecture(JEPA)分支——让模型在猜字母的同时,也去预测被遮挡片段在潜在空间中的整体功能表示。训练目标从"这里缺了 A 还是 T"变成了"这段 DNA 在生物系统中意味着什么"。
技术博客 The New Stack 当天以"Nvidia's new DNA model learns what token prediction misses"为题做了报道;AI 论文策展人 @_akhaliq 第一时间转发;中文 AI 社区博主 Max For AI 连夜写了一条千字推文拆解技术逻辑,获数千阅读。
换一个训练目标,而不是换一个模型架构
JEPA-DNA 这套框架的核心设计理念可以用一句话概括:不改变模型架构,只改变模型被要求学习什么。
它的系统由三个模块组成:一个上下文编码器(Context Encoder)、一个目标编码器(Target Encoder)和一个预测头(Predictor Head)。上下文编码器就是原来的基因组基础模型(比如 DNABERT-2),目标编码器是其指数移动平均(EMA)副本,提供稳定的潜在表示作为训练目标。
训练时,输入 DNA 序列先经过跨度掩码(span-based masking),一次性遮住 20%-40% 的连续碱基——这比标准 MLM 的 15% 随机掩码激进得多。掩码后的序列进入上下文编码器,输出的 [CLS] token 嵌入被送入一个轻量级的 3 层 Transformer 预测头,预测头需要重建目标编码器对完整序列产生的 [CLS] 嵌入。
关键在这里:预测头并不是在猜 ATGC,而是在猜一个 768 维向量。这个向量的方向——而非大小——代表了一段 DNA 序列在模型学到的"功能空间"中的位置。
为了防止联合嵌入架构常见的表示坍缩(模型把所有输入都映射到同一个常数向量,损失为零但信息为零),JEPA-DNA 引入了 VICReg 框架中的方差损失和协方差损失:方差损失强制每个嵌入维度在批次内保持足够的方差;协方差损失惩罚不同维度之间的相关性,迫使模型学习多样化的特征。这些正则项与语言模型损失(MLM 或 NTP)和 JEPA 余弦相似度损失一起,构成了最终的四项复合优化目标。
一个容易被忽略但极其重要的设计选择是"二次掩码"(re-masking)。在上下文编码器输出之后,掩码位置的表示会被再次替换为 [MASK] token,再送入预测头。这确保了预测头无法从上下文编码器的输出中"窥见"被遮挡区域的信息,只能依赖全局 [CLS] 表示和可见区域的局部特征来推断目标的功能嵌入。
跨架构兼容,可直接接到已有模型上
JEPA-DNA 的另一个重要特性是模型无关(model-agnostic)。
它在论文中主要用 DNABERT-2(117M 参数,基于 BERT 的 Transformer 编码器)做了验证实验,但框架本身不依赖 Transformer。对于使用 NTP 目标的自回归解码器或状态空间模型(如 HyenaDNA),只需在序列末尾追加一个 [EOS] token 并用它替代 [CLS] 接收 JEPA 损失即可。这也是为什么 NVIDIA 此次一口气放出了三个 backbone 的版本。
更重要的是,JEPA-DNA 被设计为持续预训练(continual pre-training)框架,而非从头训练方案。你不需要重新训练一个 DNABERT-2——直接在已有的 checkpoint 上跑一轮 JEPA 微调,两阶段训练(先冻结编码器预热预测头 1000 步,再联合训练 5 个 epoch)即可完成。这意味着现有的基因组基础模型生态可以"零成本接入"这套方法。
训练数据来自 DNABERT-2 原始语料的子集:人类参考基因组(GRCh38)加上小鼠、斑马鱼、果蝇、线虫和拟南芥五种模式生物,共约 476 万条序列、76 亿碱基对。代码以 Apache 2.0 协议开源在 GitHub(NVIDIA-BioNeMo/JEPA-DNA),模型权重遵循 NVIDIA 非商业使用许可。
17 项任务,大多数超越纯语言模型
评估覆盖了 17 项基因组基准任务,分为线性探测(linear probing,冻结编码器,只训练分类头)和零样本推断两类。
线性探测结果最直观地反映了表示质量的提升。在 GUE 基准的三个标准任务上,JEPA-DNA 相比原始 DNABERT-2 均有提升:转录因子结合位点预测 AUROC 从 0.783 提升到 0.808(+3.2%),启动子预测从 0.916 提升到 0.925(+1.0%),剪接位点预测从 0.623 提升到 0.653(+4.8%)。
在更具临床意义的 VariantBenchmarks 任务组中,编码区致病性分类的 AUROC 从 0.569 提升到 0.603(+6.0%),甲基化 QTL 预测从 0.563 提升到 0.586(+4.1%)。值得注意的是,非编码区致病性分类(0.590 → 0.593,仅 +0.5%)和因果 eQTL 预测(0.704 → 0.705,+0.1%)的增益极为有限——这印证了前文提到的"非编码区的功能语义更难捕捉"这一社区普遍关切。
零样本评估可能更能说明问题。不经过任何任务特定微调,仅通过计算参考序列和变异序列嵌入的余弦相似度来打分,JEPA-DNA 在 8 项零样本任务中 6 项超越了基线。最显著的提升出现在 BEND 表达效应预测(AUROC +6.9%)和 TraitGym 孟德尔性状预测(AUROC +7.3%)上。Songlab ClinVar 临床致病性分类也有 +3.0% 的提升。
论文报告的总体均值是:线性探测任务平均 AUROC 增益约 2.6%,零样本平均 AUROC 增益约 4.1%。部分个体任务的 AUROC 增益可达 +8.0%。这意味着 JEPA 带来的功能语义提升在不同生物学场景下表现出较强的泛化性,并非某类任务的过拟合。
一支横跨产业与临床的 18 人作者团队
JEPA-DNA 论文的作者阵容折射出 NVIDIA 在 AI for Science 领域的布局方式。
两位共同通讯作者 Nati Daniel 和 Yoli Shavit 来自 NVIDIA 以色列的应用 AI 架构团队(Applied AI Architecture)。第一作者 Ariel Larey(h-index 5)同样来自该团队。论文还纳入了 NVIDIA 全球现场运营(Elay Dahan)和开发者项目(Amit Bleiweiss)的成员,显示出该项目在公司内部有跨职能的资源调配。
更具看点的是临床合作方的深度参与。以色列 Sheba 医学中心癌症研究中心(Cancer Research Center and Wohl Institute of Translational Medicine)派出了 6 位共同作者,其中包括 h-index 高达 28 的 Dan Dominissini。纽约 Mount Sinai 伊坎医学院的 Windreich AI 与人类健康系也有 6 位作者署名,涵盖 Nicole Bussola(h-index 12)等资深研究者。这种"产业出框架 + 顶级医院出场景与验证"的模式,在基因组 AI 领域正在成为标配。
论文于 2026 年 2 月 19 日首次提交 arXiv,目前已获 38 次引用,在基因组学预训练方法这一细分方向上属于中高关注度。GitHub 仓库于 4 月 16 日创建,5 月 18 日正式公开;Hugging Face 模型权重于 7 月 16 日上线——直到一周后被 HuggingPapers 和 @_akhaliq 注意到,才引发了这一轮社区关注。
同赛道对比:JEPA 不是第一个想法,但是第一个落地的
将联合嵌入预测架构引入生物学并非 JEPA-DNA 首创。2025 年的 GeneJEPA 已经在单细胞转录组学中验证了 JEPA 范式——但 GeneJEPA 处理的是基因表达向量(表格数据),而非原始 DNA 序列。JEPA-DNA 是 JEPA 首次被直接应用到基因组一级序列上,它要处理的是多尺度的序列信号:从单碱基的局部 motif 到跨越数万碱基的远程调控关系。
在基因组基础模型赛道中,DNABERT-2、Nucleotide Transformer、HyenaDNA 和 Evo2 是四个主要玩家。前三者正是 JEPA-DNA 此次选择的 backbone,而 Evo2(基于 StripedHyena,上下文窗口可达百万碱基级别)目前不在兼容列表中。JEPA-DNA 与这些模型并非竞争关系——它的定位是一层"功能接地"(latent grounding),可以叠加在任何一个现有 GFM 之上。
真正的差异化体现在哲学层面。现有的基因组预训练范式几乎全部继承自 NLP:把 DNA 当成一种"语言",把训练目标设为"预测下一个 token"。JEPA-DNA 的隐含前提是:基因组是一种结构化信号,token 层面只是其最浅的表层,功能信息编码在更高维的语义空间中。它绕过了"更大的词汇量、更长的上下文"这条所有 GFM 都在走的路,换了一个问题。
从"猜字母"到"建世界模型",基因组 AI 的范式正在松动
JEPA-DNA 不是一个革命性的模型——它的 backbone 是已有架构,它的训练数据是已有语料,它的性能提升按绝对值算并不惊人。但它做对了一件事:向社区证明,换一个训练目标比换一个架构更能带来功能语义的提升。
这个思路的源头可以追溯到 Meta 首席 AI 科学家、图灵奖得主 Yann LeCun 2022 年提出的 JEPA 愿景——"世界模型不应该浪费算力去预测每一个像素,而应该学习抽象表征"。三年后,这个愿景在基因组序列上第一次规模化落地。
The New Stack 在报道中写道:"JEPA-DNA represents a meaningful pivot in genomic AI, one that asks models to understand DNA rather than just memorize it."(JEPA-DNA 代表了基因组 AI 的一次有意义转向,它要求模型理解 DNA,而不仅仅是记住它。)
中文社区博主 Max For AI 的判断更为直接:"基因组 AI 正在从统计 DNA 序列,走向建立 DNA 的功能世界模型。未来模型需要理解的,可能不只是某个碱基接下来是什么,而是一次变异会如何沿着调控网络传递,最终影响细胞、疾病和生命。"
当社区把目光从"谁有更长的上下文窗口"移开,开始问"模型到底学到了什么"时,JEPA-DNA 的价值或许才真正开始显现。
参考链接:
- 论文:JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures —
- Hugging Face 模型:nvidia/NV-JEPA-DNA-DNABERT2 —
- GitHub 仓库:NVIDIA-BioNeMo/JEPA-DNA —
- The New Stack 报道:Nvidia's new DNA model learns what token prediction misses —
- 原始推文:
本文由 AREX Agent 新闻热点追踪引擎自动生成。如有事实性错误,请联系编辑。