AREX Feed Article
TissueFormer 把百万细胞的注意力计算砍到线性,Broad 三校联合交出全切片单细胞病理模型
2026 年 8 月 7 日,Broad Institute 旗下的 Eric and Wendy Schmidt Center TissueFormer——一个在整张病理全切片上实现单细胞分辨率的多模态基础模型。一篇上线 bioRxiv 的详细记录了模型架构与评估结果。
一张高分辨率 H&E 染色全切片可能包含超过一百万个细胞。对每一对细胞计算注意力,复杂度随细胞数平方级增长,此前这张算力账单一直让单细胞分辨率的全切片建模停留在理论层面。TissueFormer 通过重排 query-key-value 矩阵乘法的顺序,把精确的全对注意力计算从二次降到了线性——无需近似,也无需专用硬件。
一张 H&E 切片,读出基因表达
TissueFormer 最直接的价值,是让病理科现有的常规 H&E 切片充当"虚拟空间转录组学"的输入。空间转录组学能够在组织原位同时读取形态结构与分子活性,但实验成本高昂。TissueFormer 的做法是:在一组已配对的 H&E 图像与空间转录组数据上预训练,学到一个共享的细胞表征空间;推理时只输入 H&E 图像,就能输出每个细胞的基因表达预测。
预训练数据来自 HEST-1K 数据集,覆盖 1,200 余张组织切片,从中提取了约 1,700 万对图像-表达配对,统一基因面板包含超过 20,000 个人类蛋白质编码基因。数据横跨 21 个器官、两个物种、四种空间转录组平台(Visium、Visium HD、ST、Xenium)和 25 种癌症类型。
训练分两阶段走:先在 spot 分辨率的 Visium 数据上跑 1,000 个 epoch,再在细胞分辨率的 Xenium 数据上跑 200 个 epoch,全程使用 8 张 A6000 GPU,耗时约两天。
线性注意力的代价是零近似
TissueFormer 的架构核心是一款浅层全切片图 Transformer,由三个组件叠加:一个自项、一个在相邻细胞之间做度数归一化的局部传播,以及一个全局线性注意力模块。
图像侧使用冻结的 H-optimus-1 编码器,把每个以细胞核为中心的 224×224 像素 patch 嵌入为 1,536 维向量;表达侧则把细胞计数映射到可训练的基因嵌入表,再通过 MLP 处理。对比学习目标同时对齐同一张切片内所有图像-表达配对——这个损失函数本身也被设计为线性复杂度,规避了标准 InfoNCE 的二次比较开销。
全局注意力的线性化并不是近似。研究者重排了 QKV 矩阵乘法的计算顺序,使得每一对细胞仍然被精确计入,但总计算量从 O(n²) 降到了 O(n)。一张全切片的推理耗时平均 0.4 秒。
在留出的 Xenium 测试切片上,TissueFormer 在前 100 个最可变基因上的基因级均方误差平均为 0.396,在 100 个基因中的 97 个上排名第一,比第二名 H-optimus-1(0.463)提升 14.5%。跨器官 Spearman 相关性增益在训练见过的器官上为 4.2% 至 46.3%,在 16 个未见器官上为 13.7% 至 71.6%;小鼠到人类的迁移增益为 9.7% 至 74.0%。
在 36 张肺纤维化 Xenium 切片上,区域级疾病严重程度评分的 Spearman 相关系数达到 0.815,空间 niche 分类的平均 ROC-AUC 为 0.684,而基线方法接近随机水平。
不只是预测,更是分析工具
除开虚拟空间转录组学,TissueFormer 预训练出的细胞嵌入和全切片注意力图还支撑另一条分析路径。注意力矩阵记录了任意两个细胞之间的学习依赖强度,不论它们物理距离多远。
论文给出了两个病例级案例。在肺纤维化切片中,活化的纤维化成纤维细胞与 SPP1+ 巨噬细胞之间的注意力强度跟随疾病拟时序变化,并且与配体-受体共表达模式的迁移一致。在乳腺癌切片中,巨噬细胞与导管原位癌细胞之间的注意力图将肿瘤细胞划分为多个亚型,而这些亚型仅靠表达聚类无法区分。
换句话说,注意力图不再只是模型内部的灰色地带——它在这里变成了可以直接阅读的细胞通讯推断工具。
数字病理的 patch 时代正在被撬动
此前主导数字病理的基础模型,如 UNI 和 Prov-GigaPath,工作在 patch 层面:每个 patch 聚合了数百个细胞的信息。TissueFormer 把粒度下沉到单个细胞,使注意力图能够解析 patch 级模型平均掉的长程依赖。它在理念上更接近 MAD 等以细胞为中心的方案,但叠加了全切片全局上下文,而非限于局部邻域。
这项工作的预印本尚未经过同行评议,所有 benchmark 数字均为作者自报。模型依赖冻结的外部 patch 编码器,图像特征不是端到端学习的。代码以 MIT 许可证,但预训练权重通过 Google Drive 文件夹分发而非模型 hub。
一个容易被忽略的信号藏在团队声明里:线性注意力机制不绑定组织学或基因表达,"它有潜力迁移到任何受益于长程依赖建模的基础模型中。"如果这个迁移成立,TissueFormer 的贡献就不只是一篇病理学论文,而是一套可以重用的计算方案。