AREX Feed Article
微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash:GigaPath-Flash 以约五十分之一算力保留 97% 性能
北京时间 9 月 1 日凌晨(UTC 时间 8 月 31 日),微软研究院官方账号 @MSFTResearch 发布,宣布推出两款病理基础模型(pathology foundation model)GigaPath-Flash 与 GigaTIME-Flash。推文称,两款模型「在削减计算需求的同时保持强劲性能,为更大规模的研究和更广泛的探索打开大门」。
与推文同一天上线的给出量化口径:GigaPath-Flash 用约五十分之一的算力,保留了原版 GigaPath 97% 的预测性能;GigaTIME-Flash 比原版快约 6 倍、显存占用少约 8 倍,预测质量不降反升。两款模型承接微软此前的病理模型线:GigaPath(2024 年发表于 Nature)做整张切片(whole-slide)的表征学习,GigaTIME(2026 年发表于 Cell)把常规 H&E(苏木精-伊红)染色切片翻译成虚拟空间蛋白组图谱;Flash 版本压缩了这两条线的计算成本。
十亿参数蒸馏进 2,200 万参数的小骨干
两个 Flash 模型共享同一条压缩骨干。官方博客介绍,GigaPath-Flash 由一个 2,200 万参数(22M)的 ViT-S 切片块编码器和一个 2,100 万参数(21M)的 LongNet 全切片编码器组成。切片块编码器从原版 GigaPath 的十亿参数(ViT-g)教师模型蒸馏而来,把十亿参数模型的表征能力搬进小一个数量级的骨干;LongNet 编码器通过 dilated attention(膨胀注意力)整合整张切片全部切片块的表征,计算量随切片块数量线性增长。
GigaTIME-Flash 直接复用这条编码器,替换掉原版 GigaTIME 的 CNN(U-Net++)骨干,配上一个轻量卷积解码器做 H&E 到多重免疫荧光(multiplex immunofluorescence,mIF)的翻译,并用 LoRA 适配器微调,预训练编码器权重基本冻结。按口径,整个 GigaTIME-Flash 约 2,380 万参数(23,806,559)。
PANDA 与 EBRAINS:两个切片级基准上的账
论文在 PANDA(前列腺活检分级,以二次加权卡帕 QWK 衡量)和 EBRAINS(脑肿瘤亚型分类,以平衡准确率衡量)两个公开切片级基准上对比 GigaPath-Flash 与原版:PANDA QWK 0.947 对 0.965,EBRAINS 平衡准确率 0.705 对 0.741,平均分 0.8260 对 0.8530。算力上,每张切片的 TFLOPs 从 14,367.3 降到 290.3。官方博客据此称,GigaPath-Flash 是全切片预训练模型中推理成本最低的一个,与 GigaPath 相差在 3% 以内;论文还称,它在切片级分类基准上超过了参数量最多达 31 倍的其他模型,所需算力少 37 倍。
GigaTIME-Flash 的效率账同样具体:每个切片块 14.9 GFLOPs,对原版 69.1 GFLOPs;batch size 128 时,GigaTIME-Flash 吞吐 1,679.2 块/秒,原版约 390 块/秒;峰值显存 2.16 GB,原版 16.68 GB。质量上,它在 GigaTIME 测试集和脑、乳腺、结肠、肺四个分布外(out-of-distribution)队列上全部持平或超过原版,分布外队列的提升更明显,官方认为这提示基础模型骨干改善了向未见组织的泛化。
这些数字来自作者自己的评估。论文在 limitations 一节写明:切片级评估只覆盖两个分类基准,使用自定义数据划分、每任务单次运行,结果只能视为其协议内的受控对比,不宜与其他协议下报告的分数直接比较。
省下的算力要撑起什么:百万张切片的队列
省算力的必要性来自数据规模本身:一张全切片图像常常超过一个 G 像素,基础模型跑一张切片就要处理数千个切片块;研究问题涉及数万患者时,计算成本迅速膨胀。而人群规模(population-scale)的发现不是跑一次模型,需要反复进行特征提取、统计检验、假设验证的循环,计算成本直接限制能研究的患者数、数据集、任务和假设数。
GigaTIME 本身展示了这种研究的量级:官方称它在 4,000 万个细胞的配对 H&E 与 mIF 数据上训练,把 H&E 翻译成 21 个蛋白通道的虚拟空间蛋白组图,应用于 14,000 多名癌症患者,发现了 1,200 多个免疫细胞状态与临床生物标志物之间的显著关联。博客给出了单张 A100 GPU 上的估算(按每张切片约 1 万个切片块、batch 128):生成 100 万张切片的虚拟 mIF,GigaTIME-Flash 约需 70 个 GPU 天,原版约 300 个 GPU 天;10 万张切片则是约 7 个 GPU 天对 30 个 GPU 天。官方写道,对单张切片,这些差异只是缩短运行时间;对上万张切片,「它们决定实验是否可行」。
Apache 2.0 开源与「早期研究发布」的边界
两个模型的权重托管在 HuggingFace: 与 ,许可为 Apache 2.0,下载需先同意条款。从页面时间戳看,技术报告 7 月 20 日已上传 arXiv(编号 2607.18218),两个模型页面 7 月 22 日上线,8 月 31 日的博客与推文是官方正式宣布。这项工作由微软研究院、华盛顿大学与 Providence 医疗系统合作完成。
博客写明两款模型是研究模型,「未针对临床使用(包括诊断、预后、治疗选择或其他患者护理决策)进行验证」,性能会随数据集、扫描仪、机构、人群和用例而变化;模型卡把预期用途限定为研究与复现,任何部署场景(包括商业用途)都不在范围内。博客同时自述这是「早期研究发布」:当前评估只覆盖有限的基准与队列,跨任务、扫描仪和患者人群的更广验证仍待进行,官方欢迎社区评估,「同样关心模型在哪里表现好、在哪里失效」。论文也承认,窗口级 Pearson 相关指标不能证明细胞级精度或临床效用;下游临床应用需要多机构、前瞻性的验证。