AREX Feed Article
微软 PRISM2 登 Nature Medicine:通用模型追平专科癌症检测
一个不做任务特化训练的病理 AI,在前列腺癌、乳腺癌和淋巴结转移检测上追平甚至超越了专门为此优化的临床产品。
8 月 4 日,,微软研究院与 Paige(现隶属于 Tempus)开发的病理基础模型 PRISM2 正式发表于《》。论文于 7 月 31 日在线发表,8 月 4 日微软官方博客与 Tempus 新闻稿同步公布。
Lee 写道:"我们不断发现,更通用的 AI 模型在专业任务上的表现优于专用模型。PRISM2 是又一个例证。"
论文显示,PRISM2 在没有任何任务特定训练的情况下,在前列腺癌、乳腺癌和乳腺淋巴结转移检测上达到或超过了 Paige 临床产品的表现。Paige Prostate 于 2021 年获 FDA De Novo 授权,首个获此认证的 AI 病理软件。
Peter Lee:通用 AI 又一次赢了专用 AI
Peter Lee 用一条推文直接定调。他写道:"We @MSFTResearch consistently find that more general AI models outperform specialized models, even on the specialized tasks."
Tempus 高级副总裁兼 AI 产品总经理 Razik Yousfi 在同日中称,PRISM2"在规模和多模态 AI 能力上都实现了真正的飞跃",能够"解锁临床级精度"。
PRISM2 的技术路线可追溯到 2024 年。初代 PRISM 在 ECCV 发表,将病理图像与报告文本对齐。PRISM2 在论文中被描述为引入"临床对话"作为训练信号——将 Phi-3 Mini 语言模型接入病理图像编码器,通过问答对而非单纯报告生成来监督学习。
从 Virchow2 到 PRISM2
PRISM2 的图像编码前端是 ——微软与 Paige 此前联合发布的组织病理学瓦片级基础模型。
2024 年,初代 PRISM 在 ECCV 发表,首次用病理报告文本监督幻灯片级表征学习。2025 年 6 月,PRISM2 上线 arXiv。2026 年 7 月 31 日论文在 Nature Medicine 在线发表,8 月 4 日同步对外公布。
论文明确指出,Paige Prostate 拥有 FDA De Novo 批准,Paige BLN 拥有 FDA Breakthrough Device 认定,三款临床产品均具备 CE-IVD 和 UKCA 标志。
核心不是看图,是"读懂"病理报告怎么写
PRISM2 的根本差异在于训练信号。
对话式监督替代了标签。研究团队将约 70 万份病理报告,通过 GPT-4o 转化为 1400 万组问答对(是/否、多选、开放题)。论文强调,对话不是产品功能,而是监督信号——目标是迫使模型学到语义上可迁移的幻灯片表征。
双嵌入架构。PRISM2 共 44 亿参数:6 亿参数的 Perceiver 编码器输出"基础嵌入"(2560 维),适用于生物标志物预测、生存分析等任务;38 亿参数的 Phi-3 Mini 解码器输出"诊断嵌入"(3072 维),专精癌症检测与分型。基础嵌入在各项线性探测中从未统计显著落后于此前任何基础模型(P<0.05)。
不加训练打平临床产品。在前列腺癌检测上,PRISM2 的提示式推理与 Paige Prostate 平衡准确率持平;乳腺癌与 Paige Breast 持平;乳腺淋巴结转移超越 Paige BLN。经微调后,结直肠癌无复发生存预测 C-index 达 0.809,超过从头训练的专用模型的 0.773。
论文也报告了局限:所有训练切片均在纪念斯隆·凯特琳癌症中心扫描;模型没有跨瓦片位置编码,全局空间推理能力有限。经病理学家对 50 例留出标本的审查,PRISM2 在问答任务上的错误率为 7%-11%,开放式诊断摘要则更容易出现幻觉和遗漏。
当病理 AI 从"单任务选手"变成"通才"
此前,计算病理学的主流范式是"一个任务、一个模型"。即便有瓦片级基础模型做编码,下游仍需为每个任务单独设计聚合器和训练流程。
PRISM2 用一个模型覆盖了诊断分类、生物标志物预测和生存分析三类任务,且在不做任务特定微调的情况下达到临床级性能。论文称其为"首个证据"——通用模型可以"在不经额外训练的情况下达到获授权临床专用模型的性能"。
已在 Hugging Face 公开,采用 CC-BY-NC-ND 4.0 许可,仅限非商业学术研究,临床使用被明确禁止。
社交媒体上, 称此举"只是冰山一角"。观察者 则指出"学术性能领先不会自动转化为收入,仍需通过产品整合、监管路径和商业合同完成变现"。
PRISM2 打开的是一条技术路线,不是一个产品
PRISM2 被明确禁止用于临床。它的价值在于验证了一条技术假设:用临床文本作为训练信号,可以产出超越单任务范式的通用病理表征。
这条路径现在有了 Nature Medicine 的同行评审记录。论文作者写道,PRISM2 是"首个证据"——通用模型可以在不做额外训练的情况下达到获授权专用模型的性能水平。