AREX Feed Article
微软研究院发布 CARE-X:胸部 X 光 VLM 统一报告生成、校准预测与测量工具
2026 年 8 月 11 日,正式公布了 CARE-X,一个面向胸部 X 光解读的统一视觉语言模型。CARE-X 在 ReXVQA 基准上达到 94.0% 的准确率,比此前最优公开模型高出 6 个百分点。更重要的是,它在一个模型内同时提供了自由文本报告生成和带置信度的结构化诊断预测——这是此前放射学 VLMs 始终未能兼顾的两件事。
在另一项配套实验中,团队将 Qwen3-VL-4B-Instruct 与确定性测量工具组合,让模型在推理时交替进行图像理解和精确计算。这套工具增强方案在五个测量依赖型诊断(如心脏扩大、纵隔增宽、主动脉扩张)上将平均 F1 提升了 43.6 个百分点,其中主动脉降部扩张的 F1 从 28.57 跳至 100.00。
辅助分类头与定位头共享语言主干,让模型学会输出置信度
CARE-X 的架构基于 SigLIP2-so400M 视觉编码器和 Phi-4-mini-instruct(3.8B)语言模型,中间以轻量适配器连接。与纯生成式 VLM 不同,CARE-X 在共享的语言主干上附加了任务专用的辅助头——focal-loss 分类头和 composite-loss 定位头——与语言建模目标联合训练。
分类头输出校准后的 P(Yes)/P(No) 分数,定位头给出边界框坐标与置信度。二者不是独立训练的附属品,而是与生成式语言模型共享表征并互相增强。论文中的关键发现是:辅助监督不仅提供了可调节阈值的结构化预测,还显著改善了同一任务上的生成质量。
在 Chest ImaGenome 的解剖定位任务上,辅助定位头将 mAP 提升了 28.2 个百分点,mIoU 提升 6.2 个百分点。经过 DAPO 强化学习后,CARE-X 的生成式空间解码(0.868 mAP)超过了 SFT 阶段的专用检测头(0.865 mAP)——奖励对齐训练可以让自回归生成在定位精度上追平结构化预测。
分类头的实用价值在于可调节的决策阈值。在 Chest ImaGenome 的异常分类中,将阈值从 0.5 调至 0.6,灵敏度从 0.943 降至 0.855,但阳性预测值(PPV)从 0.885 升至 0.927。放射科医生可以在同一模型上,根据筛查或确诊的不同场景切换工作点——纯生成式架构做不到这一点。
这些细节来自微软研究院 8 月 11 日发布的及配套(8 月 4 日提交至 arXiv)。
用计算代替目测:五个测量依赖型诊断的 F1 平均提升 43.6 个百分点
有些放射学发现不能靠视觉模式判断。心脏扩大需要测量心胸比,纵隔增宽依赖精确的宽度计算——这些量的判断如果只靠模型「目测」,误差很大。
CARE-X 团队为此设计了一套工具增强推理管线:Qwen3-VL-4B-Instruct 作为视觉推理核心,全程保持对胸片的视觉访问,按需调用确定性测量工具识别解剖标志、计算测量值、对照诊断阈值。整个过程是一个多轮推理循环——模型观察图像、发出工具调用、接收精确计算结果、综合视觉上下文后做出诊断。
这套方案不需要任何任务专用训练,却在五项测量依赖型条件上显著优于纯感知推理:
- 心脏扩大:F1 从 74.56 升至 96.00(+21.4 pp)
- 纵隔增宽:F1 从 72.63 升至 97.47(+24.8 pp)
- 主动脉结扩大:F1 从 60.31 升至 99.76(+39.5 pp)
- 升主动脉扩张:F1 从 39.33 升至 100.00(+60.7 pp)
- 降主动脉扩张:F1 从 28.57 升至 100.00(+71.4 pp)
在一项针对 CT 确认的扩大症队列(122 例阳性)回顾性研究中,工具增强推理的召回率达到 94.26%,比最优纯感知基线再高出 10.65 个百分点。另一项被 2026 年 EACTS 会议接收的研究显示,在轻度主动脉扩张病例中,测量驱动的方法检出了 43 例 CT 确认阳性中的 40 例(93% 灵敏度),而初次放射学读片仅识别出 5 例(12%)。
印度医院真实数据验证:从 ICU 罕见病理到 CT 确认的心脏扩大
为评估研究环境下的真实世界泛化能力,团队与印度 Narayana Health 医院合作,在两项回顾性研究中检验 CARE-X。
第一项研究使用 1,047 张去标识胸片,标注了五种罕见高危急症——骨折、纵隔移位、气腹、气胸、管路异常放置——每种病理的流行率仅 2.6% 到 5.2%。CARE-X 在其中三种病理上取得了最高灵敏度:气腹(0.89)、纵隔移位(0.83)、管路异常放置(0.66)。相比之下,CheXOne 在气腹上灵敏度为 0.67,MedGemma 在管路异常放置上仅 0.18。
第二项研究专门针对 CT 确认的测量依赖型扩大症(主动脉扩张、肺门肿块、肺动脉扩张等),在 122 例阳性门诊队列中,工具增强推理的召回率达 94.26%。
这些研究均使用去标识回顾性数据,经伦理审查和数据使用审批,Narayana Health 已批准发表相关结果。
胸部 X 光 AI 一直缺三样东西:置信度、临床优化目标和测量能力
CARE-X 的定位不是又一个报告生成模型。微软研究院在博客中明确指出当前放射学 VLMs 存在三个缺口:
第一,生成式 VLM 用自由文本做诊断,但没有校准后的置信度分数。临床医生无法根据不同场景调整灵敏度-特异度平衡。
第二,标准交叉熵损失对所有 token 级错误一视同仁。一个坐标错误和一个无害措辞变化受到同样的惩罚;漏掉一个致命发现和省略一条次要观察,训练代价相同。模型没有针对临床后果进行优化。
第三,部分放射学发现依赖精确测量而非视觉识别。模型或许能识别胸片是 AP 位还是 PA 位拍摄,但判断心脏扩大需要测量心脏宽度和胸廓宽度并计算比值——这些量应当测量和计算,而非目测估算。
这三个缺口指向同一个方向:放射学 AI 需要的不是一个更流畅的生成模型,而是一个能覆盖多种任务、输出结构化预测、针对临床质量优化、并在需要精确测量的地方引入定量工具的系统。CARE-X 是朝这个方向的一次研究探索。
研究模型,不是医疗器械
CARE-X 目前是一个研究模型,不是微软的产品,也不是医疗器械。它没有经过任何监管机构的审批或批准,不用于临床诊断、筛查或患者护理。博客中描述的均为回顾性研究结果,不构成对安全性、有效性或临床适用性的任何确认。
团队也坦承了当前研究的局限。CT 确认扩大症的研究只衡量了召回率——即真阳性的检出比例。但召回率仅反映诊断性能的一个维度:一个把所有片子都标为阳性的模型也能拿到完美的召回率,却毫无实用价值。微软研究院表示,包含 CT 确认阴性队列的扩展研究正在进行中,初步结果令人鼓舞。
即便如此,CARE-X 的研究方向获得了外部认可:基于该技术的 AI 主动脉扩张筛查应用入围了 2026 年世界医院大会(World Hospital Congress)IHF 创新中心展示环节的最终名单。