AREX Feed Article
阿里达摩院开源 DAMO RADAR:论文报告 146 项腹部 CT 发现平均 AUC 0.913,成果刊登于《科学》
9 月 18 日,阿里巴巴达摩院宣布开源通用医学影像模型 DAMO RADAR。据报道,该模型读取腹部增强 CT,覆盖 18 个腹部器官,可识别包括恶性肿瘤在内的近 150 种腹部病症;研究团队评估了其中的 146 项。
相关论文《An expert-level generalist AI for abdominal CT diagnosis》9 月 17 日刊登于。《南华早报》报道称,在近 4 万例真实世界检查中,DAMO RADAR 在 146 项临床发现上的平均 AUC(曲线下面积)为 0.913;AUC 取 1.0 表示能完美区分患者与正常人。研究团队把 RADAR 称为「全球首个专家级通用医学影像模型」,这是团队自己的定位。
另外两组验证:8 家外部中心与 27,000 例急诊
DAMO RADAR 的全称是 Rapid Abdominal Diagnosis with AI and Radiology,即面向腹部快速诊断的 AI 模型。显示,除内部评估外,RADAR 还在更多临床场景中受测:在 8 家外部中心的队列上,AUC 为 0.895;在超过 27,000 例急诊 CT 上,AUC 为 0.904(急诊病例不在训练目标之内)。论文作者称,模型在不同器官、病种乃至不常见发现上的表现仍然稳定。
作为对照,论文称表现最好的同类视觉语言模型平均 AUC 为 0.776。
据报道,研究团队还把标准提高到病理金标准:在肝癌、胰腺癌、胃癌、肠癌四项诊断上,以病理活检结果为基准核验影像判断,RADAR 的 AUC 为 0.891~0.984。
不靠逐片标注:把 CT 拆成器官,再与报告对齐
RADAR 是视觉-语言模型:医院里天然存在大量 CT 影像与配套诊断报告,模型直接学习影像与报告文本的对应关系,不需要医生逐片标注。据 EurekAlert 刊出的论文介绍,训练数据包含 424,911 例检查、150 万对图像-文本数据和超过 1,500 万对解剖结构级配对。
据报道,达摩院高级算法专家张建鹏表示,CT 数据信号稀疏,常规的视觉-语言学习效果不佳;这项研究在国际上首次采用「器官级细粒度对齐」策略,将 CT 构建为三维数据并分解为解剖单元,在器官层面实现影像与报告文本的精确对齐,再通过自适应对比建模动态调整,无需额外人工标注即可完成诊断。
据量子位报道,团队最初把整卷 CT 与整份报告直接对齐时,模型只能学到粗糙的统计特征;改成器官级对齐后,才建立起「哪个器官对应哪段描述」的关联。自适应对比建模按医学知识调整样本距离:两个健康的肝脏不必被严格区分,同一种病的两个病例则应该放在一起学习。论文中的 Scaling Law(规模定律)曲线显示,随着数据增加,模型性能仍在上升,没有饱和迹象。
与 26 名放射科医生的人机对比
据《中国科学报》报道,论文中的人机对比试验里,RADAR 与 26 名来自多家医院的放射科医生同场评估,其平均准确率超过了其中 23 名医生。据量子位报道,这批医生来自 14 家医院,在同一批病例上独立诊断,RADAR 只稍弱于余下 3 名资深医生。
在人机协同测试中,医生在 AI 提示下诊断敏感性(防漏诊能力)提高了约 10%,阅片用时减少 30% 以上,低年资医生达到高年资医生的诊断水平。
浙江大学医学院附属第一医院(浙大一院)放射科主任肖文波对《中国科学报》表示:「腹部 CT 诊断是最具挑战的影像科任务,长期缺乏一种通用的辅助诊断模型。」她同时称,DAMO RADAR 实现了腹部多器官、多病种的高准确检出,能像「导航」一样为医生提供诊断支持。
开源清单:模型、代码与技术框架
以 Apache 2.0 许可开源,附训练、推理和预处理三份操作文档;预训练权重与辅助数据托管在 ,仓库提供两个下载脚本。
达摩院资深算法专家张灵对《中国科学报》表示,该模型原生具备良好的泛化能力和通用性,其研究范式不仅可用于腹部 CT 的多病种识别,还有望应用于其他形态的医疗影像。据量子位报道,MRI(磁共振成像)、PET(正电子发射断层扫描)、超声都是团队提出的迁移目标,前提是有相应数据;模型、代码和技术框架已全部公开,其他团队可以复现、改进或迁移到自己的场景。
从专病模型到全腹部模型
RADAR 之前,达摩院的医疗 AI 走的是专病路线,用 AI 识别 CT 中肉眼难以识别的早期癌灶,先后在胰腺癌、胃癌、肠癌等消化系统肿瘤筛查和主动脉夹层预警上取得突破。据《中国科学报》报道,三年内,达摩院的医疗 AI 成果已发表 5 篇《自然·医学》论文和 10 多篇其他顶刊论文。
专病模型的瓶颈在于「一病一模」:训练依赖大量人工标注,成本高、耗时长、通用性差;真实病例里,一套腹部 CT 往往同时涉及多个器官和多种病变。据量子位报道,达摩院高级算法专家张建鹏说,一个病种啃下来至少两三年,人类疾病却有成千上万种。
RADAR 因此换了路线:达摩院与浙大一院等机构联合研发,用一个模型覆盖整个腹部。据量子位报道,浙大一院放射科主任肖文波介绍,年轻医生最怕被分到腹部组:肝胆胰脾肠全挤在一起,软组织密度接近,只能靠肉眼对密度差的敏感度找病灶。
阅片室里的下一步:部署与带教
据量子位报道,肖文波的科室有 300 多人、每天处理几千份片子;写一份腹部 CT 报告,即使中高年资医生也至少要 20 分钟。她说:「第一次看到 RADAR 的验证数据,我都不敢相信。」科室里不少人希望尽快部署,其他医院的医生也在打听。
据量子位报道,还有一层隐忧关乎年轻医生的成长:如果依赖 AI,他们写出的报告可能直接达到主任级水平,自己的影像逻辑训练反而会被截断。肖文波的想法是让 RADAR 同时充当「一对一带教工具」——年轻医生按常规写完报告,再用 AI 做一次自查,哪个病灶漏了、哪个判断偏了,当场就能发现。