Skip to content

认识DAMO RADAR —— 登上Science的通用医疗影像AI,一次腹部CT看穿146种病变

先说一句让我这种外行背上发凉的话。

“你问问年轻医生,他们最怕进的科室组别,就是腹部影像组。”——浙大一院放射科主任肖文波,从业 30 余年。

一份腹部增强 CT,几百张薄层片子,覆盖消化、泌尿等多个系统的数十个器官。器官之间互相挤压重叠,软组织密度彼此接近,病灶信号又常常细微得近乎挑衅。即便中高级医生,写完一份报告也要 20 到 30 分钟

而另一边是这么个数字:过去十年医疗影像 AI 走的是“一病一模”的路线,一个模型只治一种病,每训练一个病种通常要花 2 年,训练完还完全无法泛化到别的病种上。肺结节一套模型,胰腺癌一套模型,糖网又是另一套——医院采购的时候,等于为每一种疾病单独付一次钱。

然后 2026 年 9 月 18 日凌晨,阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构,把 DAMO RADAR 发在了《Science》上(卷 393,期 6817,文章号 eaec6129,DOI: 10.1126/science.aec6129),同一天代码和权重全部开源

一个模型,一次通过,146 种病变、18 个器官,全包了。

什么是 DAMO RADAR

DAMO RADAR 是一个面向腹部增强 CT 的通用医学视觉语言模型(VLM)。它的自我定位很直白——官方标题就是:An Expert-Level Generalist AI for Abdominal CT Diagnosis(用于腹部 CT 诊断的专家级通用 AI)。

拆开三个关键词理解:

  • 通用型(Generalist):不是某个病的检测器,一个权重文件干 146 件事,包括肝癌、胰腺癌、胃癌、结直肠癌这类高致死率的恶性肿瘤。
  • 视觉语言(Vision-Language):不看人工勾画的病灶框,而是学「CT 影像 ↔ 放射科报告文本」之间的对应关系。报告是医院本来就有的,一张不用额外标注。
  • 腹部增强 CT:注意边界——目前只针对打了造影剂的腹部 CT。平扫、其他期相、其他部位、儿童病例,统统在已验证范围之外。

训练规模是这套东西最唬人的地方:424,911 例增强腹部 CT 检查,拆出 1500 万+ 器官级(anatomy-aware)图文对。这个数据量级,过去只在大语言模型领域出现过,现在被塞进了三维体数据。

达摩院说这是“全世界第一个达到专家水平的通用医疗影像 AI 模型”。这句话是他们自己说的,但底下确实压着一篇 Science 和一组很难反驳的数字。

它到底强在哪

一、器官级细粒度对齐:这次的关键不是模型更大,是喂得更准

CT 数据有个天然麻烦:信号极度稀疏。一张腹部增强 CT 里,绝大多数体素都是正常组织,病灶往往只占极小一块,还可能小得可怜。

常规视觉语言模型的做法是「整张图 ↔ 整份报告」对齐——在自然图像配字幕的场景没问题,搁 CT 上,这个监督信号粗得像用渔网捞针:报告里写“右肝叶见约 1.5cm 低密度灶”,这句话到底对应图像里哪个方块?模型根本定位不到。

达摩院的解法是器官级细粒度对齐(organ-level fine-grained alignment),论文里强调这是国际首次:

  1. 先把三维 CT 体数据按解剖结构拆成一个个独立的器官级单元——肝、肾、脾、肠、胰……各自切出来;
  2. 再让每个解剖单元单独对应报告里描述它的那几句话
  3. 最后叠一层自适应对比建模(adaptive contrastive modeling),动态吸收不同医生的描述习惯差异。

第三步看着不起眼,其实很实用。同一个“轻度肝肿大”,不同的放射科医生会写成“肝稍大”“肝脏体积增大,轻度”“hepatomegaly, mild”——朴素的对比学习认了其中一种就认不出另一种,自适应策略把这些表述的变体都纳进来,且完全不需要人工去归一化报告文本。

结果就是:整个训练流程除医院本来就在写的报告外,没有依赖任何额外人工标注。

这一点比那几个漂亮的 AUC 数字更值钱——它意味着这条路可以被复制到别的影像场景,而不用再组织一队专科医生去画框画到地老天荒。

二、性能:0.913 是什么水平

AUC(曲线下面积)衡量的是“把病人和正常人区分开”的能力,1.0 是完美,0.5 等于瞎猜,临床上一般认为 0.9 以上属于 outstanding(优秀)

DAMO RADAR 的成绩单:

场景AUC备注
近 4 万例真实世界检查,146 种病变0.913全部评估病变的平均值
同类最强通用视觉语言模型0.776这是对照组
未训练过的急腹症场景,2.7 万+ 例0.904纯泛化测试
8 家外部独立中心验证0.895换了新机器、新协议、新人群
跨人群队列,不微调直接上0.883
肝 / 胰 / 胃 / 结直肠癌(病理活检为金标准)0.891 ~ 0.984

那栏 0.776 是我认为整篇论文里最有杀伤力的数字。它说明通用路线和“调教好的竞品通用 VLM”之间,差距不是一点点,而是整整 13.7 个百分点。如果经得起第三方复现,靠单病种工具按次收费的那套商业模式会很难受。

三、和真人医生正面刚:赢了 23 个

这部分是论文里最容易被标题党夸大、也最需要看清楚的一段。

研究团队组织了 14 家机构、26 名影像科医生(11 名资深 + 15 名初级),医生和模型分别对 300 名患者的 CT 独立判读。结果:模型的平均准确率超过了其中 23 名医生

注意措辞——是平均准确率的比较,不是逐例对打的全胜战绩;它没有赢下另外那 3 个人,而且这不是临床结局的随机对照试验。

更重要的其实是第二组数据:把 RADAR 当作**第二阅片人(second reader)**给医生用,效果是——

  • 病变检出敏感度提升约 10%(防漏诊)
  • 阅片耗时缩短 30% 以上(浙大一院口径是 30.7%)
  • 低年资医生在有 AI 辅助时,达到了高年资医生独立阅片的水平

最后这条的分量最重。如果成立,RADAR 就不只是一个诊断工具,而是个培训与人力杠杆——基层医院阅片量有限、医生经验相对不足,恰恰是腹部 CT 最难搞的场景。

真实世界,它解决了什么问题

痛点一:放射科要没人了

有研究预测到 2050 年全球将短缺 75 万名放射科医生。而影像科是全医院里极少数“工作量被设备直接绑死”的科室——机器一响片子就来,人的产出上限却卡在读片速度上。一个能把读片时间砍掉三成、同时把漏诊率往下压 10 个百分点的工具,正好打在两个最痛的点上。

浙大一院放射科主任医师肖文波的说法很实在:

这填补了临床通用辅助诊断工具的空白,如同智能阅片导航。

痛点二:凌晨三点的急诊 CT

急腹症(急性阑尾炎、肠梗阻、内脏穿孔这类要急诊手术的)AUC 做到 0.904,而且模型压根没在急诊数据上训练过。这对基层医院、夜班、缺乏腹部亚专科医生的地区意义不小——急诊 CT 往往就是凌晨三点由值班医生独自判读。

痛点三:打碎“按病种收费”

医院过去要买一堆单病种 AI 盒子,每一个单独付费、覆盖一个病种。现在采购方可以拿着一篇 Science 和八家外部中心的 0.895 验证数据去谈续约,一个字都不用部署。其中的性价比变化,那些卖单病种工具的厂商大概已经感受到了。

初体验:代码怎么跑起来

先说实话:这不是个能在你笔记本上五分钟跑通的东西。它是个研究性质的基础模型,checkpoint 和推理都以 DICOM/NIfTI 三维体数据为核心,得有一张说得过去的计算卡。

好在开源得非常干净。仓库在 github.com/alibaba-damo-academy/damo-radar,权重托管在 Hugging Face 的 radar-generalist 组织下。

第 1 步:拉代码、建环境

bash
git clone https://github.com/alibaba-damo-academy/damo-radar.git
cd damo-radar

conda create -n radar python=3.10
conda activate radar
pip install -r requirements.txt

Python 版本官方指定 3.10,别自作主张用别的版本去踩依赖坑。

第 2 步:下载权重和辅助数据

官方在 download_scripts/ 下给了两个脚本,直接跑就行,不用自己去 HF 页面上一个个点:

bash
cd download_scripts

# 拉模型权重和支持文件,落到 ckpt/
python download_checkpoints.py

# 拉辅助数据(预处理好的 mask)
python download_auxiliary_data.py

仓库里贴心地放了 demo 用的 nifti 文件预测结果的 CSV,所以哪怕你手上没有临床数据,也能先把流程跑通看一眼输出长什么样。

第 3 步:照着官方文档往下走

仓库 docs/ 目录下三份文档,分工清楚:

  • INFERENCE.md —— 两条路线:① 用预训练 checkpoint 在 RAD-CT 上跑推理 demo;② 在外部 MERLIN 测试集上做推理与评估
  • TRAINING.md —— 从零训练 RADAR / RADAR+,或在 MERLIN 数据上做微调
  • PREPROCESS.md —— 影像/mask 与报告文本的预处理,支持跑 MERLIN 或你自己的数据

强烈建议先走 INFERENCE.md 的第一条 demo 路线。第一次看到一张腹部 CT 被拆成十几个器官单元、然后每个单元吐出一串带概率的病变提示时,那个震撼程度远超看论文里的表格。

上手前必须知道的三件事

这部分比上面的性能更重要,很多转载稿都没写。

1. 许可证是拆开的:代码 Apache 2.0,权重 CC BY-NC-SA 4.0

代码在 GitHub 上以 Apache 2.0 发布,商用没问题。但模型权重单独采用 CC BY-NC-SA 4.0——允许研究和非商业使用,商业部署必须另外谈许可,而且阿里没公布这个许可的价格。

换句话说:高校课题组免费下载,要靠它赚钱问诊的医院另行付费。

这套安排其实很精明:把“贵的是训练过程”的那部分——权重——留在非商用协议里,开源当天就能换来全球学术团队的自愿复现、引用和测试。开源在这里不是慈善,是分发策略。

2. 没有任何监管审批

已发布的材料里,没有任何迹象表明它拿过 FDA 或其他司法辖区的 clearance。它不是合规的临床产品,是 research tool。别把它直接接进医院的诊断流程。

3. 0.913 是个平均值,而且人群有边界

146 个病变取平均,天生会掩盖某些单项的疲软——临床风险最高的病种如果恰好落在均值以下的尾巴里,那才是问题。另外验证人群以中国人群为主,尚未发表针对非亚洲人群的独立验证,西方医院最好把这个数字当作上限而非预期。别忘了只验证过增强腹部 CT。

对了,仓库里接地气的一点:它站在 LAVIS(BSD-3)、nnU-Net(Apache 2.0)、MONAI(Apache 2.0)、3D-ResNets-PyTorch(MIT)这几个项目的肩膀上,第三方许可原文都留在 THIRD_PARTY_LICENSES.md 里;代码还在 Zenodo 上做了归档存档(记录号 21271172)。

进阶

达摩院已经放话,这套「器官级细粒度对齐」的训练范式不局限于腹部 CT,下一步会往胸部 CT 和脑部 MRI 迁移——不过那目前还只是计划,不是结果。

真正值得盯的是三件事:独立实验室在自家机器和人群上能不能复现 0.913;有没有前瞻性临床试验把「模型辅助阅片」和「患者结局」直接挂钩;以及监管审批什么时候真正递交。

作为一个常年追国产开源项目、见过太多“发论文即巅峰”的人,这一天值得记一笔:代码 Apache 2.0、权重当天开放、论文当天上线 Science,一篇就否定了过去十年“一病一模”的路径依赖。看多了 PPT 式开源,我对这种当天就把东西交出来的做法,始终抱有好感。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区