认识DAMO RADAR —— 登上Science的通用医疗影像AI,一次腹部CT看穿146种病变
先说一句让我这种外行背上发凉的话。
“你问问年轻医生,他们最怕进的科室组别,就是腹部影像组。”——浙大一院放射科主任肖文波,从业 30 余年。
一份腹部增强 CT,几百张薄层片子,覆盖消化、泌尿等多个系统的数十个器官。器官之间互相挤压重叠,软组织密度彼此接近,病灶信号又常常细微得近乎挑衅。即便中高级医生,写完一份报告也要 20 到 30 分钟。
而另一边是这么个数字:过去十年医疗影像 AI 走的是“一病一模”的路线,一个模型只治一种病,每训练一个病种通常要花 2 年,训练完还完全无法泛化到别的病种上。肺结节一套模型,胰腺癌一套模型,糖网又是另一套——医院采购的时候,等于为每一种疾病单独付一次钱。
然后 2026 年 9 月 18 日凌晨,阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构,把 DAMO RADAR 发在了《Science》上(卷 393,期 6817,文章号 eaec6129,DOI: 10.1126/science.aec6129),同一天代码和权重全部开源。
一个模型,一次通过,146 种病变、18 个器官,全包了。
什么是 DAMO RADAR
DAMO RADAR 是一个面向腹部增强 CT 的通用医学视觉语言模型(VLM)。它的自我定位很直白——官方标题就是:An Expert-Level Generalist AI for Abdominal CT Diagnosis(用于腹部 CT 诊断的专家级通用 AI)。
拆开三个关键词理解:
- 通用型(Generalist):不是某个病的检测器,一个权重文件干 146 件事,包括肝癌、胰腺癌、胃癌、结直肠癌这类高致死率的恶性肿瘤。
- 视觉语言(Vision-Language):不看人工勾画的病灶框,而是学「CT 影像 ↔ 放射科报告文本」之间的对应关系。报告是医院本来就有的,一张不用额外标注。
- 腹部增强 CT:注意边界——目前只针对打了造影剂的腹部 CT。平扫、其他期相、其他部位、儿童病例,统统在已验证范围之外。
训练规模是这套东西最唬人的地方:424,911 例增强腹部 CT 检查,拆出 1500 万+ 器官级(anatomy-aware)图文对。这个数据量级,过去只在大语言模型领域出现过,现在被塞进了三维体数据。
达摩院说这是“全世界第一个达到专家水平的通用医疗影像 AI 模型”。这句话是他们自己说的,但底下确实压着一篇 Science 和一组很难反驳的数字。
它到底强在哪
一、器官级细粒度对齐:这次的关键不是模型更大,是喂得更准
CT 数据有个天然麻烦:信号极度稀疏。一张腹部增强 CT 里,绝大多数体素都是正常组织,病灶往往只占极小一块,还可能小得可怜。
常规视觉语言模型的做法是「整张图 ↔ 整份报告」对齐——在自然图像配字幕的场景没问题,搁 CT 上,这个监督信号粗得像用渔网捞针:报告里写“右肝叶见约 1.5cm 低密度灶”,这句话到底对应图像里哪个方块?模型根本定位不到。
达摩院的解法是器官级细粒度对齐(organ-level fine-grained alignment),论文里强调这是国际首次:
- 先把三维 CT 体数据按解剖结构拆成一个个独立的器官级单元——肝、肾、脾、肠、胰……各自切出来;
- 再让每个解剖单元单独对应报告里描述它的那几句话;
- 最后叠一层自适应对比建模(adaptive contrastive modeling),动态吸收不同医生的描述习惯差异。
第三步看着不起眼,其实很实用。同一个“轻度肝肿大”,不同的放射科医生会写成“肝稍大”“肝脏体积增大,轻度”“hepatomegaly, mild”——朴素的对比学习认了其中一种就认不出另一种,自适应策略把这些表述的变体都纳进来,且完全不需要人工去归一化报告文本。
结果就是:整个训练流程除医院本来就在写的报告外,没有依赖任何额外人工标注。
这一点比那几个漂亮的 AUC 数字更值钱——它意味着这条路可以被复制到别的影像场景,而不用再组织一队专科医生去画框画到地老天荒。
二、性能:0.913 是什么水平
AUC(曲线下面积)衡量的是“把病人和正常人区分开”的能力,1.0 是完美,0.5 等于瞎猜,临床上一般认为 0.9 以上属于 outstanding(优秀)。
DAMO RADAR 的成绩单:
| 场景 | AUC | 备注 |
|---|---|---|
| 近 4 万例真实世界检查,146 种病变 | 0.913 | 全部评估病变的平均值 |
| 同类最强通用视觉语言模型 | 0.776 | 这是对照组 |
| 未训练过的急腹症场景,2.7 万+ 例 | 0.904 | 纯泛化测试 |
| 8 家外部独立中心验证 | 0.895 | 换了新机器、新协议、新人群 |
| 跨人群队列,不微调直接上 | 0.883 | |
| 肝 / 胰 / 胃 / 结直肠癌(病理活检为金标准) | 0.891 ~ 0.984 |
那栏 0.776 是我认为整篇论文里最有杀伤力的数字。它说明通用路线和“调教好的竞品通用 VLM”之间,差距不是一点点,而是整整 13.7 个百分点。如果经得起第三方复现,靠单病种工具按次收费的那套商业模式会很难受。
三、和真人医生正面刚:赢了 23 个
这部分是论文里最容易被标题党夸大、也最需要看清楚的一段。
研究团队组织了 14 家机构、26 名影像科医生(11 名资深 + 15 名初级),医生和模型分别对 300 名患者的 CT 独立判读。结果:模型的平均准确率超过了其中 23 名医生。
注意措辞——是平均准确率的比较,不是逐例对打的全胜战绩;它没有赢下另外那 3 个人,而且这不是临床结局的随机对照试验。
更重要的其实是第二组数据:把 RADAR 当作**第二阅片人(second reader)**给医生用,效果是——
- 病变检出敏感度提升约 10%(防漏诊)
- 阅片耗时缩短 30% 以上(浙大一院口径是 30.7%)
- 低年资医生在有 AI 辅助时,达到了高年资医生独立阅片的水平
最后这条的分量最重。如果成立,RADAR 就不只是一个诊断工具,而是个培训与人力杠杆——基层医院阅片量有限、医生经验相对不足,恰恰是腹部 CT 最难搞的场景。
真实世界,它解决了什么问题
痛点一:放射科要没人了
有研究预测到 2050 年全球将短缺 75 万名放射科医生。而影像科是全医院里极少数“工作量被设备直接绑死”的科室——机器一响片子就来,人的产出上限却卡在读片速度上。一个能把读片时间砍掉三成、同时把漏诊率往下压 10 个百分点的工具,正好打在两个最痛的点上。
浙大一院放射科主任医师肖文波的说法很实在:
这填补了临床通用辅助诊断工具的空白,如同智能阅片导航。
痛点二:凌晨三点的急诊 CT
急腹症(急性阑尾炎、肠梗阻、内脏穿孔这类要急诊手术的)AUC 做到 0.904,而且模型压根没在急诊数据上训练过。这对基层医院、夜班、缺乏腹部亚专科医生的地区意义不小——急诊 CT 往往就是凌晨三点由值班医生独自判读。
痛点三:打碎“按病种收费”
医院过去要买一堆单病种 AI 盒子,每一个单独付费、覆盖一个病种。现在采购方可以拿着一篇 Science 和八家外部中心的 0.895 验证数据去谈续约,一个字都不用部署。其中的性价比变化,那些卖单病种工具的厂商大概已经感受到了。
初体验:代码怎么跑起来
先说实话:这不是个能在你笔记本上五分钟跑通的东西。它是个研究性质的基础模型,checkpoint 和推理都以 DICOM/NIfTI 三维体数据为核心,得有一张说得过去的计算卡。
好在开源得非常干净。仓库在 github.com/alibaba-damo-academy/damo-radar,权重托管在 Hugging Face 的 radar-generalist 组织下。
第 1 步:拉代码、建环境
git clone https://github.com/alibaba-damo-academy/damo-radar.git
cd damo-radar
conda create -n radar python=3.10
conda activate radar
pip install -r requirements.txtPython 版本官方指定 3.10,别自作主张用别的版本去踩依赖坑。
第 2 步:下载权重和辅助数据
官方在 download_scripts/ 下给了两个脚本,直接跑就行,不用自己去 HF 页面上一个个点:
cd download_scripts
# 拉模型权重和支持文件,落到 ckpt/
python download_checkpoints.py
# 拉辅助数据(预处理好的 mask)
python download_auxiliary_data.py仓库里贴心地放了 demo 用的 nifti 文件和预测结果的 CSV,所以哪怕你手上没有临床数据,也能先把流程跑通看一眼输出长什么样。
第 3 步:照着官方文档往下走
仓库 docs/ 目录下三份文档,分工清楚:
INFERENCE.md—— 两条路线:① 用预训练 checkpoint 在 RAD-CT 上跑推理 demo;② 在外部 MERLIN 测试集上做推理与评估TRAINING.md—— 从零训练 RADAR / RADAR+,或在 MERLIN 数据上做微调PREPROCESS.md—— 影像/mask 与报告文本的预处理,支持跑 MERLIN 或你自己的数据
强烈建议先走 INFERENCE.md 的第一条 demo 路线。第一次看到一张腹部 CT 被拆成十几个器官单元、然后每个单元吐出一串带概率的病变提示时,那个震撼程度远超看论文里的表格。
上手前必须知道的三件事
这部分比上面的性能更重要,很多转载稿都没写。
1. 许可证是拆开的:代码 Apache 2.0,权重 CC BY-NC-SA 4.0
代码在 GitHub 上以 Apache 2.0 发布,商用没问题。但模型权重单独采用 CC BY-NC-SA 4.0——允许研究和非商业使用,商业部署必须另外谈许可,而且阿里没公布这个许可的价格。
换句话说:高校课题组免费下载,要靠它赚钱问诊的医院另行付费。
这套安排其实很精明:把“贵的是训练过程”的那部分——权重——留在非商用协议里,开源当天就能换来全球学术团队的自愿复现、引用和测试。开源在这里不是慈善,是分发策略。
2. 没有任何监管审批
已发布的材料里,没有任何迹象表明它拿过 FDA 或其他司法辖区的 clearance。它不是合规的临床产品,是 research tool。别把它直接接进医院的诊断流程。
3. 0.913 是个平均值,而且人群有边界
146 个病变取平均,天生会掩盖某些单项的疲软——临床风险最高的病种如果恰好落在均值以下的尾巴里,那才是问题。另外验证人群以中国人群为主,尚未发表针对非亚洲人群的独立验证,西方医院最好把这个数字当作上限而非预期。别忘了只验证过增强腹部 CT。
对了,仓库里接地气的一点:它站在 LAVIS(BSD-3)、nnU-Net(Apache 2.0)、MONAI(Apache 2.0)、3D-ResNets-PyTorch(MIT)这几个项目的肩膀上,第三方许可原文都留在 THIRD_PARTY_LICENSES.md 里;代码还在 Zenodo 上做了归档存档(记录号 21271172)。
进阶
达摩院已经放话,这套「器官级细粒度对齐」的训练范式不局限于腹部 CT,下一步会往胸部 CT 和脑部 MRI 迁移——不过那目前还只是计划,不是结果。
真正值得盯的是三件事:独立实验室在自家机器和人群上能不能复现 0.913;有没有前瞻性临床试验把「模型辅助阅片」和「患者结局」直接挂钩;以及监管审批什么时候真正递交。
作为一个常年追国产开源项目、见过太多“发论文即巅峰”的人,这一天值得记一笔:代码 Apache 2.0、权重当天开放、论文当天上线 Science,一篇就否定了过去十年“一病一模”的路径依赖。看多了 PPT 式开源,我对这种当天就把东西交出来的做法,始终抱有好感。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
