---
url: /damo-radar/introduction.md
description: >-
  DAMO
  RADAR是什么？阿里巴巴达摩院联合浙大一院开源的“专家级”通用医疗影像大模型，42万例增强腹部CT训练、1500万器官级图文对，单次通过即覆盖18个器官146种病变，平均AUC
  0.913，击败26名放射科医生中的23名。代码Apache 2.0、权重已开源。五分钟搞懂它为什么重要
---

# 认识DAMO RADAR —— 登上Science的通用医疗影像AI，一次腹部CT看穿146种病变

先说一句让我这种外行背上发凉的话。

> “你问问年轻医生，他们最怕进的科室组别，就是腹部影像组。”——浙大一院放射科主任肖文波，从业 30 余年。

一份腹部增强 CT，几百张薄层片子，覆盖消化、泌尿等多个系统的数十个器官。器官之间互相挤压重叠，软组织密度彼此接近，病灶信号又常常细微得近乎挑衅。即便中高级医生，写完一份报告也要 **20 到 30 分钟**。

而另一边是这么个数字：过去十年医疗影像 AI 走的是“一病一模”的路线，一个模型只治一种病，**每训练一个病种通常要花 2 年**，训练完还完全无法泛化到别的病种上。肺结节一套模型，胰腺癌一套模型，糖网又是另一套——医院采购的时候，等于为每一种疾病单独付一次钱。

然后 2026 年 9 月 18 日凌晨，阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构，把 DAMO RADAR 发在了《Science》上（卷 393，期 6817，文章号 eaec6129，DOI: 10.1126/science.aec6129），**同一天代码和权重全部开源**。

一个模型，一次通过，**146 种病变、18 个器官**，全包了。

## 什么是 DAMO RADAR

DAMO RADAR 是一个面向**腹部增强 CT 的通用医学视觉语言模型（VLM）**。它的自我定位很直白——官方标题就是：*An Expert-Level Generalist AI for Abdominal CT Diagnosis*（用于腹部 CT 诊断的专家级通用 AI）。

拆开三个关键词理解：

* **通用型（Generalist）**：不是某个病的检测器，一个权重文件干 146 件事，包括肝癌、胰腺癌、胃癌、结直肠癌这类高致死率的恶性肿瘤。
* **视觉语言（Vision-Language）**：不看人工勾画的病灶框，而是学「CT 影像 ↔ 放射科报告文本」之间的对应关系。报告是医院本来就有的，一张不用额外标注。
* **腹部增强 CT**：注意边界——目前只针对**打了造影剂的腹部 CT**。平扫、其他期相、其他部位、儿童病例，统统在已验证范围之外。

训练规模是这套东西最唬人的地方：**424,911 例增强腹部 CT 检查**，拆出 **1500 万+ 器官级（anatomy-aware）图文对**。这个数据量级，过去只在大语言模型领域出现过，现在被塞进了三维体数据。

> 达摩院说这是“全世界第一个达到专家水平的通用医疗影像 AI 模型”。这句话是他们自己说的，但底下确实压着一篇 Science 和一组很难反驳的数字。

## 它到底强在哪

### 一、器官级细粒度对齐：这次的关键不是模型更大，是喂得更准

CT 数据有个天然麻烦：**信号极度稀疏**。一张腹部增强 CT 里，绝大多数体素都是正常组织，病灶往往只占极小一块，还可能小得可怜。

常规视觉语言模型的做法是「整张图 ↔ 整份报告」对齐——在自然图像配字幕的场景没问题，搁 CT 上，这个监督信号粗得像用渔网捞针：报告里写“右肝叶见约 1.5cm 低密度灶”，这句话到底对应图像里哪个方块？模型根本定位不到。

达摩院的解法是**器官级细粒度对齐**（organ-level fine-grained alignment），论文里强调这是国际首次：

1. 先把三维 CT 体数据按解剖结构拆成一个个**独立的器官级单元**——肝、肾、脾、肠、胰……各自切出来；
2. 再让每个解剖单元**单独对应报告里描述它的那几句话**；
3. 最后叠一层**自适应对比建模**（adaptive contrastive modeling），动态吸收不同医生的描述习惯差异。

第三步看着不起眼，其实很实用。同一个“轻度肝肿大”，不同的放射科医生会写成“肝稍大”“肝脏体积增大，轻度”“hepatomegaly, mild”——朴素的对比学习认了其中一种就认不出另一种，自适应策略把这些表述的变体都纳进来，且完全不需要人工去归一化报告文本。

**结果就是：整个训练流程除医院本来就在写的报告外，没有依赖任何额外人工标注。**

这一点比那几个漂亮的 AUC 数字更值钱——它意味着这条路可以被复制到别的影像场景，而不用再组织一队专科医生去画框画到地老天荒。

### 二、性能：0.913 是什么水平

AUC（曲线下面积）衡量的是“把病人和正常人区分开”的能力，1.0 是完美，0.5 等于瞎猜，临床上一般认为 **0.9 以上属于 outstanding（优秀）**。

DAMO RADAR 的成绩单：

| 场景 | AUC | 备注 |
| --- | --- | --- |
| 近 4 万例真实世界检查，146 种病变 | **0.913** | 全部评估病变的平均值 |
| 同类最强通用视觉语言模型 | 0.776 | 这是对照组 |
| 未训练过的急腹症场景，2.7 万+ 例 | **0.904** | 纯泛化测试 |
| 8 家外部独立中心验证 | 0.895 | 换了新机器、新协议、新人群 |
| 跨人群队列，不微调直接上 | 0.883 | |
| 肝 / 胰 / 胃 / 结直肠癌（病理活检为金标准） | **0.891 ~ 0.984** | |

那栏 **0.776** 是我认为整篇论文里最有杀伤力的数字。它说明通用路线和“调教好的竞品通用 VLM”之间，差距不是一点点，而是整整 13.7 个百分点。如果经得起第三方复现，靠单病种工具按次收费的那套商业模式会很难受。

### 三、和真人医生正面刚：赢了 23 个

这部分是论文里最容易被标题党夸大、也最需要看清楚的一段。

研究团队组织了 **14 家机构、26 名影像科医生**（11 名资深 + 15 名初级），医生和模型分别对 **300 名患者**的 CT 独立判读。结果：**模型的平均准确率超过了其中 23 名医生**。

注意措辞——是**平均准确率的比较**，不是逐例对打的全胜战绩；它没有赢下另外那 3 个人，而且这不是临床结局的随机对照试验。

更重要的其实是第二组数据：把 RADAR 当作\*\*第二阅片人（second reader）\*\*给医生用，效果是——

* 病变检出**敏感度提升约 10%**（防漏诊）
* 阅片**耗时缩短 30% 以上**（浙大一院口径是 30.7%）
* **低年资医生在有 AI 辅助时，达到了高年资医生独立阅片的水平**

最后这条的分量最重。如果成立，RADAR 就不只是一个诊断工具，而是个**培训与人力杠杆**——基层医院阅片量有限、医生经验相对不足，恰恰是腹部 CT 最难搞的场景。

## 真实世界，它解决了什么问题

**痛点一：放射科要没人了**

有研究预测到 2050 年全球将短缺 **75 万名放射科医生**。而影像科是全医院里极少数“工作量被设备直接绑死”的科室——机器一响片子就来，人的产出上限却卡在读片速度上。一个能把读片时间砍掉三成、同时把漏诊率往下压 10 个百分点的工具，正好打在两个最痛的点上。

浙大一院放射科主任医师肖文波的说法很实在：

> 这填补了临床通用辅助诊断工具的空白，如同智能阅片导航。

**痛点二：凌晨三点的急诊 CT**

急腹症（急性阑尾炎、肠梗阻、内脏穿孔这类要急诊手术的）AUC 做到 **0.904**，而且模型**压根没在急诊数据上训练过**。这对基层医院、夜班、缺乏腹部亚专科医生的地区意义不小——急诊 CT 往往就是凌晨三点由值班医生独自判读。

**痛点三：打碎“按病种收费”**

医院过去要买一堆单病种 AI 盒子，每一个单独付费、覆盖一个病种。现在采购方可以拿着一篇 Science 和八家外部中心的 0.895 验证数据去谈续约，一个字都不用部署。其中的性价比变化，那些卖单病种工具的厂商大概已经感受到了。

## 初体验：代码怎么跑起来

先说实话：**这不是个能在你笔记本上五分钟跑通的东西**。它是个研究性质的基础模型，checkpoint 和推理都以 DICOM/NIfTI 三维体数据为核心，得有一张说得过去的计算卡。

好在开源得非常干净。仓库在 `github.com/alibaba-damo-academy/damo-radar`，权重托管在 Hugging Face 的 `radar-generalist` 组织下。

**第 1 步：拉代码、建环境**

```bash
git clone https://github.com/alibaba-damo-academy/damo-radar.git
cd damo-radar

conda create -n radar python=3.10
conda activate radar
pip install -r requirements.txt
```

Python 版本官方指定 3.10，别自作主张用别的版本去踩依赖坑。

**第 2 步：下载权重和辅助数据**

官方在 `download_scripts/` 下给了两个脚本，直接跑就行，不用自己去 HF 页面上一个个点：

```bash
cd download_scripts

# 拉模型权重和支持文件，落到 ckpt/
python download_checkpoints.py

# 拉辅助数据（预处理好的 mask）
python download_auxiliary_data.py
```

仓库里贴心地放了 **demo 用的 nifti 文件**和**预测结果的 CSV**，所以哪怕你手上没有临床数据，也能先把流程跑通看一眼输出长什么样。

**第 3 步：照着官方文档往下走**

仓库 `docs/` 目录下三份文档，分工清楚：

* `INFERENCE.md` —— 两条路线：① 用预训练 checkpoint 在 RAD-CT 上跑推理 demo；② 在外部 MERLIN 测试集上做推理与评估
* `TRAINING.md` —— 从零训练 RADAR / RADAR+，或在 MERLIN 数据上做微调
* `PREPROCESS.md` —— 影像/mask 与报告文本的预处理，支持跑 MERLIN 或你自己的数据

> 强烈建议先走 INFERENCE.md 的第一条 demo 路线。第一次看到一张腹部 CT 被拆成十几个器官单元、然后每个单元吐出一串带概率的病变提示时，那个震撼程度远超看论文里的表格。

## 上手前必须知道的三件事

这部分比上面的性能更重要，很多转载稿都没写。

**1. 许可证是拆开的：代码 Apache 2.0，权重 CC BY-NC-SA 4.0**

代码在 GitHub 上以 **Apache 2.0** 发布，商用没问题。但**模型权重单独采用 CC BY-NC-SA 4.0**——允许研究和**非商业**使用，商业部署必须另外谈许可，而且阿里没公布这个许可的价格。

换句话说：**高校课题组免费下载，要靠它赚钱问诊的医院另行付费。**

这套安排其实很精明：把“贵的是训练过程”的那部分——权重——留在非商用协议里，开源当天就能换来全球学术团队的自愿复现、引用和测试。开源在这里不是慈善，是分发策略。

**2. 没有任何监管审批**

已发布的材料里，**没有任何迹象表明它拿过 FDA 或其他司法辖区的 clearance**。它不是合规的临床产品，是 research tool。别把它直接接进医院的诊断流程。

**3. 0.913 是个平均值，而且人群有边界**

146 个病变取平均，天生会掩盖某些单项的疲软——临床风险最高的病种如果恰好落在均值以下的尾巴里，那才是问题。另外验证人群以中国人群为主，尚未发表针对非亚洲人群的独立验证，西方医院最好把这个数字当作上限而非预期。别忘了只验证过增强腹部 CT。

对了，仓库里接地气的一点：它站在 **LAVIS**（BSD-3）、**nnU-Net**（Apache 2.0）、**MONAI**（Apache 2.0）、**3D-ResNets-PyTorch**（MIT）这几个项目的肩膀上，第三方许可原文都留在 `THIRD_PARTY_LICENSES.md` 里；代码还在 Zenodo 上做了归档存档（记录号 21271172）。

## 进阶

达摩院已经放话，这套「器官级细粒度对齐」的训练范式不局限于腹部 CT，**下一步会往胸部 CT 和脑部 MRI 迁移**——不过那目前还只是计划，不是结果。

真正值得盯的是三件事：独立实验室在自家机器和人群上能不能复现 0.913；有没有前瞻性临床试验把「模型辅助阅片」和「患者结局」直接挂钩；以及监管审批什么时候真正递交。

作为一个常年追国产开源项目、见过太多“发论文即巅峰”的人，这一天值得记一笔：代码 Apache 2.0、权重当天开放、论文当天上线 Science，一篇就否定了过去十年“一病一模”的路径依赖。**看多了 PPT 式开源，我对这种当天就把东西交出来的做法，始终抱有好感。**

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
