阿里达摩院通用医疗影像模型登《Science》,首次达到放射科专家水平
阿里达摩院通用医疗影像模型登《Science》,首次达到放射科专家水平
2016年,深度学习先驱Geoffrey Hinton曾预言:五年到十年内,AI将全面超越放射科医生,相关人才培养应停止。近十年过去,这一场景并未出现。放射科医生短缺仍是全球医疗体系的现实难题。尽管AI在多项影像任务中表现优异,但要像人类医生那样全面检查多个器官、识别并存异常,仍面临巨大挑战。

9月18日,阿里达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像模型 DAMO RADAR(Rapid Abdominal Diagnosis with AI and Radiology)正式发表于国际顶级期刊《Science》正刊,并同步开源。这是近年来中国AI模型罕见登上《Science》主刊的成果。

该模型聚焦腹部增强CT,在涵盖18个解剖结构、146种临床相关影像表现的39,160次系统评估中,平均AUC(区分患病与非患病的能力指标)达到 0.913,首次在整体性能上达到影像科专家水平。更重要的是,这项突破并非来自通用大模型的医学考试成绩,而是直面真实临床场景,经受了多医院数万病例和大规模医生对照读片的严格检验。

医疗影像AI为何迟迟难有“GPT时刻”?

医疗领域一直是AI公司竞相布局的高地。IBM Watson曾尝试为肿瘤治疗提供建议,DeepMind探索过临床预警和眼科影像,OpenAI也推出了Health相关产品。但这些尝试都面临共同门槛:医疗AI必须高度准确、可靠,且结果可复核。一次漏诊可能延误治疗,一次误报也可能引发不必要的检查和焦虑。

影像AI是其中相对成熟的方向。过去十年,深度学习催生了一批专用模型,在肺结节、糖尿病视网膜病变、特定癌症筛查等任务上达到甚至超过专家水平。但这些模型大多围绕单一病种设计——收集特定影像,标注特定异常,训练模型判断“是否存在”。任务边界清晰,优化路径明确。

然而,真实临床远比这复杂。单项任务的高分,无法直接转化为全面诊断能力。专病模型受限于训练标签,每增加一种疾病,几乎就要重新走一遍数据收集、标注、训练、验证的流程。更麻烦的是,不同医院使用的设备、扫描协议、患者群体存在差异,模型换个环境就可能“水土不服”。

达摩院高级算法专家张建鹏参与的第一个AI项目是肺癌筛查,之后又做了肠癌等专病模型。按传统流程,一个病种从立项到上线往往需要两三年。“做到第二个项目时,我们就意识到这条路走不通,”他说,“真实世界有成千上万种病,照这个速度,一辈子也做不完。”

资深算法专家张灵则提到另一个困境:团队开发胰腺癌筛查模型时发现,AI能识别微小肿瘤,却容易被腹水、术后改变或图像伪影干扰,产生假阳性。这些对医生来说通常不难辨别的干扰因素,反而成了专病模型的盲点。而现实中,患者往往不是只患一种病,而是多种异常并存——这不是简单串联多个专病模型就能解决的问题。

这些瓶颈促使达摩院转向更根本的思路:能否让一个模型同时学习不同解剖结构、影像表现和临床描述之间的关系,从而覆盖更广泛的疾病谱?
解剖级图文对齐:让AI学会“看图说话”
视觉语言学习(Vision-Language Learning)提供了新路径。医院每天产生大量CT影像和对应的放射学报告,天然构成配对数据。理论上,模型可以直接从中学习,无需为每个病种单独制作精细标签。
但问题没那么简单。一份腹部增强CT通常包含数百幅图像,涉及肝、胰、肾、胃、肠等多个器官,许多是密度相近的软组织,肠道还盘绕其中。病灶可能只占整个三维影像的极小部分,而报告却同时描述多个器官的状态——既有正常所见,也有异常发现。
如果简单地将整套CT与整份报告全局对齐,关键异常信号很容易被大量无关信息稀释。模型可能学会了“整体关联”,却无法准确定位“哪个器官出了什么问题”。
DAMO RADAR的关键创新在于:将学习单元细化到解剖结构层面。团队首先将CT体数据与放射报告配对,形成百万级图像-文本对。随后借助Qwen语言模型,将报告自动拆解为针对不同解剖结构的描述片段,再与CT中对应区域的影像配对,最终构建出超过千万级的解剖级图像-文本对。
这一过程大幅减少了人工逐病标注的需求。不过,为了准确定位器官,模型仍在带有体素级标注的TotalSegmentator数据集上进行分割预训练,最终锁定18个目标解剖结构。训练中使用的器官掩码由公开的TotalSegmentator模型生成,作为伪标签;评估阶段的测试标签则经过人工标注、医生复核和严格质控。
模型架构上,DAMO RADAR由视觉分支和文本分支组成。视觉分支采用三维U-Net提取影像特征,分割解码器负责定位各解剖结构,并聚合相应区域的视觉特征;文本分支使用BERT编码器处理报告中的对应描述。两类特征在同一表示空间中对齐,使模型学会“肝脏的低密度影对应‘肝囊肿’描述”这类具体关联。分割与图文对齐在训练中联合优化。
“这种组织方式更接近放射科医生的阅片习惯,”张建鹏解释道,“医生通常按解剖结构依次检查肝、胰、胆、肾、肠等区域,再综合判断。明确的局部对应有助于减少其他器官和无关描述的干扰。”
自适应对比学习:避免把相似病例“推开”
完成局部配对后,模型还需处理不同患者间的相似性问题。
标准图文对比学习通常将配对的影像与文本拉近,把其他样本视为负样本推开。但在医疗场景中,这可能适得其反。两名患者的正常肝脏影像可能高度相似,描述相近的异常病例也可能共享某些特征。若一律将它们视为负样本,会产生“假负样本”,干扰学习。
DAMO RADAR引入自适应对比建模:根据解剖结构的正常/异常状态,以及异常描述的语义相似性,动态调整对比学习的监督关系。对于正常结构,不同患者的样本可作为额外正样本;对于异常结构,则依据文本描述的相似度,通过软监督调整配对权重,避免语义相近的样本被过度推开。
训练完成后,模型通过文本提示进行疾病查询。例如,输入“存在结肠炎”和“不存在结肠炎”两种提示,分别与结肠区域的影像特征计算相似度,得到预测分数。这意味着,同一套图文表示可复用于多种查询,无需为每项任务重新训练分类器。
解剖级对齐解决了三维影像中诊断信号稀疏的问题,自适应对比学习则减少了语义相似带来的干扰。两者结合,使单一模型能覆盖更广的影像表现,并通过文本提示灵活查询,显著降低逐病标注和重复训练的成本。
多中心验证:在真实世界站稳脚跟
模型在训练数据上表现好还不够,关键要看它能否走出实验室,在真实临床中发挥作用。
团队首先在内部进行真实世界测试:使用独立时间段的连续病例,共39,160次腹部增强CT,覆盖18个解剖结构和146种临床相关表现。结果显示,DAMO RADAR平均AUC达 0.913(95% CI: 0.911–0.915)。细分来看,18个结构的AUC介于0.838至0.982之间,实质器官(如肝、胰)与空腔器官(如胃、肠)表现均衡,疾病与影像征象、良性与恶性表现的区分能力也相当稳定。
更严峻的考验来自外部泛化能力。团队在8个未参与训练的医院中心验证模型,纳入24,239次增强腹部CT,涵盖急诊、住院、门诊和体检等不同场景,扫描范围包括全腹、上腹、盆腔等。各中心评估的影像表现数量在68至136种之间。
结果依然稳健:8个中心平均AUC为0.895,大幅优于当前领先的fVLM模型,单中心AUC在0.874至0.912之间。与内部队列相比,平均AUC仅下降0.018。超过一半的解剖结构(如胃、肝、骶骨)在内外部测试中的AUC差异低于0.01,显示出良好的稳定性。
团队还设置了更高难度的测试:
- 急诊场景:使用27,267例急诊CT评估17种急性腹部疾病,模型AUC达 0.904,尽管训练数据未包含急诊病例;
- 跨人群验证:在以西方患者为主的斯坦福Merlin数据集上,直接测试21种表现,AUC达 0.883;
- 病理金标准验证:在两个外部队列共4,333例中(含四类癌症及正常对照),模型在胰腺癌、胃癌、结直肠癌、肝癌上的AUC介于 0.891至0.984,证明其影像判断与病理结果高度一致。
人机协作:AI如何真正帮到医生?
模型性能再好,最终要服务于临床。为此,团队开展了一项大规模读片研究:邀请来自14家机构的26名放射科医生(包括顶级医院和其他医院的资深与初级医师),对300例腹部增强CT进行判读,覆盖61种影像表现。
第一阶段,医生独立阅片并撰写报告。结果显示,绝大多数医生的工作点位于DAMO RADAR的ROC曲线下方,仅有3名资深医生略高于模型。但需注意,此次比较仅基于影像本身,医生未结合病史、实验室检查等完整临床信息,因此不能推断AI整体诊断能力超越医生。
经过至少一个月洗脱期,同一批医生以随机顺序再次阅片,此次DAMO RADAR提供预测结果,并通过注意力图标出可疑区域。结果令人鼓舞:AI辅助使医生整体灵敏度提升10.0%,特异度从98.8%轻微降至98.2%,平均每例阅片时间减少30.7%。
分层分析进一步显示,AI对不同经验水平的医生均有帮助。在顶级医院,使用AI的初级医生表现已接近未使用AI的资深医生;其他医院也观察到相同趋势。AI有效缩小了初级与资深医生之间的判读差距。
相比“AI是否超过医生”,这种人机协作的增效更具临床价值——它让医生看得更快、更准,尤其在资源有限的基层医院。
从专病到通用:达摩院医疗AI的演进
理解DAMO RADAR的意义,需将其置于达摩院近年医疗AI探索的脉络中。此前,团队聚焦“平扫CT+AI”,希望利用体检和常规检查中大量存在的平扫CT,发现易被忽略的疾病线索。
这条路线始于专病模型:2023年,DAMO PANDA利用平扫CT筛查胰腺癌,在超两万名患者中发现多例既往漏诊病变,被《自然·医学》誉为“影像AI癌症筛查开启黄金时代”;随后DAMO GRAPE拓展至胃癌,DAMO COCA探索结直肠癌机会性筛查,DAMO iAorta则进入急诊,识别急性主动脉综合征。
这些项目验证了专病路线的临床价值,但也暴露出扩展成本高的问题。DAMO RADAR完成了一次关键转向:不再依赖为每种疾病单独制作标签,而是利用海量CT与报告对,通过视觉语言学习构建通用能力。
未来,专病模型与通用模型或将长期共存:前者围绕高风险疾病深度优化,后者承担广泛异常筛查、辅助阅片和第二意见等任务。
十年前,Hinton设想AI取代放射科医生。DAMO RADAR给出的答案更务实:AI先成为医生的助手,帮他们发现更多异常,用更短时间完成工作。虽然还不能说医疗影像AI的“GPT时刻”已经到来,但这条技术路径无疑让未来图景更加清晰。随着模型开源,更多机构可复现、验证并扩展这一方向,推动AI真正融入临床工作流。