DRUGONE

医学影像人工智能走向临床应用不仅需要较高的诊断准确性,还需要能够向临床医生提供可理解、可验证的决策依据。然而,当前多模态生物医学基础模型通常更加关注预测性能和跨任务泛化能力,其内部决策过程仍具有明显的“黑箱”特征;另一方面,传统可解释人工智能方法虽然能够提供医学概念等解释,却往往依赖针对特定疾病或影像模态的大量专家标注,难以扩展到通用医学场景。研究人员因此提出 ConceptCLIP,一种将医学概念直接融入大规模视觉–语言预训练过程的可解释生物医学基础模型。


研究人员首先构建了 MedConcept-23M,包含2300万组生物医学“图像–文本–概念”三元组,并利用标准化医学术语增强传统图像–文本数据。ConceptCLIP采用双重对齐策略,同时进行全局图像–文本对齐和局部区域–概念对齐,使模型既能够学习医学图像的整体语义,也能够将局部影像区域与具有临床意义的医学概念建立联系。研究在覆盖10种医学影像模态、78个数据集的大规模基准中进行评估,涵盖医学图像诊断、跨模态检索、视觉问答、医学报告生成、病理全切片分析以及可解释人工智能等任务。


结果表明,ConceptCLIP不仅在多种医学影像任务中取得领先或具有竞争力的性能,还能够产生细粒度、临床可理解的概念解释。在包含8名临床医生、92个病例和252次病例评估的用户研究中,ConceptCLIP提供的解释帮助医生验证正确预测并识别模型错误,使总体诊断发现识别准确率由68.1%提高至76.2%。这表明医学概念不仅可以作为模型解释工具,也可以直接参与基础模型表征学习,在提高模型性能的同时增强临床可信度。

近年来,视觉–语言基础模型通过在大规模图像和文本数据上进行预训练,显著提高了医学影像人工智能的泛化能力。一个模型经过预训练后,可以通过零样本预测、线性探测或微调应用于不同疾病和不同影像模态。然而,医学场景与普通计算机视觉存在本质区别:临床医生不仅需要知道模型预测了什么,还需要理解模型为什么得出这一判断。


现有医学视觉–语言模型通常学习图像与完整文本描述之间的全局对应关系。例如,一幅胸部X线图像可以与包含“胸腔积液和气胸”的报告建立整体联系,但这种训练方式并不要求模型明确指出胸腔积液位于图像什么区域,也不能保证模型真正利用了与疾病相关的影像学征象。因此,即使模型具有较高分类准确率,其预测也可能依赖非预期的图像特征。


传统可解释AI试图通过热图、显著性分析或概念瓶颈模型解决这一问题,但通常需要人工定义和标注大量概念。医学领域疾病种类、影像模态和临床征象极为丰富,为每种场景重新建立概念体系并进行专家标注成本很高,限制了可解释模型的规模化发展。


研究人员提出,与其在模型训练完成后再附加解释模块,不如在基础模型预训练阶段直接引入结构化医学知识,使模型从一开始就学习“影像区域—医学概念—疾病”之间的关系。ConceptCLIP正是围绕这一思想构建,其目标是在一个统一模型中同时获得诊断准确性、跨模态泛化能力和概念级可解释性。



方法

研究人员从大规模生物医学开放文献中提取图像及对应文本,共获得约2329万组图像–文本数据,其中2300万组用于ConceptCLIP预训练。为了进一步构建MedConcept-23M,研究人员将图像描述中的生物医学实体映射至统一医学语言系统(UMLS)中的标准化概念,通过实体识别、语义消歧和上下文验证,将传统图像–文本数据扩展为图像–文本–概念三元组。 ConceptCLIP随后采用两种互补的预训练目标:图像–文本对齐(IT-Align)负责学习完整图像与整体文本之间的全局语义关系;区域–概念对齐(RC-Align)进一步比较局部视觉区域与文本中的医学概念,使最相关的图像区域逐渐与对应概念建立联系。推理阶段则综合全局图像语义与局部概念证据完成疾病预测。研究最终在诊断、跨模态检索、医学报告生成、视觉问答、病理全切片分析、医学概念标注、概念瓶颈模型、概念–疾病关联以及临床医生用户研究等多个层面评价模型。

图1|ConceptCLIP及大规模概念增强视觉–语言预训练框架。 



结果

MedConcept-23M建立大规模医学概念增强预训练体系

研究首先构建MedConcept-23M,这是ConceptCLIP获得可解释能力的基础。与传统视觉–语言数据仅包含“图像–文本”配对不同,MedConcept-23M进一步为每幅图像关联标准化医学概念,使预训练监督信号从完整文本下沉到更细粒度的医学实体层面。


这些概念由UMLS统一表示。UMLS整合了SNOMED CT、MeSH、RxNorm等100余种医学术语来源,并通过统一概念标识符连接不同医学术语体系。因此,即使同一疾病或征象在不同论文、不同临床体系中使用不同表达,也可以被映射到统一概念空间。MedConcept-23M由此使基础模型能够跨越自然语言表述差异,学习相对标准化的医学知识。


研究建立的大规模评价体系同样强调通用性,共覆盖10种医学影像模态和78个下游数据集。其中58个数据集用于医学影像诊断,另外15个用于跨模态检索、医学报告生成、视觉问答和病理全切片分析,并在5个数据集上专门评价概念级可解释能力。


ConceptCLIP在多种医学影像诊断任务中表现出较强泛化能力

研究人员首先在39个数据集、10种影像模态上进行零样本诊断。在完全不针对下游任务进行训练的情况下,ConceptCLIP总体上优于所比较的通用和医学视觉–语言基础模型,其跨模态平均AUC相比此前最佳医学模型提高6.81%。CT、超声和眼底影像中的提升尤为明显,分别达到约10.73%、10.06%和8.98%。这说明概念增强预训练不仅提高解释能力,也改善了视觉表征本身。


在线性探测实验中,研究人员分别使用1%、10%和100%的训练数据评价模型。在仅使用1%训练数据的X线任务中,ConceptCLIP平均AUC达到71.48%,较第二名提高3.75%,显示出较好的低数据学习能力。进一步进行完整微调后,ConceptCLIP在10种模态中的8种取得最佳平均性能。


研究还专门检验模型面对真实分布偏移时的稳定性。在罕见或预训练数据中低代表性的疾病、来自不同医疗中心的私有临床数据以及高位深原始临床影像上,ConceptCLIP仍保持较强性能。在9个私有多中心数据集中,模型全部获得最高AUC,其中8个达到显著优势;区域–概念对齐也有助于模型适应从文献图像到原始临床影像的像素分布变化。

图2|ConceptCLIP在医学影像诊断中的性能。 


ConceptCLIP泛化至检索、视觉问答、报告生成和全切片病理分析

基础模型的价值并不限于疾病分类。研究人员进一步测试ConceptCLIP是否能够作为通用医学视觉表征应用于其他任务。


在跨模态检索中,ConceptCLIP在PMC-9K和QUILT-1M上均获得最佳图像到文本和文本到图像检索表现。例如,在PMC-9K中,图像到文本Recall@1达到82.85%,高于BiomedCLIP的73.41%;在大规模病理数据QUILT-1M上,文本到图像Recall@200达到32.50%,较BiomedCLIP提高12.88个百分点。


在医学视觉问答中,ConceptCLIP在SLAKE和VQA-RAD上的总体准确率分别达到83.86%和70.70%。在医学报告生成中,模型在MIMIC-CXR和IU X-Ray的大多数指标上获得最佳或具有竞争力的结果,其中MIMIC-CXR的Macro F1达到26.38%。这些结果说明概念增强并没有使模型局限于分类任务,而是形成了能够被不同下游系统利用的通用视觉–语言表征。


研究还将模型用于病理全切片图像。与普通图像不同,全切片病理图像需要从超大尺度组织图像中的大量局部区域聚合信息。在涵盖癌症诊断、基因突变预测和患者生存预测的9项任务中,ConceptCLIP同样保持较强性能,例如BRACS-3癌症诊断AUC达到91.65%,LUSC生存预测C-index达到59.66%。

图3|ConceptCLIP在多种医学影像分析任务中的泛化性能。 


概念增强预训练赋予模型细粒度医学可解释性

ConceptCLIP最重要的特点并非单纯提高准确率,而是能够使用临床医生熟悉的医学概念解释预测。研究人员首先在皮肤病学、病理学、超声和CT等5个数据集上进行零样本医学概念标注,共涉及5901幅测试图像和53个细粒度临床概念。ConceptCLIP相比PMC-CLIP和BiomedCLIP的平均性能分别提高10.9%和10.4%。局部区域–概念对齐在全部5个数据集中均优于仅使用全局图像信息的方式,而且可视化结果显示模型能够将具体概念定位至具有临床合理性的影像区域。


研究随后将ConceptCLIP作为概念瓶颈模型的视觉骨干。此时AI不能直接从图像跳到疾病诊断,而是先预测一组人类可以理解的医学概念,再利用这些概念完成疾病判断。基于ConceptCLIP构建的模型较第二名获得6.13%的AUC提升,并且在部分场景中能够达到甚至超过完全微调的黑箱模型。这意味着可解释性与诊断性能并不一定需要相互牺牲。


ConceptCLIP还能够发现跨人群的“概念–疾病”关系。例如,在胸部X线中,模型将空洞、实变、阴影和淋巴结肿大与结核病联系起来,而清晰肺野和正常膈肌轮廓更多与正常图像相关;在乳腺摄影、病理和超声中,也能够发现与良恶性状态一致的概念差异。对于肺炎,整合多个数据集后得到的关键概念比仅分析单一数据集更加完整和稳定,说明基础模型能够从大规模数据中提取疾病层面的全局概念解释。

图4|ConceptCLIP的概念级可解释能力。 


临床医生研究验证概念解释的实际价值

可解释模型真正重要的问题并不是能否产生漂亮的热图,而是解释能否帮助医生做出更可靠的判断。研究人员因此邀请8名来自病理、超声和放射领域的临床医生,对92个病例完成252次病例评估。


实验采用三阶段流程。医生首先观察原始图像和AI预测,独立判断临床征象并评价对AI的信任程度;随后展示ConceptCLIP生成的“概念–区域”解释热图,医生可以重新评估自己的判断和对AI的信任;最后评价解释是否具有实际临床价值。


结果揭示了一个比单纯“提高信任”更重要的现象——解释能够帮助医生校准对AI的信任。当AI预测正确时,合理的概念和区域证据提高医生信任;当AI预测错误时,不合理的解释反而帮助医生发现模型问题。例如,在放射科病例中,正确预测对应的信任评分平均增加1.25,而错误预测对应的信任平均下降1.08。另一个超声病例中,医生发现AI关注的是伪影而非真正的低回声肿块,因此主动降低了对模型预测的信任。


更重要的是,解释还改善了医生识别临床征象的准确率。在仅观察“图像+AI预测”时,总体准确率为68.1%;加入ConceptCLIP解释后提高至76.2%,绝对提升8.1%。超声医生的提升达到10.6%。医生认为,当AI正确时,解释主要帮助增强信心和提高效率;当AI错误时,则能够帮助发现AI错误并更快拒绝不合理预测。

图5|ConceptCLIP概念解释的临床医生用户研究。



讨论

ConceptCLIP试图解决医学基础模型长期存在的一项核心矛盾:模型规模和性能不断提高,但临床人员越来越难理解模型为何作出某个预测。研究的关键思路是将“解释”从训练后的附加步骤前移到基础模型预训练阶段。通过MedConcept-23M,医学概念不再只是模型预测后的解释标签,而成为模型学习视觉世界的重要监督信息。


这一设计的核心是全局IT-Align与局部RC-Align的互补。前者保留CLIP类模型大规模图像–文本学习的优势,使模型形成跨疾病和跨模态的整体医学语义空间;后者则迫使模型进一步寻找能够支持具体医学概念的局部视觉证据。研究结果表明,这种结构化医学知识并没有牺牲通用性能,反而同时改善了零样本诊断、跨模态泛化以及概念级解释能力。


更值得关注的是,ConceptCLIP将可解释性从“展示模型注意了哪里”进一步推进到了“模型依据什么医学概念作出判断”。概念标注、概念瓶颈模型以及概念–疾病关联共同表明,预训练阶段获得的医学概念并非辅助训练的临时信号,而是在推理阶段仍然可以直接使用的结构化表征。医生用户研究进一步显示,这些解释不仅能够增加对正确AI预测的信任,也能够降低对错误预测的信任,因此其价值并不是让医生“更相信AI”,而是帮助医生判断什么时候应该相信AI。


不过,该研究仍存在明显局限。首先,即使MedConcept-23M已经达到2300万规模,一些罕见疾病和特殊临床情况仍可能代表不足,因此模型无法保证覆盖所有医学场景。其次,ConceptCLIP目前依赖预先定义的医学概念,其开放集概念发现能力尚未得到验证,这限制了模型直接用于未知生物标志物发现的能力。


此外,RC-Align通过选择与概念最匹配的局部区域建立对应关系,这种方式虽然有利于学习稀疏、明确的区域–概念关系,但也可能错误锁定高频伪影、采集噪声或其他虚假局部特征。因此,在高风险临床场景中,这些解释应被视为辅助证据,而不能替代临床医生判断。未来可以通过更加柔性的区域聚合、不确定性建模以及前瞻性真实世界验证提高解释可靠性。


总体而言,这项研究提出了一条值得关注的医学基础模型发展路线:不仅扩大训练数据和模型规模,还将标准化医学知识直接融入视觉–语言预训练,使基础模型同时学习“看见什么、意味着什么,以及为什么支持这一诊断”。 ConceptCLIP由此将医学影像基础模型从单纯追求预测性能进一步推进到性能、泛化性与可解释性协同优化,为构建能够与临床医生有效协作的可信医学人工智能提供了新的技术框架。

整理 | DrugOne团队


参考资料


Nie, Y., He, S., Bie, Y. et al. An explainable biomedical foundation model via large-scale concept-enhanced vision–language pretraining. Nat. Biomed. Eng (2026). 

https://doi.org/10.1038/s41551-026-01764-x

内容为【DrugOne】公众号原创转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除