- 简介医学影像人工智能在单幅图像的独立解读任务中已展现出卓越性能,但其与放射科临床实践仍存在显著脱节——因为实际诊断和随访工作高度依赖于对既往检查结果及类似参考病例的跨时间、跨案例比对分析。本文将放射科比对任务建模为一种“实体感知型跨图像推理”问题,并提出一个统一框架,同步支持参考病例检索与纵向对比性影像解读。我们构建了MedReCo-DB——一个大规模、面向临床比对任务的影像资源库,该库源自常规临床实践中积累的影像-报告配对数据,涵盖来自8家医疗机构、4个国家、7种影像模态的逾69万张影像,涉及超16万名患者。所有报告均被系统性地结构化解析为解剖结构、异常征象与病理状态三类语义实体,从而为实体条件约束下的精准检索与对比式视觉问答任务提供高质量监督信号。基于该资源库,我们研发了MedReCo——一种具备实体感知能力的视觉编码器,可实现临床意义高度相似病例的可控式检索;同时开发了MedReCo-VLM——一种视觉-语言融合模型,专用于生成式地解读病灶随时间推移的动态变化。在内部验证、外部验证及跨中心验证三类评估中,MedReCo在全部12项内部检索任务中均取得最高的Recall@1指标;在外源性检索任务中,平均提升幅度达6.0个百分点;尤其在临床易混淆的鉴别诊断组别中,其表现持续显著优于最强基线模型。MedReCo-VLM则在全部对比生成类评估任务中均斩获最佳性能:在胸部X线片的纵向随访任务中,准确率提升14.5–46.5个百分点;在CT影像中亦提升13.0–27.9个百分点。上述结果表明,实体感知型的对比推理能力完全可从海量常规临床数据中规模化习得,有望为医学影像人工智能构建更契合真实临床需求的技术基础。
-
- 图表
- 解决问题医学影像AI在单张图像判读上表现优异,但与真实放射科临床实践脱节——实际诊断高度依赖跨时间(纵向随访)和跨病例(参考类似病例)的比较推理。现有方法缺乏对解剖结构、异常发现和病理实体的显式建模,难以支持临床所需的可控、可解释的对比分析。
- 关键思路将放射学比较建模为‘实体感知的跨图像推理’问题;提出双组件框架:MedReCo(实体条件化视觉编码器,支持解剖/病变层面的可控类比病例检索)和MedReCo-VLM(视觉-语言模型,生成区间变化的自然语言解释);核心创新在于从常规配对的影像-报告数据中自动解构出结构化临床实体(解剖、异常、病理)作为弱监督信号,无需人工标注即可实现细粒度比较学习。
- 其它亮点构建了迄今最大规模开源临床比较影像数据库MedReCo-DB(69万+图像,16万+患者,8机构/4国/7模态),报告经结构化解析为实体三元组;所有模型均仅用常规临床数据训练(无专家标注);在12项内部检索任务中Recall@1全部第一,外部检索平均提升6.0个百分点;在胸片和CT纵向随访生成任务中,准确率提升13.0–46.5个百分点;代码与MedReCo-DB子集已开源(https://medreco.github.io);值得深入的方向包括:实体动态演化建模、多中心偏差鲁棒性增强、与PACS/RIS系统临床集成验证。
- Contrastive Learning for Medical Image Retrieval (MICCAI 2022); CLIP-Driven Radiology Report Generation (Nature Communications 2023); Temporal Contrastive Learning in Chest X-ray Sequences (CVPR 2023); RAD-GPT: A Vision-Language Model for Radiology (NeurIPS 2023); MedKLIP: Knowledge-Guided Vision-Language Pretraining for Radiology (IEEE TMI 2024)


提问交流