医学

Medicine

眼科临床诊断常需综合眼底照相、眼部B超等多模态影像,并结合指南与医学证据进行判断。针对现有人工智能系统单任务、弱循证和难追溯等局限,研究团队开发了自主多模态眼科智能体 AgentEYE。该系统可自动识别影像模态、调用专科工具、按需检索临床证据,并生成带有可核查参考依据的诊断报告。


近日,浙江大学医学院附属第二医院眼科中心金凯团队联合国内外研究者完成题为“An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis”的研究,论文于2026年8月5日在Cell Press细胞出版社旗下期刊Cell Reports Medicine正式刊载。


研究团队开发了自主多模态眼科人工智能智能体AgentEYE。该系统能够自动识别眼底照片和眼部B超图像,调用相应的专科影像分析工具,根据需要检索临床指南和权威网络医学证据,并将多模态结果整合为带有参考依据的诊断报告。研究显示,AgentEYE显著提高了诊断报告的正确性、完整性和安全性,同时减少了错误引用与无法核实的“幻觉”文献,为构建可审计、可追溯的眼科临床决策支持系统提供了新路径。

▲长按识别二维码阅读论文

研究亮点


  • 智能体架构:自动完成影像模态路由、专科工具调用、循证检索和报告整合,关键步骤均可检查与审计。

  • 诊断质量:在302例内部多模态测试中,AgentEYE的诊断正确性和完整性评分分别为71.93和75.59,显著高于通用大模型直接分析图像的基线。

  • 临床安全:3名眼科医生对200例病例进行盲法评价:AgentEYE诊断正确率为83.0%,完整率为82.5%,潜在有害输出率仅为3.5%。


从单一模型走向“自主协作”的眼科智能体


传统眼科AI通常采用“一种图像对应一个模型”的固定工作方式,难以模拟临床医生综合不同检查结果进行判断的过程。AgentEYE采用模块化智能体架构,将复杂诊断任务分解为多模态识别与路由、专科影像分析、循证检索与充分性判断,以及诊断整合与报告生成四个相互衔接的环节。


系统首先自动区分眼底照片和眼部B超图像,并将其分配至对应的专科分析工具;当影像结果存在不确定性或模态间冲突时,系统进一步检索临床指南及权威网络证据,并判断当前证据是否充分,必要时优化检索问题;最终由推理核心综合影像表现、专科工具结果和检索证据,生成包含诊断解释、鉴别诊断、处理建议和参考文献的报告。


这一设计并非简单地让大模型“直接看图并回答”,而是让大模型负责规划流程、调用工具、检查证据并整合结论,使每个关键步骤均可记录和审查。


大规模真实世界数据支持系统开发与评估


研究团队基于浙江大学医学院附属第二医院的临床数据建立AgentEYE开发队列,共纳入9049名患者、31393张眼底图像、43266张眼部B超图像和15244份参考报告或PDF记录。


随后,研究采用302例同日完成眼底照相和B超检查的病例进行主要内部测试,并从中选择200例开展由3名眼科医生完成的盲法评估,共形成400份候选报告和1200次独立评分。此外,团队还在中国和波兰的外部队列中检验系统的跨中心泛化能力。


专科影像工具是性能提升的关键


在302例内部多模态测试中,完整AgentEYE的诊断正确性评分达到71.93分,完整性评分达到75.59分;而直接使用通用大语言模型分析图像的基线分别仅为36.52分和48.57分。


消融实验显示,移除专科影像工具后,系统诊断正确性降至39.40分,说明专科工具是诊断性能提升的主要来源。相比之下,移除检索模块对正确性和完整性评分的影响较小,提示证据检索的主要价值并非简单提高诊断分数,而是增强报告的循证性、引用可靠性和可审计性。


这一发现说明,医学智能体的优势不只是连接更多模块,而在于根据不同任务,让专科模型、证据检索和大语言模型分别承担其最适合的角色。


眼科医生盲法评价验证安全性与证据可靠性


在200例病例的盲法评价中,3名眼科医生分别比较了AgentEYE与能够自行生成引用的大语言模型基线。基于多数投票,AgentEYE生成报告的诊断正确率为83.0%,明显高于基线的42.0%;报告完整率为82.5%,而基线为41.5%。AgentEYE产生潜在有害内容的比例仅为3.5%,显著低于基线的29.0%。


引用可靠性方面,AgentEYE有86.5%的引用被眼科医生评价为正确,而自行生成引用的大模型基线仅为46.5%。无法核实或疑似虚构的文献仅出现在基线组,在AgentEYE报告中未被发现。


多中心验证同时揭示系统能力边界


在皖南医学院外部队列的既定疾病类别中,AgentEYE较通用大模型基线将诊断正确性提高18.53分,完整性提高11.17分。


但在规模较小的波兰外部队列中,两种方法总体表现接近;对于超出专科工具既定标签范围的未见疾病,AgentEYE主要改善了报告完整性,并未显著提高诊断正确性。上述结果说明,AgentEYE能够在部分跨中心场景中保持优势,但其表现仍受到疾病谱、图像采集方式、报告规范及专科工具覆盖范围的影响,尚不能被视为具备开放世界诊断能力。


AgentEYE自动分析眼底和B超图像,结合医学证据生成可追溯的诊断报告


作者专访

Cell Press细胞出版社特别邀请论文通讯作者金凯研究员进行了专访,为大家进一步解读。

CellPress:

您的团队为何开展这项研究?



金凯研究员:

目前多数眼科AI仍然是针对单一任务设计的分类模型,例如仅判断一张眼底照片是否存在某种疾病。但在真实临床场景中,医生需要综合眼底照相、眼部B超以及其他检查信息,并在不同模态结果不一致时进行鉴别诊断。与此同时,通用大语言模型虽然具备较强的语言与推理能力,但直接应用于临床影像时,仍可能出现识别错误、推理依据不清或引用文献无法核实等问题。因此,我们希望建立一个能够自主选择工具、整合多模态影像并检索可靠证据的眼科智能体,使最终报告不仅“给出答案”,还能够展示答案所依据的影像表现和医学证据。

CellPress:

您认为本项工作的主要亮点是什么?



金凯研究员:

首先,AgentEYE不是单一的端到端模型,而是一个由影像模态识别、专科工具调用、证据检索和诊断整合共同组成的模块化智能体。系统能够根据病例特点自主规划分析流程,并保留可检查的中间状态。其次,我们通过消融实验区分了不同组件的作用:专科影像工具是诊断性能提升的主要来源,而检索模块主要增强证据支撑、引用准确性和决策过程的可追溯性。这说明医学智能体的评价不能只关注准确率,还应考察证据质量、安全性和审计能力。第三,我们同时采用多模型自动评价、眼科医生盲法评价和外部队列验证,并主动报告系统在跨中心和未见疾病场景中的能力边界,而不是将其描述为可以替代医生的自主诊断系统。

CellPress:

AgentEYE未来将重点开展哪些研究?



金凯研究员:

下一步,我们计划开展前瞻性、多中心临床验证,比较眼科医生在使用和不使用AgentEYE时的诊断准确性、决策时间、转诊合理性、治疗方案变化及安全性。在系统层面,我们将进一步整合OCT、视力、眼压、病史及电子健康记录等信息,扩大专科工具的疾病覆盖范围,同时重点完善逐条结论与证据之间的核验机制、证据重排序、低质量图像鲁棒性和医生—智能体交互设计。AgentEYE现阶段应被定位为由医生监督的临床决策支持工具,其目标是帮助医生组织多模态信息、识别影像间的冲突并提供可核查的循证依据,而不是替代医生作出最终诊断。

相关论文信息

论文原文刊载于CellPress细胞出版社旗下期刊Cell Reports Medicine上,点击“阅读原文”或扫描下方二维码查看论文

论文标题:

An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis

论文网址:

https://www.sciencedirect.com/science/article/pii/S2666379126003861

DOI:

https://doi.org/10.1016/j.xcrm.2026.102969

代码:

https://github.com/OpenMedAILab/AgentEYE

▲长按识别二维码阅读论文

内容中包含的图片若涉及版权问题,请及时与我们联系删除