

医学
Medicine


眼科临床诊断常需综合眼底照相、眼部B超等多模态影像,并结合指南与医学证据进行判断。针对现有人工智能系统单任务、弱循证和难追溯等局限,研究团队开发了自主多模态眼科智能体 AgentEYE。该系统可自动识别影像模态、调用专科工具、按需检索临床证据,并生成带有可核查参考依据的诊断报告。
近日,浙江大学医学院附属第二医院眼科中心金凯团队联合国内外研究者完成题为“An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis”的研究,论文于2026年8月5日在Cell Press细胞出版社旗下期刊Cell Reports Medicine正式刊载。
研究团队开发了自主多模态眼科人工智能智能体AgentEYE。该系统能够自动识别眼底照片和眼部B超图像,调用相应的专科影像分析工具,根据需要检索临床指南和权威网络医学证据,并将多模态结果整合为带有参考依据的诊断报告。研究显示,AgentEYE显著提高了诊断报告的正确性、完整性和安全性,同时减少了错误引用与无法核实的“幻觉”文献,为构建可审计、可追溯的眼科临床决策支持系统提供了新路径。


▲长按识别二维码阅读论文
研究亮点
智能体架构:自动完成影像模态路由、专科工具调用、循证检索和报告整合,关键步骤均可检查与审计。
诊断质量:在302例内部多模态测试中,AgentEYE的诊断正确性和完整性评分分别为71.93和75.59,显著高于通用大模型直接分析图像的基线。
临床安全:3名眼科医生对200例病例进行盲法评价:AgentEYE诊断正确率为83.0%,完整率为82.5%,潜在有害输出率仅为3.5%。
从单一模型走向“自主协作”的眼科智能体
传统眼科AI通常采用“一种图像对应一个模型”的固定工作方式,难以模拟临床医生综合不同检查结果进行判断的过程。AgentEYE采用模块化智能体架构,将复杂诊断任务分解为多模态识别与路由、专科影像分析、循证检索与充分性判断,以及诊断整合与报告生成四个相互衔接的环节。
系统首先自动区分眼底照片和眼部B超图像,并将其分配至对应的专科分析工具;当影像结果存在不确定性或模态间冲突时,系统进一步检索临床指南及权威网络证据,并判断当前证据是否充分,必要时优化检索问题;最终由推理核心综合影像表现、专科工具结果和检索证据,生成包含诊断解释、鉴别诊断、处理建议和参考文献的报告。
这一设计并非简单地让大模型“直接看图并回答”,而是让大模型负责规划流程、调用工具、检查证据并整合结论,使每个关键步骤均可记录和审查。
大规模真实世界数据支持系统开发与评估
研究团队基于浙江大学医学院附属第二医院的临床数据建立AgentEYE开发队列,共纳入9049名患者、31393张眼底图像、43266张眼部B超图像和15244份参考报告或PDF记录。
随后,研究采用302例同日完成眼底照相和B超检查的病例进行主要内部测试,并从中选择200例开展由3名眼科医生完成的盲法评估,共形成400份候选报告和1200次独立评分。此外,团队还在中国和波兰的外部队列中检验系统的跨中心泛化能力。
专科影像工具是性能提升的关键
在302例内部多模态测试中,完整AgentEYE的诊断正确性评分达到71.93分,完整性评分达到75.59分;而直接使用通用大语言模型分析图像的基线分别仅为36.52分和48.57分。
消融实验显示,移除专科影像工具后,系统诊断正确性降至39.40分,说明专科工具是诊断性能提升的主要来源。相比之下,移除检索模块对正确性和完整性评分的影响较小,提示证据检索的主要价值并非简单提高诊断分数,而是增强报告的循证性、引用可靠性和可审计性。
这一发现说明,医学智能体的优势不只是连接更多模块,而在于根据不同任务,让专科模型、证据检索和大语言模型分别承担其最适合的角色。
眼科医生盲法评价验证安全性与证据可靠性
在200例病例的盲法评价中,3名眼科医生分别比较了AgentEYE与能够自行生成引用的大语言模型基线。基于多数投票,AgentEYE生成报告的诊断正确率为83.0%,明显高于基线的42.0%;报告完整率为82.5%,而基线为41.5%。AgentEYE产生潜在有害内容的比例仅为3.5%,显著低于基线的29.0%。
引用可靠性方面,AgentEYE有86.5%的引用被眼科医生评价为正确,而自行生成引用的大模型基线仅为46.5%。无法核实或疑似虚构的文献仅出现在基线组,在AgentEYE报告中未被发现。
多中心验证同时揭示系统能力边界
在皖南医学院外部队列的既定疾病类别中,AgentEYE较通用大模型基线将诊断正确性提高18.53分,完整性提高11.17分。
但在规模较小的波兰外部队列中,两种方法总体表现接近;对于超出专科工具既定标签范围的未见疾病,AgentEYE主要改善了报告完整性,并未显著提高诊断正确性。上述结果说明,AgentEYE能够在部分跨中心场景中保持优势,但其表现仍受到疾病谱、图像采集方式、报告规范及专科工具覆盖范围的影响,尚不能被视为具备开放世界诊断能力。

AgentEYE自动分析眼底和B超图像,结合医学证据生成可追溯的诊断报告

作者专访

Cell Press细胞出版社特别邀请论文通讯作者金凯研究员进行了专访,为大家进一步解读。








相关论文信息

论文原文刊载于CellPress细胞出版社旗下期刊Cell Reports Medicine上,点击“阅读原文”或扫描下方二维码查看论文

▌论文标题:
An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis
▌论文网址:
https://www.sciencedirect.com/science/article/pii/S2666379126003861
▌DOI:
https://doi.org/10.1016/j.xcrm.2026.102969
▌代码:
https://github.com/OpenMedAILab/AgentEYE
▲长按识别二维码阅读论文
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢