DRUGONE

急性肾损伤(Acute Kidney Injury,AKI)是住院患者最常见且最严重的并发症之一,早期识别高危患者对于降低死亡率和改善预后具有重要意义。然而,目前多数AKI预测模型虽然具有较好的判别能力,却普遍存在假阳性率高、临床解释能力不足等问题,导致医生容易产生“报警疲劳”,限制了人工智能模型在真实临床环境中的推广应用。研究人员开展了一项覆盖我国四家不同地区医院、多中心回顾性队列研究,构建了由两个大型语言模型组成的协同框架,包括用于24小时内急性肾损伤实时预测的AKI-PM(Prediction Model)和用于风险解释的AKI-RAM(Risk Attribution Model)。研究共纳入140637例住院患者,通过肾脏领域专门预训练、监督微调以及专家对齐训练,实现了预测与解释相结合的智能决策支持体系。结果显示,AKI-PM不仅具有优异的预测性能,而且在外部医院经过少样本适配后仍保持良好的泛化能力;AKI-RAM则能够自动识别可干预与不可干预风险因素,并生成具有临床指导价值的个体化建议。研究认为,该双模型框架有效解决了传统人工智能预测模型“准确但难解释”的瓶颈,为急性肾损伤的早期预防提供了一种兼具高准确性、可解释性和可推广性的解决方案。

急性肾损伤是全球重要的公共卫生问题,每年影响数千万住院患者,并导致大量死亡。由于目前尚缺乏针对急性肾损伤的特异性治疗方法,因此预防始终是降低疾病负担的核心策略。研究表明,相当比例的急性肾损伤可以通过优化液体管理、避免肾毒性药物以及及时处理感染等措施得到预防,因此,如果能够提前识别高风险患者,便有机会阻止疾病发生。


近年来,大量机器学习模型被用于急性肾损伤预测,并取得较高的AUC。然而,这些模型大多存在两个突出问题。一方面,由于阳性预测值较低,模型容易产生大量误报警,增加医生工作负担,降低临床信任度;另一方面,多数模型只能输出风险概率,无法解释导致预测结果的具体原因,更无法给出针对性的干预建议,因此难以真正融入临床决策流程。


大型语言模型的发展为解决这一问题提供了新的可能。相比传统机器学习,大语言模型能够同时理解电子病历中的结构化数据、自由文本及时间序列信息,并利用丰富医学知识建立更加符合临床思维的推理过程。虽然已有少量研究尝试利用大语言模型预测围手术期或重症患者急性肾损伤,但样本规模有限,泛化能力不足,也缺乏针对风险来源的系统解释。因此,研究人员希望构建一个既能够准确预测急性肾损伤,又能够解释风险来源并指导临床干预的大语言模型框架,提高人工智能在真实临床中的应用价值。



方法

研究人员基于Qwen2.5-7B构建两个相互协同的大语言模型。首先开发AKI-PM预测模型,利用包含42.6亿词元的肾脏专科语料进行持续预训练,语料来源包括肾病临床指南、医学文献、MIMIC-IV和eICU公开数据库以及北京大学第一医院电子病历;随后采用47750例住院患者电子病历进行监督微调,实现未来24小时急性肾损伤动态预测。与此同时,研究人员开发AKI-RAM风险归因模型,通过人工标注的600例专家示范数据及偏好优化训练,使模型能够自动识别患者不可改变风险因素、可干预风险因素,并进一步生成个体化临床建议。整个系统最终在来自北京大学第一医院、四川省人民医院、北京密云医院及太原市中心医院共140637例患者中进行内部和外部验证,并进一步开展少样本迁移学习及临床专家评价。



结果

多中心大规模数据验证AKI-PM具有稳定预测能力

研究首先构建覆盖四家医院的大规模验证队列,共纳入住院患者140637例,其中急性肾损伤发生率约4.8%,近一半患者属于中重度急性肾损伤。不同医院患者年龄、疾病组成及住院特点存在明显差异,例如四川省人民医院重症患者比例更高,而密云医院和太原市中心医院以内科患者为主,体现了研究数据具有较好的异质性。


在北京大学第一医院内部验证中,AKI-PM表现出较高预测能力,AUC达到0.95,预测准确率达到0.91,阳性预测值达到0.68,明显优于此前多数针对普通住院患者建立的机器学习模型。同时,模型平均推理时间仅约0.23秒,能够满足实时临床预警需求。


研究人员进一步将模型直接应用于三个完全独立的外部医院。即使采用零样本预测,模型依然保持较高准确率,AUC维持在0.88至0.91之间,说明模型具有良好的跨医院泛化能力。不过,不同医院之间敏感性和阳性预测值仍存在一定差异,提示不同医疗机构之间电子病历特征和患者构成仍会影响模型表现。

图1: 大语言模型AKI-PM与AKI-RAM整体框架及多中心验证流程。


AKI-PM预测性能优于现有主流大型语言模型

为了进一步评价模型性能,研究人员将AKI-PM与多个公开大型语言模型进行比较,包括医学专用模型和通用大型语言模型。


结果显示,在未经训练的零样本条件下,多数通用模型表现并不稳定,部分模型虽然具有较高敏感性,却伴随大量误报警;另一些模型则更加保守,导致漏诊增加。随后,研究人员采用与AKI-PM完全相同的数据和训练策略,对多个可微调模型重新训练。


经过统一训练后,各模型性能均有所提高,但AKI-PM依然保持整体最佳表现,不仅获得最高预测准确率,而且阳性预测值达到所有模型最高水平。这意味着AKI-PM能够在保持较高识别率的同时,有效减少误报警,提高临床应用价值。


研究人员指出,这一优势主要来源于三个方面:首先,大规模肾脏专科语料持续预训练使模型学习了更加丰富的医学知识;其次,将传统时间序列电子病历重新组织为具有时间逻辑的自然语言文本,更符合大型语言模型理解方式;最后,通过专门针对急性肾损伤任务设计提示工程,使模型能够更加准确理解临床上下文。

图2: AKI-PM与多个医学及通用大型语言模型预测性能比较。


少样本学习显著提升模型跨医院泛化能力

针对不同医院之间存在的数据分布差异,研究人员进一步引入少样本学习策略,希望利用极少量本地数据快速适应新的临床环境。


结果显示,仅利用1000例本地病例进行快速微调后,模型在四川、密云和太原三个外部医院的整体性能均明显提升。其中四川医院AUC由0.88提高至0.96,预测准确率由0.82提高至0.92,阳性预测值由0.47提高至0.74,误报警明显减少;密云医院和太原市中心医院敏感性也分别提高至0.67左右。


进一步分析不同样本数量发现,即使仅使用数百例本地病例,模型已经能够明显改善预测效果,说明AKI-PM具有较强迁移学习能力,可以快速适应不同医院电子病历特点,而无需重新训练完整模型。


随后,研究人员进一步分析模型在不同患者亚群中的表现。结果显示,无论高龄患者、肾功能减退患者、心脏手术患者还是血管介入患者,模型均保持较高预测性能,仅在ICU患者中由于疾病复杂程度较高,预测准确率略有下降,但整体仍保持良好的临床应用价值。

图3: AKI-PM在不同医院及不同患者亚群中的预测性能。


AKI-RAM实现可解释风险归因,并提供个体化临床干预建议

在完成急性肾损伤风险预测之后,研究人员进一步开发了风险归因模型AKI-RAM,希望解决传统人工智能模型“能够预测但无法解释”的问题。


不同于以往仅输出风险概率或重要变量排序的方法,AKI-RAM采用分层推理框架,将整个风险分析过程划分为三个连续步骤:首先识别患者不可改变的基础风险因素;随后分析可以通过医疗干预改善的危险因素;最后结合上述结果自动生成针对当前患者的临床建议。


研究人员展示了一例典型病例。模型首先识别患者年龄较大、既往存在心血管疾病以及既往手术史等不可改变风险;随后进一步发现患者近期液体摄入不足、新发感染以及可能存在肾毒性药物暴露等可干预危险因素;最后自动建议加强液体管理、积极控制感染、重新评估用药方案并动态监测肾功能。整个推理过程与肾内科医生实际临床思维高度一致,而不仅仅停留在风险预测层面。


为了评价模型真实临床价值,研究人员邀请来自四家医院的6位具有丰富临床经验的肾内科医生,对200例患者进行独立评价,从病例理解、指南一致性、临床推理、风险因素合理性、建议可接受性以及模型可信性等8个维度进行打分。


结果显示,AKI-RAM在所有评价指标上均获得较高评分。其中,病例理解、指南一致性和临床推理均达到4分以上;针对风险因素分析和临床建议,平均评分分别达到4.55和4.74;而在减少模型幻觉、降低偏倚以及避免潜在危害等安全性指标上,平均评分均接近4.9分。不同医院医生之间评价结果保持较高一致性,说明模型输出具有良好的稳定性和临床可信度。


研究人员认为,AKI-RAM最大的价值并非简单解释模型结果,而是能够直接生成可操作的临床建议,使人工智能真正参与临床决策,而不仅仅作为预测工具。

图4: AKI-RAM风险归因流程及肾内科专家多维度临床评价。


专科预训练与时间序列重构共同提升模型性能

为了进一步分析模型性能来源,研究人员分别评估了不同训练策略对预测能力的影响。


首先比较是否采用肾脏专科语料持续预训练。结果发现,仅采用监督微调虽然已经能够获得较高预测能力,但继续利用42.6亿词元肾脏专业语料进行持续预训练后,模型预测性能进一步提高,AUC由0.93提高至0.95,预测准确率由0.89提高至0.91,阳性预测值由0.62提高至0.68。这说明大规模领域知识能够帮助模型更加准确理解电子病历中的医学信息。


随后,研究人员进一步比较电子病历不同输入方式。传统方法通常将连续时间序列直接拼接为字符串输入,而研究团队重新设计了符合临床诊疗逻辑的时间序列文本,将不同时间节点的生命体征、实验室指标和治疗措施按照时间顺序组织成自然语言描述。


结果显示,这种时间一致性的文本表示方式明显提高了模型理解能力,相比传统字符串输入,预测准确率提高约45%,特异性提高约59%,阳性预测值提高约141%。研究人员认为,这说明大型语言模型更加适合理解具有自然语言逻辑的临床病程,而非简单数值排列。


与此同时,研究团队还比较了是否采用偏好优化进行临床对齐训练。结果显示,经过肾内科专家偏好优化后,AKI-RAM生成的风险分析更加符合临床思维,不仅推理过程更加完整,而且建议更加具体,显著提高了医生对模型输出的认可程度。


这些结果说明,医学领域持续预训练、符合临床逻辑的数据组织方式以及专家偏好对齐,是提升医学大语言模型临床性能的重要组成部分。

图5: 专科预训练、时间序列表示及偏好优化对模型性能的影响。


大语言模型实现跨医院快速迁移,为临床部署提供可行方案

研究最后进一步分析了模型在真实医院部署中的适应能力。


不同医院之间不仅患者组成存在差异,电子病历格式、检查流程以及诊疗习惯也明显不同,因此传统机器学习模型通常需要重新训练才能迁移应用。


AKI-PM则采用少样本迁移学习策略,仅利用少量本地病例即可快速完成适配。研究结果表明,仅需极少数量的医院本地数据,模型便能够明显改善预测能力,而无需重新构建整个模型。


研究人员认为,这种部署方式特别适合医疗资源有限地区。一方面,大医院可以利用丰富数据完成模型训练;另一方面,基层医院仅需极少量本地病例即可完成快速适配,大幅降低人工智能落地成本,也避免了重新收集大量训练数据所需的人力和时间。


与此同时,AKI-RAM能够根据不同医院患者特点自动调整风险分析和临床建议,使预测结果更加符合当地实际医疗环境,为未来跨医院推广提供了现实基础。

图6: AKI-PM与AKI-RAM跨医院迁移部署及临床应用流程。



讨论

本研究构建了由AKI-PM和AKI-RAM组成的双模型大语言模型框架,在目前急性肾损伤智能预警研究中实现了预测能力与临床可解释性的统一。不同于传统机器学习模型主要关注风险分类,研究人员将预测、风险归因和临床建议整合到同一系统中,使人工智能不仅能够识别未来24小时发生急性肾损伤的高危患者,还能够进一步解释导致风险增加的具体原因,并提出针对性的干预措施,从而实现真正意义上的临床决策支持。


研究的重要创新之一,在于建立了针对肾脏疾病的大规模医学预训练体系。通过持续学习42.6亿词元肾脏专业知识,再结合真实电子病历微调,模型不仅保持了大型语言模型的通用推理能力,还获得了较强的专科医学知识储备。同时,研究创新性地将电子病历时间序列转换为符合临床诊疗逻辑的自然语言描述,使模型能够更加准确理解患者病程变化,从而显著提高预测性能。


另一个突出特点是模型具备较强的临床可解释性。传统机器学习虽然可以利用特征重要性解释预测结果,但难以转化为具体临床决策;AKI-RAM则能够区分不可改变和可干预危险因素,并结合患者具体情况生成个体化建议,使医生能够直接采取相应干预措施。这种从"预测风险"到"指导干预"的转变,大大提高了人工智能在临床实践中的实际价值。


此外,研究证明,大语言模型具有良好的跨医院迁移能力。通过少样本学习即可快速适应不同医院电子病历特点,为未来大规模部署提供了现实路径。研究人员也指出,目前模型在重症监护病房患者中的表现仍略低于普通病房,未来可进一步针对ICU患者开展专门训练。同时,本研究仍属于回顾性验证,后续仍需开展前瞻性随机临床试验,进一步评估模型辅助决策是否能够真正降低急性肾损伤发生率和改善患者预后。总体而言,该研究为大语言模型在临床风险预测、可解释人工智能以及智能决策支持系统中的应用提供了新的范例,也为未来智慧医疗的发展奠定了重要基础。

整理 | DrugOne团队


参考资料


Xu, L., Yan, K., Zhang, Z. et al. Large language model driven multicenter prediction and explainable risk attribution of acute kidney injury. Nat Commun (2026). 

https://doi.org/10.1038/s41467-026-76029-x

内容为【DrugOne】公众号原创转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除