引入
NPJ Digital Medicine 是 Nature Portfolio 旗下的开放获取国际同行评议期刊,创刊于2015年,聚焦数字医学与数字健康领域,关注数字和移动健康技术的临床应用、人工智能与机器学习、临床信息学和虚拟医疗等研究。该刊被 Science Citation Index Expanded(SCIE)、Scopus 和 PubMed Central 等数据库收录;根据期刊官网公布的 2025 年数据,其 Journal Impact Factor 为 18.0,5 年影响因子为 19.7。
近日,复旦大学数据智能与社会计算课题组(Fudan DISC)联合复旦大学循证护理中心合作完成的研究《A domain-specific large language model for evidence-based nursing: development and multi-method evaluation of EviNurse》被 NPJ Digital Medicine录用。研究团队构建了基于护理证据的高质量数据集 NursData 并系统评估了面向循证护理的大语言模型 EviNurse,探索如何让高质量护理证据更及时地回应临床中的具体问题。
论文信息
论文题目:
A domain-specific large language model for evidence-based nursing: development and multi-method evaluation of EviNurse
发表期刊:npj Digital Medicine
DOI:https://doi.org/10.1038/s41746-026-03229-6
作者:Junyi Ruan, Shangzhe Dai, Zhijie Bao, Zhongyu Wei, Weijie Xing
合作单位:复旦大学护理学院、复旦大学大数据学院、上海创智学院
Github地址:https://github.com/Creeper12345/EviNurse
模型地址:https://huggingface.co/Agnania/EviNurse-32B
数据集地址:https://huggingface.co/datasets/Agnania/NursData-MCQ
NursData:打造高质量护理证据数据集
为训练护理领域大模型提供高质量语料,团队通过多渠道检索国内外护理领域资料,开发出首个护理证据高质量数据集NursData。该数据集涵盖公开可获取的期刊论文、医学指南、专业书籍、政策文件、电子书等资源,并根据5S证据金字塔模型对文献进行分类,最终构造了包含6000份证据总结、1.5万份指南及共识、50万份系统评价、7.5万份原始研究的大体量数据集。
除训练集外,为评估应答模型系统表现,团队收集了历年护士资格考试题总计3438题,作为选择题测试模型在护理领域的基本能力。接着,团队联合临床护理专家,基于现有的高质量护理证据编制问答题,全面测试模型在实际循证护理领域的表现。
模型训练:护理语境理解与应答能力显著提升
依托NursData的高质量数据支撑,团队构建了超百万级别的大模型指令微调样本对。该训练样本集从多来源护理证据文档中提炼关键知识信息,使用指令合成、思维链构造、小样本学习等多种数据构造方法产生符合护理领域实际应用需求的训练样本,确保模型在注入通用模型所缺乏的护理证据知识的同时,更好地对齐人类偏好,满足临床应用场景。
团队同时采用了检索增强技术来进一步增强模型回复的可信度及可解释性。基于NursData,团队构建了超70万条的护理证据向量知识库,并针对护理证据场景设计了双重检索、覆盖性补全、元信息增强等检索方案,可有效减缓大语言模型在使用过程中的幻觉问题,优先获取较高等级的证据,提高证据可靠性和有用性。

多方法评价:从自动化测试到真实世界可用性
研究从自动化评价、专家评价和真实世界可用性评价三个层面进行综合评估。在 3438 道选择题中,EviNurse 的准确率在全部参与比较的模型中排名第二,仅低于 Gemini-3-flash-preview(94.33%),并优于 Qwen3-32B、Baichuan4、DeepSeek-R1、Qwen3-14B 和 GPT-5.2 Instant。
专家评价从 491 题简答题池中有目的地选取 25 题,每个内科、外科、妇产科、儿科及急危重症护理专科各 5 题,由相应专科的 3 位专家独立评价,共计 15 位专家参与。结果显示,EviNurse 在专家评价中整体显著优于通用大语言模型(P < 0.001),在可靠性和满意度方面表现最强;在外科、儿科及急危重症护理中,模型间的表现差异尤为明显。

图2 EviNurse 与通用大语言模型的专家评价结果(数值越低代表回答质量更高)
真实世界可用性评价共纳入来自中国大陆各省不同临床场景的 316 名护士。问卷覆盖模型质量、信息质量、界面质量、用户满意度、使用意愿和净获益六个维度。EviNurse 在六个维度均显示出良好可用性;由于量表中较低得分代表更好的使用体验,这一结果提示其在真实护理情境中具有良好的可接受性和应用潜力。
复旦大学数据智能与社会计算实验室
Fudan DISC
联系方式:disclab@fudan.edu.cn
地址:复旦大学袁天凡、慧敏校园C栋
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢