DRUGONE

生物医学研究依赖于从已有知识和实验数据中提出新的、可验证的科学假设。然而,生物医学文献、蛋白质相互作用网络及多组学数据正以前所未有的速度增长,单个研究人员很难系统整合分散在不同来源中的信息。大语言模型虽然能够阅读文献并生成解释,但容易产生缺乏证据的内容,也难以直接利用转录组、蛋白质组和磷酸化蛋白质组等实验数据;图学习和多模态模型能够整合复杂数据,却通常缺少透明的机制推理。


研究人员开发了名为XunZi的人工智能生物学家,将基于大语言模型的逻辑推理模块XunZi-R与基于图卷积网络的多模态数据融合模块XunZi-M结合起来。XunZi-R经过约2440万篇生物医学文献、200余万条结构化生物学语料和超过33万条人工校正的基因—疾病机制解释训练,用于判断基因是否在特定疾病中发挥功能并生成相关基因、通路及作用机制。XunZi-M则整合约613 TB多组学数据、约281万个蛋白质相互作用以及超过4.7万个生物过程注释,学习疾病背景下的基因表示。两个模块的输出进一步融合,用于为疾病修饰靶点排序并提供可实验检验的机制解释。


在非小细胞肺癌中,XunZi预测出此前未被充分认识的调控因子MYO1B。实验表明,降低MYO1B会抑制肺癌细胞活力,并降低AKT和ERK通路活性,与模型提出的机制一致。在帕金森病中,XunZi识别出CHK2、IRAK4和STK33等候选致病激酶。两种帕金森病小鼠模型均显示Chk2异常激活。遗传降低Chk2或使用选择性抑制剂CCT241533均可改善运动障碍、减少黑质多巴胺能神经元丢失,并抑制相关分子病理变化。研究还发现CHK2可能位于帕金森病关键激酶LRRK2上游,提示二者存在此前未明确的功能联系。


这些结果表明,将文献推理与多组学图学习相结合,可以从碎片化知识和数据中形成新的机制假设,并将计算预测推进至细胞和动物实验验证。XunZi为人工智能参与疾病机制研究和治疗靶点发现提供了新的工作范式。

提出科学假设是生物医学研究的起点。研究人员通常需要阅读大量文献,理解特定基因、蛋白质和通路之间的关系,再结合实验数据判断哪些分子可能驱动疾病发生,最终提出可验证的机制模型。这种过程高度依赖研究人员的知识积累、逻辑推理和对不同数据类型的综合理解。


随着开放获取文献和公共数据资源迅速扩张,传统工作方式面临明显瓶颈。关于同一个疾病的知识可能分散在遗传学、细胞生物学、蛋白质组学、药理学和动物实验等不同领域。一个基因在文献中可能只被描述为参与某个基础生物过程,但其在特定疾病中的作用需要结合表达变化、蛋白质互作、磷酸化状态及组织特异性才能被识别。人类研究人员难以同时追踪数千万篇文献和数百TB实验数据,这限制了新机制和新靶点的发现。


大语言模型为生物医学知识检索和假设生成提供了新工具。它们可以理解自然语言、总结文献并生成机制解释,但其回答主要受训练文本驱动,可能把相关性误认为因果性,甚至生成不存在的基因关系或通路。单纯依靠文献也难以发现尚未被报道的新靶点,因为真正的新发现通常缺少直接的文本证据。


多组学模型和图神经网络具有互补优势。它们可以把基因表达、蛋白质丰度、磷酸化变化、蛋白质互作和功能注释映射到统一的计算空间,识别疾病条件下异常的分子网络。然而,这类模型通常只输出分数或排序,难以解释一个候选基因为什么与疾病有关、可能影响哪些下游分子以及应该如何设计验证实验。


XunZi的核心思想是模仿人类认知中逻辑推理与整体信息整合的协同过程。一方面,通过领域大语言模型阅读和推理生物医学知识;另一方面,通过图学习从多组学数据中发现疾病特异的统计和网络证据。只有当两个模块提供相互支持的信息时,候选基因才会获得较高优先级,从而减少纯文本模型的幻觉,也避免多组学模型缺乏机制解释的问题。



方法

研究人员首先以一个73亿参数的开放大语言模型为基础,利用约2441万篇生物医学文献以及基因功能、疾病本体和基因本体等结构化语料进行持续预训练,构建XunZi-R。随后从多个基因—疾病数据库收集关联,并结合相关文献生成基因在疾病中的功能解释,包括作用机制、受影响基因和相关通路。研究人员逐条检查这些解释,修正虚构关系、事实错误、逻辑矛盾和信息缺失,最终形成包含阳性和阴性基因—疾病关系的机制推理语料,用于训练模型判断功能关联并输出结构化解释。XunZi-M以蛋白质和生物过程为节点,整合多个蛋白质相互作用数据库和功能注释,构建包含约62万个节点和609万条边的知识图谱;再将肿瘤及神经退行性疾病的转录组、蛋白质组和磷酸化蛋白质组特征加入基因节点,通过图卷积学习疾病相关表示。针对非小细胞肺癌和帕金森病,研究人员在预训练模型基础上加入疾病特异多组学数据进行微调。最终,XunZi将XunZi-R的机制推理置信度与XunZi-M的图表示融合,为候选靶点打分。预测结果通过肺癌细胞基因敲低、神经细胞毒性实验、两种帕金森病小鼠模型、病毒介导的基因降低、激酶抑制剂治疗、行为学测试、免疫印迹、组织染色和转录组分析进行验证。



结果

XunZi融合逻辑推理与多模态生物数据

XunZi-R覆盖肿瘤、神经系统疾病、心血管疾病、消化系统疾病和先天异常等多类疾病。与多个通用或生物医学大语言模型相比,它在判断基因是否功能性参与疾病方面具有更高准确率,并能够生成更加接近人工校正机制描述的解释。其优势不仅体现在常见疾病,在知识较少的罕见疾病类别中也保持了相对稳定的表现。


XunZi-M整合了泛癌和神经退行性疾病数据。泛癌部分包括33种癌症中的转录、蛋白和磷酸化信息,神经退行性疾病部分则覆盖多个脑区及不同疾病状态。图模型通过蛋白质相互作用和生物过程节点传播信息,使缺少直接组学测量的基因也可以从邻近分子和通路中获得上下文表示。


当两个模块融合后,XunZi在泛癌和神经退行性疾病任务上均优于任一单独模块,也优于通用大语言模型、普通深度神经网络和支持向量机。这说明文献推理与实验数据不是简单重复的信息来源,而是能够相互校正:文献模块提供生物学语义和可解释机制,多组学模块提供疾病背景下的实证约束。

图1|XunZi人工智能生物学家的总体框架。


XunZi发现非小细胞肺癌调控因子MYO1B

在非小细胞肺癌任务中,XunZi的预测性能明显高于通用大语言模型和传统机器学习方法。其学习到的基因表示能够将已知肺癌调控基因聚集到相近区域,说明模型捕获了与肺癌功能相关的分子特征。


研究人员从排名靠前且此前未被报道的候选基因中选择20个进行功能筛选。在A549肺癌细胞中,降低MYO1B、NAA30、BRCC3、GFPT1和PGAM5均明显降低细胞活力。相比之下,从传统差异表达分析中选择的20个未充分研究基因只有一个表现出类似作用,说明单纯依据表达变化容易错过真正具有功能影响的调控因子。


MYO1B尤其具有代表性。通用大语言模型未能识别其与肺癌的功能关联,而XunZi不仅将其列为候选调控因子,还提出MYO1B可能通过PI3K–AKT和MAPK–ERK信号影响肿瘤细胞增殖、存活和迁移。实验降低MYO1B后,AKT和ERK的磷酸化均明显下降,验证了模型提出的下游机制。


在另一种非小细胞肺癌细胞中,部分候选基因同样影响细胞活力;但在小细胞肺癌和肝癌细胞中的作用明显减弱,显示XunZi的预测具有一定疾病和细胞背景特异性,而不是简单寻找普遍影响细胞生存的基因。


XunZi识别帕金森病相关激酶网络

帕金森病涉及线粒体功能障碍、氧化应激、蛋白质稳态破坏、α-突触核蛋白聚集和异常磷酸化等多个过程。研究人员建立了MPTP毒性模型和α-突触核蛋白预形成纤维模型,并对黑质和相对不易受累的小脑进行转录组、蛋白质组和磷酸化蛋白质组分析。


常规差异分析主要得到转录调控和细胞内运输等较宽泛的过程,而XunZi识别出线粒体功能障碍、激酶异常和α-突触核蛋白聚集等更接近帕金森病核心病理的机制。模型还将已知帕金森病激酶LRRK2和PINK1排在高位,说明其能够恢复已有生物学知识。


研究人员进一步建立帕金森病蛋白激酶预测模型。XunZi的预测性能明显高于其他方法,并从全部蛋白激酶中筛选出20个候选分子。细胞实验显示,降低Chk2、Irak4和Stk33能够减轻神经毒物诱导的细胞死亡,提示它们可能具有致病作用;降低Dapk2和Grk5则加重损伤,提示这些激酶可能发挥保护作用。


对STK33的进一步实验显示,降低Stk33可以抑制MAPK信号活化、减少细胞凋亡相关变化,并降低病理性α-突触核蛋白磷酸化。这些结果支持XunZi不仅能够预测候选基因,还能够提出可验证的下游通路。

图2|XunZi在非小细胞肺癌和帕金森病中的靶点预测与功能筛选。


CHK2是帕金森病中的潜在致病激酶

在多个候选激酶中,CHK2受到重点关注。XunZi推测CHK2可通过DNA损伤反应、细胞周期调控、氧化应激和线粒体功能影响帕金森病,并关联TP53、LRRK2等关键基因。相比之下,通用大语言模型直接判断CHK2与帕金森病不存在功能联系。


在MPTP模型中,黑质内磷酸化Chk2显著升高,而Chk2总蛋白变化不明显,说明疾病主要引起激酶活化。在α-突触核蛋白纤维模型中也观察到相似变化。小脑中未出现对应异常,表明Chk2激活与帕金森病易损脑区具有一定特异性。Irak4的活化也在两种模型中升高。


研究人员随后利用腺相关病毒在黑质中降低Chk2。正常情况下,Chk2降低并未明显影响小鼠自主活动或运动协调。MPTP处理后,对照小鼠在爬杆和转棒实验中出现严重运动障碍,而Chk2降低小鼠的运动表现明显改善。组织分析显示,Chk2降低抑制了病理性Chk2活化,恢复酪氨酸羟化酶水平,并显著减少黑质多巴胺能神经元丢失。


这些结果说明CHK2并非仅是疾病损伤后的伴随标志,而是参与多巴胺能神经退行性过程的功能性调控因子。降低其表达能够改变疾病表型,因此CHK2符合疾病修饰靶点的基本特征。

图3|XunZi预测CHK2参与帕金森病及其遗传学验证。


药理抑制Chk2改善两种帕金森病模型

研究人员使用选择性Chk2抑制剂CCT241533验证其药物靶点潜力,并以曾进入帕金森病临床研究的LRRK2抑制剂作为比较。在MPTP模型中,不同剂量的CCT均改善了爬杆表现,较高剂量还将转棒表现恢复至接近正常水平。药物对未患病小鼠的运动行为没有明显影响。


分子分析显示,CCT降低了Chk2活性,恢复了黑质酪氨酸羟化酶表达,并减少多巴胺能神经元死亡。药物没有明显改变相关激酶Chk1的活性,支持其作用具有一定选择性。CCT同时降低p53活化,与XunZi提出的Chk2—p53 DNA损伤通路一致。


XunZi还提出CHK2可能调控LRRK2。研究人员发现,抑制Chk2会降低LRRK2活化,并检测到CHK2与LRRK2的蛋白相互作用。Chk2抑制剂与LRRK2抑制剂引起的转录变化具有较大重叠,共同影响神经发育、神经元分化和神经肽信号等过程,说明二者可能调节部分相同的下游程序。


在α-突触核蛋白纤维模型中,连续使用CCT同样改善运动缺陷,降低病理性α-突触核蛋白磷酸化、Chk2活化和p53活化,并保护黑质多巴胺能神经元。由此,遗传降低和药理抑制两条独立证据共同支持CHK2是帕金森病中的可干预靶点。

图4|Chk2抑制剂缓解帕金森病小鼠表型。



讨论


XunZi的主要创新在于将两类能力整合到同一系统中。XunZi-R能够以自然语言解释基因在疾病中的潜在作用,XunZi-M则利用多组学和网络信息判断这些解释是否得到疾病数据支持。二者的结合减少了单纯依赖文献导致的保守预测,也降低了大语言模型生成无证据机制的风险。


MYO1B和CHK2的发现体现了这种组合的价值。MYO1B此前并非公认的非小细胞肺癌调控因子,但模型从网络和多组学背景中识别其重要性,并进一步给出AKT和ERK通路解释。CHK2与帕金森病之间同样缺乏明确的既有机制联系,但模型将DNA损伤、p53、线粒体异常和LRRK2连接起来,形成了能够指导实验的假设。


尤其值得注意的是CHK2与LRRK2的潜在联系。实验支持二者存在蛋白相互作用,而且抑制CHK2可降低LRRK2活化。然而,当前结果尚不能确定CHK2是否直接磷酸化LRRK2,也可能通过其他激酶或信号中间体间接调控。因此,这一机制仍需进一步进行体外激酶实验、位点鉴定和结构研究。


XunZi也存在局限。现有训练数据把许多尚未研究的基因—疾病关系视为阴性,这可能把真正的新关联错误标记为无关。人工校正机制语料虽然减少了幻觉,但也可能引入研究人员的主观偏倚。对于数据稀少的罕见疾病,模型的泛化能力仍不确定。此外,动物模型结果不能直接等同于人类临床疗效,CCT241533的长期安全性、药代动力学和人体适用性仍需系统评价。


未来可将时间和空间分辨的单细胞多组学、蛋白质结构、医学影像和电子病历加入系统,使预测更接近真实疾病过程。若进一步与自动化实验平台连接,人工智能可以从提出候选靶点发展为设计实验、读取结果并迭代修正假设的闭环系统。


总体而言,XunZi并不是用人工智能替代生物学家,而是将人类难以同时处理的海量知识和数据转化为可检验的研究方向。其在肺癌和帕金森病中的验证表明,逻辑推理、多组学融合和实验检验的结合,有望缩短从计算预测到疾病机制发现及治疗靶点验证的路径。

整理 | DrugOne团队


参考资料


Huang, X., Qin, J., Tang, F. et al. XunZi, an AI biologist, reveals disease-modifying targets. Nat. Biomed. Eng (2026). 

https://doi.org/10.1038/s41551-026-01769-6

内容为【DrugOne】公众号原创转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除