Xun Zi, filósofo chino: “La naturaleza te da la forma, pero es el esfuerzo  quien te da la fuerza” - AS.com

生物医学领域的假设生成受到人类认知能力的限制,难以整合来自碎片化生物医学知识和多模态数据源的洞见。本文介绍 XunZi,一款人工智能生物学家,它整合了逻辑推理和多模态数据融合,能够自主生成具有可验证机制的全新治疗靶点假设。XunZi 已使用 2440 万篇文献和 613.6 TB 的多源数据进行训练,涵盖 21008 个人类基因和 5850 种疾病,在各种疾病背景下,其准确性和可解释性均优于现有方法。在帕金森病 (PD) 中,复杂的机制和有限的靶点阻碍了治疗研发,XunZi 在多个模型中识别出 CHK2 和 IRAK4 激酶的异常激活。药理学或基因抑制 Chk2 可以挽救帕金森病小鼠的多巴胺能神经元丢失和运动障碍。我们进一步证明了XunZi在非小细胞肺癌等疾病中的广泛应用前景。XunZi建立了一个颠覆性的框架,将零散的生物医学知识和数据转化为可操作的治疗方案。

论文:XunZi, an AI biologist, reveals disease-modifying targets

单位:华科、川湖北红山实验室、华中农业大学

发布日期:2026年

code: https://github.com/biocuckooHXH/XunZi

下载论文https://t.zsxq.com/cLdKM

请索引第123篇论文

荀子如何把2440万篇文献喂出一个帕金森新靶点

生物医学研究里最贵的东西从来不是试剂,而是一个真正原创、且能被实验证伪的科学假说。

几千年来,这件事牢牢攥在人类生物学家的脑子里——靠的是从海量文献里找线索,从多组学数据里看出模式,再凭经验和直觉拧成一条"基因A通过通路B导致疾病C"的因果链。但今天,PubMed 里躺着数千万篇文献,TCGA、CPTAC、Synapse 里的多组学数据早已突破 TB 级,任何一位天才科学家,认知带宽都不够用了。

2026年8月4日,华中科技大学薛宇团队联合四川大学华西医院雷鹏、华西第二医院贾大团队,在 Nature Biomedical Engineering 上发表了一篇封面级别的研究——他们给这位"AI生物学家"起了个很中国的名字:XunZi(荀子)。

图1展示了XunZi的双模块架构。这个系统的野心大到有点不讲理:它要把"读文献、融数据、提假说、给机制"这条原本只有人类PI能走的路,全自动化。而它真正做到的程度,让整个AI+生命科学交叉领域都得重新想一想——原来"AI提假说"不是PPT概念,是可以一路做到老鼠爬杆实验的。

01 荀子不是另一个聊天机器人,它是"左脑+右脑"的合体

很多团队做AI for Science,思路是"找个最强的大模型,prompt工程拉满"。Google 的 AI co-scientist 走的就是这条路——多智能体互相问答、批判、迭代。

作者们换了条更"仿生"的路:他们认为,人类大脑之所以能提出好假说,是因为左半球的逻辑推理和右半球的整体信息整合在协同工作。于是 XunZi 被显式拆成了两个模块:

XunZi-R(推理模块):基座是 Mistral 7B(73亿参数,在当下算"中小模型")。团队用 24,411,924 篇生物医学文献、2,054,130 条结构化生物语料(来自NCBI gene_info、GeneRIF、Disease Ontology、Gene Ontology)对它做持续预训练,让它先把生物学"内功"练扎实。接着,用 336,108 条经过人工逐条校对的思维链(CoT)机制解释做指令微调——这些语料把"基因X在疾病Y中有没有功能作用"这个问题,训练成模型能输出"机制描述+受影响基因+受影响通路"的结构化回答。

XunZi-M(多模态融合模块):用图卷积网络(GCN)整合 613.2 TB 多组学数据、2,813,799 条蛋白质相互作用、47,922 条生物过程GO注释,构建一个超过62万节点、609万边的知识图谱,每个节点嵌入为4096维向量。

两个模块的输出在最后一层做特征级融合,得到一个统一置信分,对候选基因排序,并同时给出"为什么"。

这里有个反直觉的设计哲学:作者故意没用GPT-4o、Claude这种千亿巨兽,而是用73亿参数的小模型,靠"喂专业数据+CoT微调"在窄领域里反超大模型。图1c的混淆矩阵显示,XunZi-R 正类判对率 90.2%,而 GPT-4o 只有 54.1%——基本在抛硬币。原因很直白:通用大模型倾向于回答"这个基因跟这个病没关系",而发现新靶点恰恰需要模型敢于在正类上说"yes"。

02 训练语料的"人工校对"细节,才是荀子抗幻觉的真正秘密

AI提假说最大的槽点是"一本正经地胡说八道"。作者们在CoT语料构建这一步下了狠功夫,值得每一个做AI+生物的交叉学科研究者抄作业:

1. 从 DisGeNET(47,576条)和 CTD(34,166条)取原始基因-疾病对,去冗余后得到 77,118 对唯一关联

2. 通过 PubMed API 为每对下载最相关的3篇文献

3. 用 GPT-4 按固定模板生成 JSON 格式的机制解释

4. 6名学生逐条人工核查,纠正四类错误:无根据的编造、事实不准确、逻辑不一致、过度简化

5. 最终保留 116,301 条正样本 + 219,807 条负样本(负样本显式标注为"无证据支持该基因在该疾病中的功能参与")

这套"AI生成 + 人类严审"的流水线,是 XunZi-R 能把幻觉压到比 GPT-4o 低得多的关键。它学到的不只是"什么是对的",更是"什么是噪音"——这种双向判断,恰恰是发现新靶点的核心能力。

03 第一站:非小细胞肺癌,XunZi 找到了 MYO1B

作者在 NSCLC 上先验证了系统的实战能力。

XunZi 在 NSCLC 靶点预测里拿到 AUC = 0.86,而 GPT-4o 只有 0.65,DNN 0.72,SVM 0.70。他们从 XunZi 预测的 Top20 未报道基因里挑出候选,在 A549 细胞里做 siRNA 敲低——5个基因(MYO1B、NAA30、BRCC3、GFPT1、PGAM5)敲低后显著降低了细胞活力,命中率 25%。

图2c-2h 展示了关键的实验验证。最有意思的是 MYO1B 这个案例:GPT-4o 完全没识别出它与肺癌的关联,但 XunZi 不仅识别了,还给出了机制预测——通过 PI3K/AKT 和 MAPK/ERK 通路影响肿瘤进展。后续免疫印迹实验证实,敲低 MYO1B 后,AKT 和 ERK 的磷酸化水平确实显著下降。计算预测与湿实验完美对齐。

作为对照,作者用传统的"差异表达基因"策略挑了20个基因做同样实验,只有1个有效。XunZi 的筛选效率是传统方法的 5 倍。

04 帕金森病,XunZi 挖出了 CHK2

帕金森病(PD)是出了名的"靶点荒漠"——病理机制高度异质,现有可成药靶点极少。作者把 XunZi 的激酶预测模型用到 PD 上,AUC 达到惊人的 0.92,而 GPT-4o 只有 0.52(基本等同随机)。

图2l-2o 展示了 PD 激酶预测的 t-SNE 可视化和细胞实验验证。XunZi 不仅把已知的 PD 核心激酶 LRRK2、PINK1 排在了前面,还筛选出了 CHK2、IRAK4、STK33 等候选。

接下来是这篇论文最精彩的部分——作者用 两种机制完全不同的 PD 小鼠模型(MPTP 神经毒素模型 + α-syn PFF 纤维注射模型)做了验证:

图3a-3e 显示,在两种模型中,CHK2 的磷酸化水平(p-Chk2/Chk2 比值)在黑质(SN,PD 中多巴胺能神经元丢失的核心脑区)都显著升高,而在 cerebellum(作为对照的非病变区)没有变化。这种"疾病区域特异性"的分子事件,正是 XunZi 从多组学数据里识别出来的。

更绝的是图3a那张对比:XunZi 给出了 CHK2 在 PD 中的详细机制角色(包括相关通路、被调控基因、致病机制),而 GPT-4o 在同一问题上明确回答"no"——它没能给出这些洞见。

05 基因敲低:Chk2 KD 保护了多巴胺能神经元

作者用 AAV 载体在小鼠黑质单侧注射 Chk2 靶向 gRNA,将 Chk2 蛋白水平降低约 50%,4周后再用 MPTP 攻击。

图3f-3m 的结果非常干净:

• 运动功能:爬杆实验(pole test)和转棒实验(rotarod)中,AAV-Chk2KD + MPTP 组的表现显著优于 AAV-control + MPTP 组

• Chk2 激活被抑制:p-Chk2/Chk2 比值下降

• 多巴胺能神经元被保护:黑质中酪氨酸羟化酶(TH)蛋白水平更高,TH 阳性神经元数量显著多于对照组

这是一个完整的"计算预测 → 遗传验证"闭环:AI 说 CHK2 是 PD 的致病激酶,敲低它应该能救命——实验结果果然如此。

06 老药新用的惊喜:CCT241533 在老鼠身上逆转了帕金森表型

光有基因敲低还不够"转化"。作者拿出了一个现成的、原本为肿瘤开发的 CHK2 选择性抑制剂 CCT241533(IC50 = 3 nM),在两种 PD 小鼠模型里做了药效验证。

图4a-4g 展示了 MPTP 模型中的结果:0.2μg 和 2μg 两种剂量的 CCT241533 都能显著改善运动缺陷,2μg 剂量将转棒测试表现恢复至接近基线水平,效果与处于临床阶段的 LRRK2 抑制剂 DNL-201 相当。免疫印迹显示,CCT241533 有效逆转了 MPTP 导致的 p-Chk2 升高和 TH 下降,并显著降低了 p-p53/p53 比值。

图4h-4n 进一步在 α-syn PFF 模型中确认:CCT241533 治疗 3 个月,显著改善了运动表现,降低了病理性 p-α-syn/α-syn 比值,保护了黑质多巴胺能神经元。

07 最意外的发现:CHK2 是 LRRK2 的上游调控因子

LRRK2 是帕金森病最主要的遗传决定因素之一,但它的上游调控网络一直没完全理清。XunZi 在图3a的预测里明确点出:CHK2 可能是 LRRK2 的上游调控因子。

这条关联在 PubMed 里查不到,其他 AI 也没预测出来。但实验验证成立:

• 抑制 Chk2 显著降低 LRRK2 的磷酸化水平(p-LRRK2/LRRK2 比值下降)

• Co-IP 实验证实 CHK2 与 LRRK2 在细胞中存在物理相互作用

• 转录组分析显示,CCT241533 与 DNL-201 在黑质中调控了高度重叠的下游基因表达程序,主要涉及神经发育和分化通路

图4o 重构了包含7个 PD 相关激酶(LRRK2、PINK1、CHK2、IRAK4、STK33、DAPK2、GRK5)的调控网络,展示了这些激酶如何通过高度互联的拓扑结构,汇聚到多巴胺能神经元变性、线粒体功能障碍、蛋白质稳态破坏、氧化应激、DNA损伤应答等 PD 核心病理通路。CHK2 在网络中处于关键枢纽位置。

08 为什么这篇论文值得AI+交叉学科研究者反复读

抛开"发现CHK2是帕金森新靶点"这个生物学结论本身,XunZi 这篇论文在方法论上对交叉学科研究的启发更为深远:

第一,它证明了"逻辑推理 + 多模态数据融合"的 1+1>2。 单独看 XunZi-R(仅推理)在 PD 基因预测上 AUC 0.70,XunZi-M(仅融合)0.80,完整 XunZi 直接拉到 0.88;PD 激酶预测更是从 GPT-4o 的 0.52 跃升到 0.92。融合带来的不是线性提升,是指数级的。

第二,它给出了一个可复制的"抗幻觉"配方。 2440万篇文献 + 33.6万条人工校对的CoT + 显式负样本训练——这套数据工程方法论,对任何想做"领域专用AI科学家"的团队都是现成的脚手架。

第三,它跑通了"计算→细胞→动物"的完整闭环。 从全基因组预测到 Top20 候选基因,从 A549 细胞 viability 筛选到 MPTP 小鼠爬杆实验,XunZi 把"AI提假说"的兑现成本压缩到了一个课题组可以承受的范围。

第四,它展示了小模型的逆袭。 在"更大参数"的军备竞赛之外,XunZi-R 用 73亿参数打赢了 1750亿参数的 GPT-4o。这对算力有限的高校课题组来说,是个非常重要的信号——垂直领域的"专",可以战胜通用领域的"大"。

09 但要泼几盆冷水:XunZi 的边界在哪里

作为严肃的学术解读,必须聊聊这篇论文自己的 limitations(原文 Discussion 部分坦诚地列出了几条):

负样本标签偏倚。海量的基因-疾病对在当前知识边界下仍是未探索的,这些"未报道关联"被隐式当作负样本,可能引入不可避免的训练偏倚。

稀有病/新兴疾病泛化风险。在训练数据稀疏的场景下,模型可能难以提供可靠预测——过拟合和泛化不足的风险真实存在。

尚需临床证据。目前所有体内实验仅在雄性小鼠上完成,样本量偏小,IRAK4 等靶点未获同等深度的体内验证。从老鼠到人类,还有漫长的临床路。

数据偏差。训练语料主要来自已发表的英文文献,存在已知的"发表偏倚"——热门基因被过度研究,冷门基因数据稀少。

作者在文末也点明了未来方向:整合时空单细胞多组学、纳入影像和电子健康记录、最终让 XunZi 与机器人实验室系统连接,实现假说的自主实验验证闭环。

10 写在最后:从荀子到"荀子"

两千多年前,荀子倡导"化性起伪"——通过后天学习和理性思辨,人可以超越天生的认知局限。

今天,以他命名的 AI 生物学家系统,正在用 2440 万篇文献和 613 TB 多组学数据做着类似的事:把人类积累的生物医学知识"内化"进一个可推理、可融合、可验证的系统里。

从"AI辅助分析"到"AI自主提假说",这道坎,XunZi 迈过去了。它发现的 CHK2-LRRK2 调控轴,是一个连 PubMed 和 GPT-4o 都没能给出的原创生物学洞察——这意味着,AI 已经开始在人类知识版图的边缘,画出新的线。

对于"图科学实验室"的读者们——无论你是做 AI for Science 的算法研究者,还是用量化方法攻克生物问题的交叉学科PI,XunZi 这篇论文都值得放在案头反复翻。它不只是一项成果,更是一份方法论宣言:在 AI+生命科学的下一个十年,谁先把"逻辑推理"和"多模态数据融合"真正焊在一起,谁就掌握了提假说的主动权。


微信群

内容中包含的图片若涉及版权问题,请及时与我们联系删除