RNA引导核酸酶是现代基因编辑技术的核心工具,其代表CRISPR-Cas系统已经彻底改变了生命科学研究。然而,目前几乎所有天然RNA引导核酸酶都受到长期生物进化的限制,在蛋白大小、结构组成以及催化性能方面存在天然边界。如何利用人工智能设计突破自然进化限制的新型RNA引导核酸酶,成为蛋白质设计领域的重要挑战。


研究人员提出了一种融合蛋白质结构信息与进化约束信息的新型设计策略,以最小RNA引导核酸酶TnpB为模板,结合ESM Inverse Folding逆折叠模型和系统发育保守性分析,设计出一系列人工合成RNA引导核酸酶(SynTnpB)。这些蛋白虽然与天然TnpB具有较低序列相似性,但仍保持甚至超过天然酶的基因编辑能力。进一步利用高通量筛选、人源细胞、植物细胞以及冷冻电镜结构解析,研究人员证明AI设计蛋白能够建立新的RNA-DNA相互作用网络,在不同构象之间维持稳定催化活性。


这项研究首次证明,结合结构设计与进化信息可以突破天然蛋白序列限制,实现复杂RNA引导核酸酶的人工设计,为下一代基因编辑工具和新型蛋白设计开辟了新的研究方向。

CRISPR-Cas系统已经成为现代基因编辑最重要的平台,其能够利用RNA识别特定DNA序列,实现精准切割、碱基编辑以及表观遗传调控。然而,目前广泛应用的Cas蛋白大多来源于自然界,其性能受到天然进化过程限制,例如蛋白体积较大、靶向范围有限以及递送效率不足等问题。


近年来,TnpB逐渐受到关注。TnpB被认为是Cas12家族的祖先,仅由一个较小蛋白即可完成RNA引导DNA识别和切割,因此具有天然的小型化优势,非常适合作为下一代基因编辑工具。然而,与Cas蛋白相比,TnpB功能更加依赖多个结构域之间复杂协调,包括RNA识别、DNA识别、构象变化以及催化中心激活,因此人工设计难度更高。


传统蛋白质语言模型主要依赖天然蛋白序列进行训练,虽然能够生成新的蛋白序列,但生成结果通常与天然蛋白高度相似,很难真正突破自然进化空间。而近年来发展的逆折叠模型则能够根据三维结构反向设计氨基酸序列,为探索更大的蛋白质设计空间提供了可能。然而,仅依赖结构信息容易破坏关键功能位点,因此如何在保持催化功能的同时获得高序列多样性,仍然是蛋白设计的重要难题。


研究人员因此提出,将蛋白质三维结构、系统进化保守性以及RNA-DNA共进化信息共同引入AI设计流程,希望构建既具有天然功能,又拥有全新序列的新型RNA引导核酸酶。


方法

研究人员首先选择小型RNA引导核酸酶ISDra2 TnpB作为设计模板,利用ESM Inverse Folding模型根据蛋白三维结构反向生成大量新序列。随后,结合天然TnpB家族多序列比对以及RNA-DNA共进化分析,对催化中心、RNA结合位点和DNA结合位点施加不同程度的保守性约束,使模型能够在保持关键功能位点的同时最大程度探索新的序列空间。之后构建数千种人工设计蛋白,通过细菌高通量筛选系统快速评价活性,并进一步在人源HEK293T细胞和拟南芥原生质体中验证基因编辑能力。最后,对活性最优的SynTnpB进行冷冻电镜解析,分析AI引入的新氨基酸如何稳定RNA-DNA复合物并促进构象转换。


结果

结构与进化联合约束实现高多样性TnpB设计

研究人员首先测试ESM逆折叠模型是否能够直接重新设计TnpB蛋白。


实验发现,模型生成的新蛋白仍能够折叠成与天然TnpB几乎相同的整体三维结构,同时成功保留RuvC催化中心的关键催化三联体,说明逆折叠模型具有较好的整体结构保持能力。


然而,仅依赖结构设计仍存在明显问题。模型虽然能够恢复催化中心,却不能准确保留RNA和DNA结合界面的关键识别残基,部分重要氨基酸发生替换,可能影响RNA引导识别过程。


为解决这一问题,研究人员进一步引入天然TnpB家族系统进化信息,计算每个位点的保守程度以及RNA-DNA共进化关系,并将这些关键位点固定,其余位置交由AI自由设计。通过不断调整保守阈值,可以在功能保持和序列创新之间获得不同平衡。


系统发育分析进一步显示,AI生成蛋白形成了区别于天然TnpB的新分支,与天然蛋白序列相似度仅约50%至60%,说明设计策略已经成功突破天然序列空间。

图1: 基于蛋白结构与进化信息联合约束设计人工RNA引导核酸酶SynTnpB总体流程。


高通量筛选获得大量高活性人工核酸酶

为了寻找真正具有活性的设计蛋白,研究人员建立了细菌高通量筛选体系。


首先,他们直接筛选完整蛋白。结果发现,仅有少数设计蛋白保持一定活性,而且整体编辑能力仍低于天然TnpB。进一步分析发现,TnpB由RNA识别结构域(REC)和催化结构域(NUC)组成,两部分对突变耐受程度明显不同。研究人员因此分别设计两个结构域,再自由组合形成新的人工蛋白。


这一策略显著提高了成功率。高通量筛选近两千种不同组合后,共获得466种具有活性的SynTnpB,其中约8%的设计蛋白编辑活性超过天然TnpB。


研究人员最终筛选出九种代表性SynTnpB,它们既保持较高活性,又具有较大的序列差异,为后续细胞实验提供了候选蛋白。结果说明,模块化设计能够有效提高复杂多结构域蛋白的AI设计成功率,也进一步扩大了人工蛋白可探索空间。

图2: 基于细菌高通量筛选获得具有高编辑活性的人工SynTnpB。


SynTnpB在人类和植物细胞中表现出优异基因编辑能力

随后,研究人员在人胚肾HEK293T细胞中评价人工蛋白的真实编辑性能。


以蓝色荧光蛋白敲除实验为例,天然TnpB平均编辑效率约为28%。其中多个SynTnpB保持与天然蛋白相当水平,而v1和v5表现尤为突出,编辑效率分别达到46%和50%,显著高于天然酶。


进一步检测多个内源基因位点,包括RUNX1、NIBAN1、EMX1和AGBL1后发现,大部分设计蛋白均具有稳定编辑能力,其中v1和v5在多个位点持续优于天然TnpB,在EMX1位点最高提高近四倍。


随后,研究人员进一步分析脱靶效应。结果显示,活性最高的v1仍保持与天然蛋白相近的特异性,而部分其他高活性变体则出现一定脱靶增加,说明未来仍可进一步优化活性与特异性的平衡。


由于TnpB体积较小,非常适合植物病毒递送,研究人员随后又在拟南芥原生质体中测试人工蛋白。实验结果与人细胞高度一致,v1几乎在所有测试位点均优于天然TnpB,进一步证明AI设计蛋白具有跨物种应用能力。

图3: AI设计SynTnpB在人类细胞和植物细胞中实现高效基因编辑。


冷冻电镜揭示AI设计蛋白活性增强机制

为了理解AI设计为何能够提高编辑能力,研究人员选择序列变化最大的v7进行冷冻电镜解析。v7与天然TnpB序列一致性仅约77%,约四分之一氨基酸由AI重新设计。然而,其整体折叠仍与天然蛋白保持一致。


进一步比较不同构象状态发现,AI引入的新氨基酸大量集中于RNA-DNA结合界面,形成新的静电作用和氢键网络。这些新增相互作用显著增强RNA、DNA及蛋白之间结合稳定性,使不同催化阶段均能够保持稳定构象。


更重要的是,研究人员首次捕获此前未报道的TAM识别中间状态。AI设计蛋白能够稳定这一短暂构象,使RNA-DNA异源双链逐渐形成,并进一步完成后续R-loop构象转换。


此外,多个完全由AI设计的螺旋区域仍然保持天然蛋白所需的弯折运动,说明AI不仅重新设计了序列,还成功保留了复杂蛋白构象变化所需的动态特性。


这些结果揭示了AI设计蛋白保持高活性的分子基础,也证明AI能够设计新的RNA-DNA相互作用网络,而不仅仅复制天然蛋白。

图4: 冷冻电镜解析揭示AI设计SynTnpB通过新的RNA-DNA相互作用网络稳定催化构象。


讨论

研究人员建立了一种融合蛋白质结构信息和系统进化信息的新型AI蛋白设计框架,并成功突破天然RNA引导核酸酶的序列限制。与传统蛋白质语言模型相比,该策略并非简单生成与天然蛋白高度相似的新序列,而是在保留关键催化位点的基础上,大幅扩展可设计序列空间,使人工蛋白能够形成全新的系统发育分支。


研究还发现,TnpB不同结构域对序列改变具有明显不同的耐受性。DNA识别结构域受到更加严格的进化约束,而RNA结合和催化结构域则允许更大的序列变化。这一发现为未来复杂多结构域蛋白设计提供了新的模块化设计思路,即分别优化不同功能模块,再重新组合获得最佳整体性能。


冷冻电镜进一步证明,AI设计并非随机替换氨基酸,而是能够建立新的静电作用和氢键网络,稳定RNA-DNA复合物在不同催化阶段的构象变化。这意味着AI已经能够在一定程度上学习复杂蛋白质动态构象规律,而不仅仅恢复静态三维结构。


研究人员认为,这种结合结构、进化和共进化信息的设计框架不仅适用于TnpB,也有望推广到Cas蛋白、RNA结合蛋白以及其他多结构域酶体系。随着蛋白逆折叠模型不断发展,未来甚至有望摆脱天然蛋白模板,实现完全从零开始设计具有全新功能的RNA引导核酸酶,从而进一步拓展可设计蛋白空间,为精准基因编辑和合成生物学提供更加丰富的新型工具。

整理 | 王建民

参考资料

Petr Skopintsev et al. ,Structure and evolution-guided design of minimal RNA-guided nucleases.Science393,313-318(2026).

DOI:10.1126/science.aed6123

内容中包含的图片若涉及版权问题,请及时与我们联系删除