DRUGONE

RNA广泛参与蛋白质合成、基因表达调控、分子识别与生物催化,其功能通常依赖特定的三维折叠结构。然而,RNA分子具有明显的柔性、动态性和构象不稳定性,可用于训练模型的高质量三维结构数量远少于蛋白质结构,这使得基于目标结构反向设计RNA序列仍面临数据稀缺、过拟合以及对新型折叠泛化能力不足等问题。现有方法通常将每个目标RNA视为独立结构,未能充分利用不同RNA之间共享的结构模式和进化约束。


研究人员提出了RNA逆向设计框架AlignIF。该方法借鉴多序列比对在结构预测中的作用,将多个结构相似RNA进行多结构比对,并将比对后的RNA表示为相互对应的几何图。AlignIF通过跨图节点和边注意力整合相关结构中的保守几何模式,再利用随机顺序自回归解码器生成符合目标结构的RNA序列。模型同时引入RNA糖环构象、骨架方向、局部取向、二面角及空间距离等结构特征,以更加完整地表示RNA三维构象。


在基准测试集、时间独立测试集以及AlphaFold3预测结构数据集上,AlignIF在序列恢复率、困惑度、核苷酸分类准确性和结构自洽性等指标上均优于已有方法。进一步分析表明,该模型不仅能够恢复天然序列,还能够生成符合RNA家族保守性和变异规律的多样化序列。研究人员随后对23种荧光RNA适配体和7种自切割核酶进行了实验验证。所有iMango-III和Mango-I来源的设计均表现出可检测荧光,其中两种Mango-I设计的荧光强度超过野生型;七种手枪型核酶设计也均具有切割活性。结果表明,结构比对驱动的跨图建模能够将有限RNA结构数据转化为可迁移的结构与进化规律,为功能性RNA工程提供新的计算设计途径。

RNA不仅是遗传信息传递过程中的中间分子,也是细胞中的调控元件、分子传感器和生物催化剂。核糖开关能够感知代谢物并调节基因表达,RNA适配体可以特异性结合小分子或蛋白质,核酶则能够催化RNA链的切割或连接。这些功能并非仅由一级序列决定,而是依赖RNA形成特定的二级结构、三级相互作用和动态构象。因此,给定目标三维结构并设计能够稳定折叠到该结构的RNA序列,是理解RNA序列—结构—功能关系以及开发合成RNA工具的重要任务。


近年来,研究人员开发了多种基于深度学习的RNA逆折叠方法,通过图神经网络、扩散模型或自回归生成模型,根据目标RNA骨架预测核苷酸序列。这些方法推动了RNA设计从依赖规则和局部碱基配对,转向利用完整三维结构进行数据驱动建模。然而,RNA三维结构实验解析困难,现有结构数据库规模有限,并且不同RNA家族的结构分布高度不均衡。模型容易记忆训练数据中的天然序列,而不是真正学习决定折叠稳定性和功能保留的结构规律。


传统模型通常以单个目标结构作为输入。即使某些方法能够利用同一RNA的多个构象状态,也要求目标RNA已经具有多个实验或预测构象,实际适用范围受到限制。相比之下,不同RNA成员即使序列差异较大,也可能共享相似的整体折叠、局部基序或空间相互作用。若能够对这些结构进行比对,并识别其中反复出现的几何模式,模型就可能从有限结构样本中提取具有进化意义的设计原则。


在蛋白质和RNA结构预测中,多序列比对能够揭示进化保守性及协同变异信息。AlignIF将这一思想反向应用于结构驱动的序列设计:不是从同源序列推断结构,而是从多个相似结构中学习哪些空间特征在进化过程中保持稳定,以及哪些位置能够容纳序列变化。由此,RNA设计目标也从简单复现一条天然序列,扩展为生成一组共享目标折叠并遵循家族进化规律的候选序列。



方法

研究人员从RNA三维结构数据库中收集实验结构,保留分辨率优于4埃、长度为16至512个核苷酸的RNA,并根据结构相似度进行聚类,构建训练集、验证集和基准测试集。为检验时间外泛化能力,又选取后续发布且与基准数据结构不相似的RNA组成独立测试集,同时使用AlphaFold3预测的50种不同长度RNA结构评估模型对计算结构的适应性。对于每个目标RNA,研究人员利用结构比对程序搜索整体折叠相似的RNA,将目标及相关结构对齐后分别构建几何图,其中节点表示核苷酸,空间距离一定范围内的核苷酸之间建立边。节点特征包含糖环局部坐标、骨架方向、碱基方向、骨架二面角、糖环构象角及相邻核苷酸取向;边特征描述原子间距离和局部坐标系之间的相对旋转。AlignIF编码器首先在每个结构图内部进行消息传递,随后在已经对齐的多个图之间分别更新对应节点和对应边,从而整合多个结构中的保守模式。经过三层跨图编码后,解码器仅以目标图的增强表示为条件,按照随机生成顺序逐位预测A、U、C和G。随机顺序训练降低了固定从左到右解码带来的顺序偏差,并支持优先固定已知功能基序,再生成其余位置。模型以天然序列重建为训练任务,并与多种代表性RNA逆向设计方法在统一数据划分和训练条件下比较。



结果

AlignIF框架将多结构信息引入RNA序列设计

AlignIF的核心创新在于多结构比对编码器。对于给定目标RNA,模型首先检索整体折叠相似的结构,并通过结构比对建立核苷酸位置之间的对应关系。每个RNA仍被独立表示为几何图,但对应节点和边可以在不同图之间交换信息。图内消息传递负责学习单个结构的局部环境,跨图注意力则用于识别多个结构共同保留的空间模式。最终,目标结构的表示既包含自身几何信息,也融合了相似RNA中的结构保守性。


随机顺序解码器进一步提高了设计灵活性。模型在训练过程中不固定核苷酸生成次序,因此能够学习更接近条件分布的双向结构约束,而不是过度依赖上游已生成序列。在存在已知结合位点、催化核心或保守基序时,模型还可以先固定这些位置,再根据其结构和序列条件生成周围核苷酸,为功能导向设计提供了直接接口。

图1|AlignIF总体框架及数据集构建。


AlignIF显著提高天然RNA序列恢复能力

研究人员首先评估模型恢复天然RNA序列的能力。在基准测试集中,AlignIF的序列恢复率达到0.595,困惑度为2.221,明显优于多种已有模型。即使完全不提供多结构比对信息,AlignIF仍获得0.574的恢复率,说明其几何特征表示和编码器架构本身已经具有较强性能。加入相似结构后,恢复率进一步提高、困惑度进一步降低,并且改进幅度随着可用比对结构数量增加而扩大。


在严格时间隔离的独立测试集中,AlignIF仍取得0.487的恢复率和2.723的困惑度,优于其他方法。模型在较长RNA上的优势更加明显,说明跨图建模有助于捕捉远距离结构依赖。核苷酸类别的宏平均评价结果也表明,AlignIF并非通过过度预测高频碱基获得较高总体准确率,而是对四种核苷酸均保持较好的识别能力。


模型给出的序列平均概率与天然序列恢复率呈明显正相关,说明内部概率可以反映候选序列与目标结构的匹配程度。研究人员还采用更严格的序列和结构去冗余阈值重新筛选测试集,AlignIF在不同阈值下均保持稳定优势,降低了结果由训练集近邻结构造成的可能性。


在AlphaFold3预测的RNA结构上,AlignIF获得0.552的恢复率、2.551的困惑度和0.549的宏平均评价值。由于这些预测结构没有可用的相似结构集合,完整模型与无多结构输入版本结果相同,但仍显著优于对照方法。对于一个470个核苷酸的部分16S核糖体RNA,设计序列恢复率达到0.68,重新预测后的结构与目标结构高度一致,表明模型能够处理较长RNA及非实验结构输入。

图2|AlignIF在基准集、独立测试集和预测结构数据集上的序列恢复结果。


设计序列具有更高的结构可折叠性

高序列恢复率并不必然意味着设计序列能够形成目标三维结构,因此研究人员进一步利用AlphaFold3重新预测设计序列的结构,并将其与目标结构进行比较。评价同时涵盖整体拓扑相似性、原子偏差、不同距离阈值下的结构一致性以及二级结构配对一致性。


在基准测试集和独立测试集中,AlignIF在多项三维结构自洽性指标上均优于其他设计方法,并接近以天然序列重新预测结构所得到的参考上限。使用另一种独立RNA结构预测模型重新评估后,也获得相似结论,说明结果并非仅依赖单一预测工具。


在一个核糖开关案例中,AlignIF设计序列与天然序列的恢复率为0.64,重新预测结构与目标结构保持较高相似性。研究人员另外构造了两个具有相同恢复率的随机突变序列,但二者均无法正确折叠。这一对照说明,AlignIF并不是简单保留较多天然核苷酸,而是学习了未恢复位置之间与三维折叠相关的组合规律。


对于含有吻合环、分支吻合环和T形连接等复杂结构单元的人工二聚RNA纳米笼,AlignIF设计在全部结构自洽性指标上优于其他方法。该人工结构没有相似RNA可供比对,完整模型仍能够依靠其基础架构完成设计,体现了模型对新型折叠的适应能力。

图3|不同方法设计序列的三维与二级结构可折叠性比较。


AlignIF能够重建RNA家族的进化保守模式

功能性RNA设计不仅需要生成接近天然序列的结果,还需要探索能够维持相同折叠和功能的多样化序列。随着采样温度提高,各模型生成序列的多样性普遍增加,但天然序列恢复率随之下降。AlignIF在整个采样范围内均表现出更优的多样性—恢复率平衡,能够在较高序列差异下维持较好的结构条件一致性。


研究人员将模型生成的核苷酸概率分布与天然RNA家族的多序列比对分布进行比较。AlignIF生成的序列谱与家族比对谱之间差异最小,说明模型输出不仅接近单条天然序列,也符合整个RNA家族的保守和变异规律。在荧光RNA案例中,AlignIF正确保留了多个高度保守位置,同时允许可变区域产生不同核苷酸组合。


进一步的位点熵分析显示,AlignIF能够从三维结构中区分高度保守位点和可变位点。在RNase P RNA中,模型预测的保守区域与同源序列比对结果高度一致;在锤头型核酶中,当底物链及其配对核苷酸被固定后,模型识别出的保守位置与已知催化相关位点相符。这表明AlignIF能够联合结构约束和进化原则,不再局限于复现天然序列,而是具备生成RNA家族成员的能力。

图4|AlignIF生成序列的多样性、家族序列谱及保守位点分析。


跨图节点、边建模和随机解码均不可缺少

消融实验显示,删除跨图节点更新、跨图边更新或随机顺序解码都会降低模型性能,同时删除节点和边对齐所造成的下降最明显。无跨图对齐版本在困惑度、恢复率和宏平均评价值上均表现最差,说明仅将多个结构分别编码而不建立对应关系,无法有效提取结构保守性。


节点对齐和边对齐具有互补作用。前者帮助模型比较对应核苷酸的局部几何环境,后者则比较核苷酸之间的空间关系。仅删除其中一个模块时性能下降较小,但两者同时移除后,序列恢复、家族分布匹配和多样性均明显恶化。固定顺序解码也增加了模型输出与天然家族变异模式之间的差异,说明随机顺序有助于降低过拟合和生成过程中的暴露偏差。


研究人员还验证了两个额外糖环角度特征的作用。加入这些特征后,模型能够更准确地描述核糖构象变化,并获得更好的序列设计性能。随着多结构比对深度从零逐渐增加,模型在酵母U6小核RNA上的恢复率和核苷酸分类能力持续提高,困惑度则不断下降。注意力分析显示,模型倾向于对结构相似度更高的比对成员赋予更强权重。


将真实相似结构替换为随机高斯扰动的骨架并不能复现性能提升。这说明多结构比对的价值并非来自简单的数据增强,而是源于自然RNA中进化保留且物理合理的构象变化。

图5|AlignIF模块消融、多结构深度及跨图注意力分析。


实验验证功能性荧光适配体和自切割核酶

研究人员首先以iMango-III荧光RNA适配体为目标,重新训练时排除了与该结构高度相似的样本。AlignIF生成的序列分布能够保留负责荧光团结合的双层G-四链体核心。研究人员随机选择并合成13条序列,其与野生型的一致性范围约为30%至73%。所有设计在加入TO1-biotin后均产生荧光,其中三条达到野生型荧光强度的一半以上。即使一条与野生型序列一致性仅约30%的设计,也保持了可检测功能。


以Mango-I为目标时,模型保留了三层G-四链体功能核心。十条合成序列全部具有荧光,且强度至少达到野生型的40%。其中两条设计的荧光强度分别约为Mango-I的1.6倍和1.4倍。进一步测定发现,这两条设计对荧光团的结合亲和力并未提高,但其最大荧光团结合容量接近野生型的两倍。另有两条设计表现出优于Mango-I的结合亲和力。圆二色谱结果表明,增强荧光的设计更容易形成稳定的G-四链体结构,这可能解释了其更高的荧光信号。


研究人员随后利用基序引导策略设计手枪型自切割核酶。为保持底物特异性,模型固定了底物结合臂以及靠近切割位点的关键核苷酸,再生成其余区域。尽管训练数据中不含同类手枪型核酶,AlignIF输出仍恢复了多个已知保守位置。七种合成核酶均表现出可检测切割活性,其中活性最高的设计约为野生型的11%。虽然尚未超过天然核酶,但这一结果证明模型可以从静态三维结构出发,生成具有真实催化功能的全新RNA序列。

图6|AlignIF设计的荧光RNA适配体和手枪型核酶的实验验证。



讨论

AlignIF将多序列比对的进化思想引入结构驱动的RNA设计,通过多结构比对和跨图建模,从有限RNA结构中提取共享的三维规律。与只处理单个目标结构的方法相比,该框架能够利用结构相似但序列不同的RNA,学习整体折叠、局部基序及空间相互作用中稳定保留的部分。实验结果进一步表明,这些规律能够转化为真实功能,而不仅是更高的计算评价指标。


该研究的重要意义在于将RNA逆向设计从“恢复天然序列”推进到“设计RNA家族”。传统恢复率指标会奖励与单个天然序列相同的核苷酸,但真实RNA设计通常希望获得多个不同序列,以优化稳定性、表达效率、结合能力或催化活性。AlignIF能够在维持结构约束的同时生成符合家族保守性和变异模式的序列,为探索更广阔的功能序列空间提供了基础。


该方法仍存在局限。首先,模型尚缺少适用于不同RNA类型的统一候选排序指标。平均生成概率、结构自洽性和二级结构一致性与实验活性的相关性因设计目标而异,因此不能保证计算得分最高的序列具有最佳功能。未来需要将实验反馈、结合能、催化动力学或细胞环境稳定性直接纳入训练与排序过程。


其次,多结构比对深度增加会提高显存开销。可以通过筛除低相似度结构、压缩跨图编码器或学习代表性结构原型降低计算成本。对于缺少结构同源物的新型RNA,模型虽然仍具有较强基础性能,但无法获得多结构信息带来的额外提升。未来可结合高置信度预测结构、化学探测数据和冷冻电镜密度构建更丰富的结构集合。


核酶设计也揭示了静态结构条件的局限。催化过程涉及构象变化、金属离子配位和反应中间态,而晶体结构可能与真实活性构象存在差异。将多个功能状态、动态模拟以及序列进化信息联合建模,有望提高催化RNA设计效果。此外,利用主动学习循环选择最有信息量的候选进行实验,再将实验结果反馈给模型,可能尤其适用于结构样本稀缺的RNA家族。


总体而言,AlignIF证明了结构比对驱动的跨图学习能够同时提高RNA序列恢复、结构可折叠性、进化合理性和实验功能。随着结构预测、实验测量和生成模型进一步融合,该框架有望扩展到RNA—蛋白质复合物、工程化核糖核蛋白、CRISPR相关系统以及其他合成生物学平台,推动RNA设计从结构条件生成走向真正的功能导向工程。

整理 | DrugOne团队


参考资料


Wang, S., Wang, J., Liu, X. et al. Structure-alignment-driven cross-graph modeling for functional RNA design. Nat Comput Sci (2026). 

https://doi.org/10.1038/s43588-026-01029-2

内容为【DrugOne】公众号原创转载请注明来源


内容中包含的图片若涉及版权问题,请及时与我们联系删除