DRUGONE

人类基因组中大量非蛋白编码区域通过RNA直接发挥生物学功能,但这些RNA序列所编码的结构与功能规律仍远未得到充分解析。与蛋白质相比,RNA三维结构数据十分有限,使深度学习模型难以获得足够的监督信息。同时,许多现有RNA结构预测方法依赖多序列比对(MSA)提供的进化共变信号,对于缺少同源序列的新型RNA或浅MSA家族,其应用受到明显限制。


研究人员开发了 NucleicBERT,一种基于自监督学习的RNA语言模型,仅利用单条RNA序列学习上下文表示,无需MSA或其他显式进化信息。模型在约3000万条非编码RNA序列上通过掩码语言建模进行预训练,使其从海量未标注序列中自主学习核苷酸之间的统计依赖和潜在生物学规律。


结果显示,NucleicBERT能够在潜在表示空间中按照RNA功能家族组织序列,并在RNA二级结构、长程接触、剪接位点以及核酶适应度预测等任务中达到或超过多种现有模型。可解释AI分析进一步发现,模型能够识别二级结构边界、长程接触热点以及天然RNA允许的序列变化范围。更重要的是,仅使用单序列输入,模型内部即可恢复部分与经典共进化分析相似的核苷酸耦合信号。因此,NucleicBERT表明,仅依赖大规模RNA序列的自监督学习,也能够建立具有结构和进化意义的RNA序列空间表示。

RNA不仅负责遗传信息传递,还参与基因表达调控、催化、核糖体组装以及多种细胞过程。大量非编码RNA的功能仍然未知,而RNA结构通常是理解这些功能的重要基础。这一问题也具有直接的药物开发意义,因为RNA本身已经成为重要治疗靶点,包括与抗菌药物作用和耐药性相关的核糖体RNA。


然而,RNA结构实验仍然存在明显瓶颈。X射线晶体学、NMR和冷冻电镜能够提供高分辨率结构,但实验周期和资源需求较高。相比之下,测序技术已经产生海量RNA序列,从而形成明显的“序列丰富、结构稀缺”问题。


传统计算方法往往通过MSA寻找协同进化的核苷酸,从而推断碱基配对和三维接触。然而,建立高质量MSA本身需要大量计算,而且很多RNA家族缺乏足够同源序列。因此研究人员提出一个关键问题:如果只给模型单条RNA序列,通过学习数千万条RNA中的统计规律,它是否能够自行获得类似进化和结构约束的信息?


NucleicBERT正是围绕这一问题建立。与单纯追求更大模型不同,研究人员同时强调模型解释性,希望理解RNA语言模型究竟学到了什么,以及这些内部表示是否真正对应RNA的结构、功能和进化规律。



方法

NucleicBERT采用BERT式Transformer架构,包含32层Transformer、每层32个注意力头,嵌入维度为1024,总参数量约4.04亿。研究人员从MARS数据库提取约3000万条非编码RNA序列,以单个核苷酸为基本token,通过随机掩盖部分核苷酸并要求模型根据上下文恢复原始序列进行自监督预训练。预训练完成后,通过不同任务头分别进行RNA二级结构、核苷酸距离与接触图、跨物种剪接位点以及CPEB3核酶突变适应度预测,并分别比较完整微调和冻结骨干网络的线性探测。为解释模型学习内容,研究人员进一步使用PHATE分析潜在序列空间,通过显著性分析和注意力分析寻找模型关注的结构区域,通过人工打乱RNA序列检测其对天然序列约束的敏感性,并设计单序列掩码似然影响方法,检验模型能否在没有MSA输入的情况下恢复类似共进化的核苷酸耦合关系。

图1:NucleicBERT整体架构、自监督预训练、下游结构预测及可解释AI分析流程。



结果

自监督学习建立具有生物学组织的RNA序列空间

NucleicBERT首先在掩码核苷酸恢复任务上接受检验。预训练模型的平均准确率达到83.1%,并且预测困惑度与准确率之间形成清晰关系:模型越确信某种核苷酸应该出现在当前位置,其预测通常越准确。这说明模型并非简单记忆碱基频率,而是学习了RNA序列内部复杂的上下文依赖。


更有意思的是潜在表示空间。研究人员选择miRNA、piRNA、rRNA、siRNA、snRNA、snoRNA和tRNA等RNA类型进行PHATE降维。未经训练的随机模型以及简单6-mer组成表示都难以形成清晰的功能组织,而预训练后的NucleicBERT能够形成明显的RNA家族聚类,甚至可以区分长度相近但功能不同的piRNA和siRNA。


研究人员进一步控制序列长度和碱基组成后,这种家族分离能力仍然存在,说明模型学习到的信息超出了“RNA有多长”“GC含量多少”等简单统计性质。换言之,自监督训练已经把不同RNA家族映射到具有生物学意义的潜在序列空间。

图2:NucleicBERT预训练性能及不同RNA家族在潜在表示空间中的PHATE分布。


单序列模型实现RNA二级结构和长程接触预测

在RNA二级结构预测中,NucleicBERT在ArchiveII600数据集获得0.872的F1,在更具挑战性的TS0数据集达到0.649。尤其在TS0上,其结果超过文中比较的RNAfold、MXfold2、RNA-FM和RNAErnie+等方法。


冻结NucleicBERT骨干网络,仅训练简单预测头时,ArchiveII600的F1仍达到0.581,而随机初始化模型仅为0.005。这一巨大差异说明,在看到任何二级结构监督标签之前,自监督预训练获得的RNA表示中已经存在可直接利用的结构信息。不过,完整微调后性能还能明显提高,表明任务特异性训练仍会进一步学习结构规律。


类似现象也出现在更困难的三维长程接触预测中。对于序列间隔至少24个残基的接触,NucleicBERT的Top-L/5、Top-L/2和Top-L分别达到0.616、0.549和0.460,均高于文中比较的RNA-FM和RiNALMo。即使冻结预训练骨干,Top-L仍达到0.423,说明单序列预训练表示已经编码相当程度的远距离核苷酸相互作用信息。

图3:NucleicBERT在RNA二级结构、长程接触及CPEB3核酶适应度预测中的表现。


NucleicBERT同时学习RNA功能规律

NucleicBERT并不限于结构预测。研究人员在斑马鱼、果蝇、线虫和植物四种物种中测试剪接位点识别,完整微调后的平均准确率达到0.948,在四种物种中保持稳定表现,说明统一的RNA序列表征能够迁移到功能性识别任务。


随后,研究人员利用CPEB3核酶大规模突变数据测试RNA序列–功能关系。完整微调后,NucleicBERT预测实验适应度的R²达到0.994,与RNA-FM和RiNALMo相当,而随机初始化模型为0.914。预训练模型达到有效预测性能所需的训练轮数也明显减少。


不过,该任务中冻结骨干网络后的线性探测效果较差。这说明预训练知识的价值并不总是表现为“拿来即用”的线性可分特征;对于复杂的定量序列–功能关系,预训练更可能提供一个良好的参数起点,需要通过下游数据进一步重塑内部表示。


可解释AI揭示模型学习到RNA结构边界和天然序列约束

研究人员进一步通过显著性分析观察模型做预测时“看哪里”。在二级结构任务中,最高显著性并不简单集中在所有配对核苷酸上,而更容易出现在配对区和非配对区之间的转换位置,说明模型能够识别RNA折叠中的结构边界和连接区域。


在接触图预测中,这种关系更加明确。一个核苷酸参与的三维接触越多,模型给予它的显著性通常越高,表明NucleicBERT会重点关注维持RNA三维拓扑的重要位置。注意力分析进一步显示,早期层主要提取局部基序和碱基配对信息,中间层开始针对二级和三级结构形成不同的任务特异性模式,而深层则更多整合序列级信息。


研究人员还逐步随机打乱天然RNA序列。随着打乱比例增加,模型识别“天然RNA”的能力持续下降;当扰动达到约20%–25%时出现明显性能变化。有趣的是,Rfam天然RNA家族平均能够容忍的最大序列差异约为26.9%,与模型约25%的阈值十分接近。当只扰动参与Watson–Crick配对的残基时,模型对破坏更加敏感。


这意味着模型可能已经从数千万条序列中学习到了天然RNA序列空间的某种边界,即哪些序列变化仍可能保持生物学合理性,而哪些扰动开始破坏关键结构约束。

图4:NucleicBERT显著性、不同层注意力模式及RNA序列扰动与天然进化约束分析。


单条RNA序列中出现“类共进化”信号

该研究最值得关注的问题之一,是没有MSA时语言模型能否恢复传统共进化分析获得的部分信息。研究人员为此提出掩码似然影响分析:依次遮盖一个核苷酸,并观察这种扰动会在多大程度上改变模型对另一个位置的预测置信度。如果两个位置存在强烈相互依赖,其耦合信号就会升高。


在FMN核糖开关等RNA家族中,NucleicBERT仅凭单条序列得到的耦合矩阵已经能够恢复与经典互信息和直接耦合分析相似的部分接触模式。研究人员在14个Rfam家族中进一步测试发现,该方法明显优于随机基线,但整体仍低于真正使用完整MSA的传统方法。


此外,预测质量与测试序列和预训练数据库中最近邻序列的相似程度没有明显关系,说明这种信号不能简单解释为模型记住了训练集中相似RNA。


因此,NucleicBERT并没有完全取代MSA共进化分析,而是揭示了一个重要现象:在足够大规模的RNA序列上进行自监督学习后,单序列语言模型能够内化一部分传统上需要跨同源序列比较才能观察到的成对进化约束。

图5:NucleicBERT从单序列恢复类共进化核苷酸耦合信号,并与互信息和直接耦合分析比较。



讨论

NucleicBERT的核心意义并不仅是提出另一个RNA预测模型,而是试图回答RNA基础模型究竟能够从“序列本身”学习多少生物学知识。研究结果表明,大规模掩码语言建模能够将RNA家族组织到具有功能意义的潜在空间,并在没有显式结构标签和MSA输入的预训练阶段获得二级结构、长程接触以及部分进化约束信息。


这对于RNA尤其重要。与蛋白质相比,目前高质量RNA三维结构数据仍然非常有限。研究人员指出,截至2025年初,PDB中的RNA三级结构数量只有数千个,而且其中还包含大量冗余、短链和RNA复合结构。相比之下,RNA序列资源已经达到极大规模。自监督语言模型因此提供了一种利用“丰富序列数据”弥补“稀缺结构标签”的方法。


与此同时,这项研究清楚区分了预训练与微调的作用。在线性探测实验中,冻结的NucleicBERT明显优于随机模型,证明结构相关知识确实已经存在于预训练表示中;但完整微调仍然能够大幅提升某些任务。这意味着RNA语言模型并不是在预训练阶段就完整掌握了RNA结构,而是首先学习通用的序列约束,再由下游监督数据将这些表示重新组织为具体的结构或功能预测能力。


单序列类共进化分析尤其体现了这种能力的边界。NucleicBERT能够恢复明显高于随机水平的核苷酸耦合,但仍然弱于利用真实MSA的互信息和直接耦合分析。因此,更合理的定位并不是“语言模型已经取代MSA”,而是当同源序列不足、MSA很浅或无法可靠构建时,单序列基础模型可以提供一种近似、无需比对的进化约束来源。


可解释AI分析则进一步增强了这一结论。模型关注二级结构转换边界、高接触度核苷酸,并对破坏Watson–Crick配对区域的扰动尤其敏感;其判断天然RNA序列是否遭到严重破坏的阈值,还与真实RNA家族的自然序列变异范围接近。这些结果共同说明,NucleicBERT并非仅通过大模型容量完成统计拟合,而是在一定程度上形成了具有结构和进化意义的RNA序列空间。


总体而言,NucleicBERT建立了一条从海量未标注RNA序列→自监督语言模型→RNA序列空间表示→结构与功能预测→模型内部生物学规律解释的完整路径。它利用约3000万条非编码RNA序列弥补结构数据不足,并证明单序列模型能够学习部分过去依赖MSA才能获得的信息。随着RNA结构和高通量功能实验数据继续增长,这类模型有望进一步连接海量RNA序列与稀缺的结构功能注释,为RNA功能解析、未知非编码RNA研究以及RNA靶向药物发现提供统一的计算基础。

整理 | DrugOne团队


参考资料


Upadhyay, U., Herold, J., Götz, M. et al. NucleicBERT interprets RNA sequence space through self-supervised language modelling. Nat Mach Intell (2026). 

https://doi.org/10.1038/s42256-026-01295-9

内容为【DrugOne】公众号原创转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除