DRUGONE
AlphaFold等结构预测方法已经将可获得的蛋白质结构扩展到数亿规模,Foldseek等工具也使大规模结构搜索成为可能。然而,当前多数结构搜索方法仍然依赖从N端到C端的顺序对应,因此容易遗漏一种特殊的结构关系——环状置换(circular permutation,CP)。在这种情况下,两个蛋白质具有高度相似的三维折叠,但N端和C端的位置发生重新安排,使传统顺序比对难以识别二者之间的关系。
研究人员开发了CIRPIN(circular permutation-invariant graph neural network),一种对环状置换具有不变性的蛋白质结构图神经网络。其关键思想并不是收集大量天然环状置换蛋白,而是在训练过程中人为产生合成环状置换(synCP):假想连接蛋白质原来的N、C端,再从其他位置切开产生新的末端。通过这种半合成数据增强,模型逐渐学会忽略末端位置变化,更关注真正决定蛋白质折叠的局部和三级结构模式。
CIRPIN在已知环状置换基准中明显优于原始Progres结构嵌入模型,并能够以接近Progres的速度搜索大规模结构数据库。研究人员随后建立CIRPIN-DB,获得约1830万对高度富集环状置换关系的蛋白质,涉及589,113个独特结构域和845种CATH拓扑,是目前规模最大的环状置换蛋白资源之一。尤其值得注意的是,研究人员发现广泛存在的PDZ结构域至少具有四种不同拓扑形式。

环状置换并不意味着蛋白质真正变成一个环。更准确地说,可以想象首先将一个蛋白质原来的N端和C端连接起来,然后在序列内部另一个位置切开,由此产生新的N端和C端。如果这种操作之后整体二级结构连接关系及三维排列仍与另一个蛋白质一致,那么二者就可以被认为存在环状置换关系。研究人员特别强调,这一定义描述的是结构拓扑关系,而不自动意味着两个蛋白质具有共同祖先。
环状置换不仅具有进化意义,也已经被用于研究蛋白质折叠和稳定性,并用于构建变构蛋白质开关、蛋白质纳米颗粒以及可感知蛋白酶的Cas9等工程系统。然而,天然环状置换长期主要依赖研究人员针对特定蛋白进行人工结构比较而发现,缺少能够在整个蛋白质结构宇宙中进行高速系统搜索的方法。
问题来自传统结构搜索中的“顺序依赖”。即使两个蛋白质三维结构几乎相同,只要链的起点和终点发生变化,从N端到C端进行比对时就会出现明显错位。显式考虑CP的结构比对虽然能够解决问题,却难以扩展到数百万乃至数亿结构的数据库。因此,研究人员尝试让神经网络直接学习一种“不在乎蛋白质从哪里开始、在哪里结束”的结构表示。
方法
CIRPIN建立在Progres图神经网络基础上。研究人员将蛋白质表示为空间图,以主链Cα原子作为节点,并根据空间距离建立连接,同时保留局部结构、末端身份和序列位置信息。训练时,对每个蛋白质随机执行synCP操作:将坐标序列循环移动,相当于改变N端和C端的位置,但基本保持原来的三维结构。随后利用监督对比学习,使属于同一SCOPe家族的蛋白质及其不同synCP表示在潜在空间中靠近,而不同蛋白质远离。模型训练500轮后,通过余弦相似度进行高速数据库检索。实际发现天然CP时,研究人员同时使用CIRPIN和不具CP不变性的Progres:如果CIRPIN认为两个蛋白高度相似,而Progres认为二者不同,则将其视为候选CP,再使用考虑环状置换的TM-align进行结构验证。

图1:环状置换定义、synCP数据增强以及CIRPIN图神经网络训练和结构检索框架。
结果
CIRPIN学习到不受蛋白质末端位置影响的结构表示
研究人员首先使用一对具有环状置换关系的winged helix–turn–helix结构测试现有方法。原始Progres给出的相似度仅为0.39,低于0.8的结构相似阈值。但当人为改变其中一个蛋白质的序列起点时,Progres评分会随着新末端位置剧烈变化,最高能够达到很高的相似度。这说明模型实际上识别到了相似结构,却被序列位置编码所干扰。
CIRPIN训练后,同一蛋白质无论从哪个位置产生新的N、C端,相似度评分都保持高度稳定。与此同时,对于真正结构无关的蛋白质,模型仍然给出较低评分,说明获得CP不变性并没有简单地让模型“什么都认为相似”。
在文献整理的11对已知CP中,普通TM-align识别3对,考虑CP的TM-align识别7对,Progres识别4对,而CIRPIN识别9对。排除训练分类可能带来的影响后,Progres识别2/9,CIRPIN则达到7/9。

图2:CIRPIN、Progres和TM-align对合成及天然环状置换蛋白的识别性能比较。
SCOPe分析显示环状置换约占4.4%–7.0%
研究人员随后对约15,200个SCOPe40结构进行全对全搜索。首先寻找CIRPIN评分高于0.9而Progres低于0.6的候选,再利用TM-align验证结构关系。
初步得到18,326对模型判断差异明显的蛋白,其中1,973对被进一步认为可能存在CP。去除重复后包含1,204个独特结构,经过结构聚类得到193个簇。改变筛选阈值后得到193–304个簇,据此估计SCOPe中环状置换发生比例约为4.4%–7.0%。
这一比例明显低于此前9%–36%的估计。研究人员重新检查旧有CP数据库后发现,其中存在明显结构冗余,例如约20%的蛋白对来自研究非常充分的concanavalin-like折叠;此外还包含部分结构相似度不足的潜在假阳性以及人工工程化环状置换蛋白。因此,过去可能高估了天然CP的普遍程度。

图3:CIRPIN与Progres联合筛选SCOPe环状置换的流程及天然CP比例估计。
PDZ结构域存在至少四种不同拓扑
SCOPe搜索产生的一个重要发现来自PDZ结构域。PDZ是动物中极其常见的蛋白质相互作用模块,人类有400多种蛋白质包含PDZ结构域,也是多结构域蛋白中最常被插入的结构域之一。
传统研究主要关注一种“标准PDZ拓扑”。CIRPIN却在PDZ-like折叠中发现大量CP关系,并识别出此前未充分认识的拓扑形式。SCOPe结构分析首先显示PDZ至少存在三种彼此通过CP关联的拓扑。
研究人员随后从AlphaFold结构数据库获得4,015个PDZ注释结构域,质量过滤后保留2,563个。在潜在空间分析中又发现一个与前三种结构明显不同的群体,其代表结构构成第四种PDZ环状置换拓扑。因此,同一种PDZ折叠可以通过至少四种不同的链连接方式实现。

图4:CIRPIN发现PDZ结构域的多种环状置换拓扑及其在结构嵌入空间中的分布。
CIRPIN-DB将环状置换搜索扩展到整个蛋白质宇宙
研究人员进一步处理约270万个AlphaFold聚类代表结构,将其划分为约350万个结构域,再利用CIRPIN进行大规模搜索。初步筛选产生约5.85亿对候选关系,经过结构验证后最终获得18,301,678对候选CP,涉及589,113个独特结构域和845种CATH拓扑。
随机人工检查100对后,72对能够明确判断为CP,12对因同时存在其他结构变化而难以判断,16对并不符合CP关系,对应约72%的估计精确率。589,113个结构域进一步形成44,875个结构簇,远超旧数据库质量控制后得到的121个簇,显示CIRPIN显著扩大了已知CP结构空间。
其中不仅重新发现了已报道的内肽酶CP,还发现核糖核酸酶H-like结构域之间此前未识别的关系。约一半候选甚至缺少CATH注释,提示CIRPIN可能帮助连接当前结构分类体系中尚未建立关系的蛋白质。

图5:CIRPIN-DB中约1830万对候选环状置换的CATH分布及代表性内肽酶和核糖核酸酶案例。
CIRPIN揭示大量此前未知的远缘拓扑关系
对CIRPIN-DB不同长度和不同结构类别的代表蛋白进行检查后,研究人员发现许多候选蛋白甚至被CATH归入不同class、architecture或topology,部分则完全没有CATH分类。
这说明环状置换可能掩盖传统分类体系中的远缘结构关系。尤其对于某些核糖核酸酶,CIRPIN识别出的共享核心在常规TM-align中甚至低于通常认为具有显著结构相似性的阈值,却表现出与已知功能相关结构一致的核心拓扑特征。

图6:AlphaFold结构数据库中CIRPIN发现的不同长度、不同CATH分类及未注释蛋白的代表性新型环状置换。
CIRPIN还能识别重连、插入和延伸造成的结构变化
研究人员意外发现,CIRPIN学习到的表示并不只对CP具有鲁棒性。一些CIRPIN认为高度相似、但TM-align在允许CP后没有明显改善的蛋白,实际上具有相似的三维二级结构排列,却采用不同的链连接方式。
研究人员将这种情况称为secondary-structure rewiring。它不同于CP:CP要求连接原来的N、C端并在其他位置产生新末端,而rewiring可以改变内部二级结构之间的连接方式。
此外,较大的插入或末端延伸也会严重影响Progres表示,而CIRPIN相对稳定。当删除这些插入后,Progres评分明显升高。因此,synCP训练似乎使CIRPIN减少了对精确序列位置和结构域边界的依赖,从而能够识别更加复杂的拓扑重排。

图7:环状置换、二级结构重连、结构延伸和插入等不同蛋白质拓扑变化。

图8:CIRPIN识别被二级结构重连和大型插入掩盖的蛋白质结构关系。
CIRPIN内部表示自动学习到三级结构基序
为了理解模型为什么能够获得这种能力,研究人员进一步检查单个残基节点的潜在表示。
在由三段α螺旋组成的蛋白质区域中,CIRPIN自动将属于不同α螺旋但局部三级环境相似的残基表示为相似特征。在另一个蛋白中,模型能够识别N端和C端两个短β折叠之间的结构相似性。
更加复杂的例子是一个具有内部对称性的蛋白,其两个亚结构像“握手”一样彼此交错。两个亚结构可以高度重叠,TM-score达到0.81。CIRPIN的节点表示清晰识别了这种内部重复,而Progres几乎没有产生对应信号。
因此,synCP训练带来的并不只是“忽略N端和C端”,还迫使模型更多依赖残基的局部三级结构环境和结构基序。这可能正是CIRPIN能够进一步识别插入、重连和远缘结构关系的原因。

图9:CIRPIN节点级潜在表示捕获α螺旋、β折叠及复杂内部重复三级结构基序。
讨论
CIRPIN最重要的意义,是使环状置换研究从少数蛋白的人工观察转变为整个蛋白质结构宇宙中的系统搜索。过去,研究人员通常先发现两个蛋白“看起来很像”,随后才通过精细结构比对确认CP。面对数百万AlphaFold结构,这种方式显然无法扩展。CIRPIN则利用快速图嵌入进行第一轮搜索,再对少量候选使用昂贵的结构比对,从而兼顾速度与准确性。
这项研究也展示了合成数据增强改变模型归纳偏置的价值。天然CP数量不足以直接训练深度模型,研究人员因此人为生成synCP。模型在训练过程中反复看到“结构几乎相同但链起点不断改变”的样本,被迫学习哪些信息真正决定折叠,而哪些只是序列编号和末端位置。这种训练最终不仅解决CP问题,还意外增强了模型对插入、延伸和结构重连的鲁棒性。
不过,发现CP并不意味着证明两个蛋白具有共同进化祖先。基因复制后截短可能产生CP,但不同序列也可能独立收敛到相似三维拓扑。特别是仅含4–6个二级结构元件、长度约60–80个残基的小型结构域,可形成的稳定排列本来就有限,因此趋同进化的可能性更高。真正区分趋同与分歧进化仍需要结合序列、结构和系统发育分析。
当前CIRPIN也存在局限。为了控制数百万结构产生的巨大组合空间,研究人员采用了较保守的筛选阈值,因此可能遗漏末端位置变化较小的“轻微CP”。模型又主要在SCOPe上训练,对明显偏离训练结构空间的蛋白可能泛化不足;AlphaFold数据库中的结构域切分错误也可能导致真实CP被漏掉。
总体而言,CIRPIN建立了一条从合成环状置换数据增强 → CP不变图神经网络 → 大规模结构搜索 → CIRPIN-DB → 蛋白质拓扑与进化关系发现的完整路径。它产生的约1830万对候选关系和845种CATH拓扑显著扩展了已知环状置换空间,而PDZ结构域四种拓扑的发现尤其说明,同一种稳定蛋白质折叠可能隐藏着远比传统结构分类所显示的更加丰富的链连接方式。
因此,这项工作的价值不仅在于“找到更多环状置换蛋白”,还在于重新提醒我们:三维结构相似并不要求一级序列按照相同顺序连接。 当结构搜索模型摆脱从N端到C端的线性视角后,过去被序列顺序、插入和拓扑重排掩盖的远缘关系开始重新显现。这为研究蛋白质折叠的演化、重新审视结构分类体系以及为蛋白质工程寻找新的设计自由度提供了新的计算工具。研究人员还指出,CIRPIN发现的大量缺少CATH注释、却与已知结构家族存在明显拓扑联系的结构域,未来可能用于修正或补充现有蛋白质分类,并帮助推测未知蛋白的潜在功能。
从蛋白质工程角度看,环状置换尤其值得关注,因为它改变的是蛋白质链的连接方式,而不一定改变整体三维折叠。新的N端和C端位置可能改变蛋白质折叠路径、局部稳定性、结构动力学以及与其他结构域连接的位置。过去工程化CP已经被用于设计蛋白质开关、纳米颗粒以及可编程Cas9系统,而CIRPIN提供的大规模天然CP资源则有可能进一步帮助研究人员了解:哪些位置能够容忍新的末端、哪些折叠天然具有较大的拓扑可塑性,以及自然界如何在保持整体结构的情况下重新组织蛋白质链。 论文将这些工程应用作为CP研究的重要背景,并通过CIRPIN-DB显著扩大了可供进一步研究的天然实例范围。
PDZ结构域的结果尤其体现了这一价值。PDZ是多结构域蛋白中最常见的插入结构域之一,但长期以来,大量研究主要围绕经典PDZ拓扑展开。CIRPIN显示,同一个PDZ折叠至少可以由四种不同的链连接拓扑实现,而且这些结构彼此可以通过环状置换联系起来。研究人员指出,虽然PDZ的肽结合特异性已经得到大量研究,但环状置换如何影响其折叠与功能仍缺乏系统认识。因此,这四类天然拓扑为进一步研究“保持相似三维结构的同时改变链连接顺序会产生什么功能后果”提供了天然实验体系。
CIRPIN的另一个潜在用途是重新连接目前被不同结构分类标签分开的蛋白质。研究人员在CIRPIN-DB中发现,一些CP蛋白被CATH归入不同class、architecture甚至topology,而另一些结构域完全没有CATH注释。如果只依赖传统顺序结构比对,这些蛋白可能被认为彼此无关;而当允许链连接关系发生重新排列后,它们可能共享相同或相近的核心三维结构。研究人员因此认为,CIRPIN可以帮助统一目前被划分到不同家族的蛋白质,并可能辅助为未注释结构域赋予功能。
值得注意的是,CIRPIN并不是要取代TM-align等精确结构比对方法,而是解决它们难以应对超大规模数据库的问题。显式CP结构比对需要动态规划,当结构数据库达到数百万乃至上亿规模后,全对全计算几乎不可行。论文估计,仅使用普通TM-align对1亿个结构进行全对全比较,即使拥有1,000个CPU核心也可能需要约一万年,而开启CP模式还会进一步增加计算成本。
因此,CIRPIN采用的是一种“快速嵌入检索+精确结构验证”的分层策略。神经网络首先把每个蛋白质压缩成固定维度表示,数据库可以提前完成嵌入;查询时只需要计算余弦相似度,从而快速缩小候选范围。随后,再对最可能存在CP的蛋白对使用TM-align CP进行更加昂贵但精确的验证。正是这种组合,使研究人员能够从约350万个AlphaFold结构域产生的巨大两两组合空间中筛选出约1830万对候选CP。
从机器学习角度看,这项工作还展示了一个很有启发性的现象:训练模型对一种特定扰动保持不变性,可能促使模型学习更加普遍的结构规律。 CIRPIN训练时只明确加入了环状置换增强,并没有专门训练模型识别二级结构重连、大型插入或结构域延伸,但这些变化对CIRPIN表示的影响同样明显小于对Progres的影响。研究人员认为,这是因为synCP训练降低了模型对残基绝对序列位置的依赖,使其更多关注局部结构环境和相互作用模式。
节点级表示分析为这一解释提供了进一步支持。CIRPIN能够自动识别不同α螺旋之间的相似局部环境,也能够把位于蛋白质N端和C端的相似β折叠关联起来。对于具有复杂内部对称性的3cbn结构,两个彼此交错、但可以高度重叠的亚结构在CIRPIN潜在空间中表现出明显相似,而Progres没有捕获这一信号。研究人员据此认为,CIRPIN实际上学习到了与三级结构基序相关的局部表示,而不仅是完整蛋白质的全局结构标签。
这一点也为未来发展提供了新的方向。当前CIRPIN主要输出蛋白质级结构嵌入,用于快速检索相似结构;但其节点级表示已经表现出识别局部三级结构重复的能力。研究人员因此提出,未来可以利用这些表示搜索不同蛋白质中的相似亚结构,甚至进一步发展显式结构比对方法。换言之,synCP训练产生的局部结构表征可能不仅服务于环状置换,还可能用于发现更加普遍的远缘结构基序。
当然,CIRPIN-DB中的1830万对结果不能全部被直接视为确定的天然环状置换。研究人员随机人工检查100对候选,其中72对能够明确确认,12对由于同时存在其他复杂结构变化而难以判断,16对不符合CP。因此,当前数据库更准确地说是高度富集CP关系的候选结构资源,而不是经过逐一人工确认的1830万对天然CP。
此外,研究采用较大的CIRPIN与Progres评分差异作为筛选条件,本身会偏向那些末端位置发生明显变化的CP。对于新的N、C端只移动少量残基的轻度环状置换,两种模型可能给出相似评分,因此无法通过当前筛选条件。这意味着1830万对并不是蛋白质宇宙中所有CP的完整集合。研究人员认为,未来如果能够首先根据蛋白质长度等简单条件缩小搜索空间,就可以降低评分差异阈值,从而发现更多细微的拓扑变化。
结构域划分也是一个现实问题。AlphaFold数据库中的完整蛋白质首先需要被切分成独立结构域,而大型插入、复杂多结构域连接或预测误差都可能导致错误切分。一旦一个真实结构域被分成多个片段,CIRPIN就无法看到完整拓扑,从而漏掉潜在CP。与此同时,CIRPIN主要在SCOPe结构空间上训练,对于SCOPe中缺乏代表性的特殊蛋白质折叠,其泛化能力仍然需要进一步验证。
总体来看,CIRPIN并不是单纯为环状置换增加一个新的结构比对算法,而是提出了一种更加一般的思路:先明确传统模型在哪一种结构变换下失败,再人工生成这种变换作为训练数据,使模型主动学习对这种变化保持不变的表示。 在本研究中,这种半合成训练数据只需要重新定义已有蛋白质的链起点和终点,不需要实验获得大量新的天然CP,就能够显著改变模型对蛋白质结构的理解方式。
最终,CIRPIN将蛋白质结构搜索从传统的“两个蛋白质能否按照N端到C端顺序对齐”,推进到了“忽略链从哪里开始后,它们是否实际上具有相同的三维拓扑组织”。这一视角使过去隐藏在序列顺序变化背后的结构关系重新显现,并揭示PDZ等经典结构域具有远比此前认识更加丰富的拓扑多样性。
随着AlphaFold等方法继续扩展蛋白质结构宇宙,真正的挑战正在从“获得结构”转向“理解数亿结构之间隐藏的关系”。CIRPIN说明,当深度学习模型能够摆脱线性序列顺序这一人为限制后,它不仅可以发现新的环状置换,还能够捕获三级结构基序、复杂结构重连和远缘拓扑关系。因此,CIRPIN及其建立的CIRPIN-DB有望成为研究蛋白质结构演化、远缘同源关系、结构域分类以及蛋白质拓扑工程的重要资源,也为未来开发能够理解更加复杂蛋白质结构变换的AI搜索模型提供了新的方向。
整理 | DrugOne团队
参考资料
A.R. Kolodziej,S.M. Abulnaga, & S. Ovchinnikov, Systematic discovery of circular permutations across the protein universe using CIRPIN, Proc. Natl. Acad. Sci. U.S.A. 123 (36) e2605178123,
https://doi.org/10.1073/pnas.2605178123 (2026).

内容为【DrugOne】公众号原创|转载请注明来源
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢