DRUGONE
蛋白质语言模型(protein language model,pLM)通过在海量蛋白质序列上进行自监督训练,能够学习进化尺度上的序列规律,并已经被广泛用于蛋白质结构、功能和突变效应预测。然而,这些规律通常隐藏在高维表示中,使pLM仍然具有明显的“黑箱”属性。研究人员开发了 MotifAE,一种基于稀疏自编码器(sparse autoencoder,SAE)的无监督解释框架,将pLM嵌入投射到高维但稀疏的潜在特征空间,从中直接寻找与蛋白质功能相关的序列模式。
MotifAE的关键改进是在传统SAE的重构和稀疏约束之外加入“平滑性约束”,使相邻或局部邻近残基更倾向于产生连贯的潜在特征激活,从而更符合蛋白质功能基序和局部结构元件通常由连续或规律排列残基组成的生物学特点。研究人员基于ESM2-650M构建MotifAE,并在230万条代表性蛋白质序列上训练。结果显示,MotifAE能够在基本保持ESM2原始突变效应预测能力的同时,将隐藏表示分解为具有较强可解释性的稀疏特征。
这些特征能够识别已知功能基序、描述具有不同氨基酸偏好的序列模式,并捕获部分结构域以及结构域内部与稳定性、活性和生物学功能相关的关键残基。进一步将潜在特征与深度突变扫描实验数据对齐后,研究人员构建了监督扩展版本MotifAE-G,筛选出与蛋白质折叠稳定性相关的潜在特征,并利用这些特征调整蛋白质序列设计方向。研究表明,MotifAE为解析蛋白质语言模型内部学习到的功能序列规律提供了一种通用方法,并有望用于蛋白质功能注释、突变效应解释和理性蛋白质工程。

蛋白质的催化中心、蛋白质或核酸结合界面、翻译后修饰位点、降解信号以及亚细胞定位信号等功能区域,通常具有一定程度的保守序列模式,这些短序列规律通常被称为功能基序。传统发现方法需要首先通过实验确定具有相同功能的蛋白质区域,再通过序列比对总结共同模式,因此成本高且速度较慢。即使经过多年积累,目前经过系统整理的真核线性功能基序数量仍然有限。
机器学习可以辅助预测功能基序,但监督学习方法通常依赖已经注释的功能区域,因此容易受到训练数据覆盖范围限制。更理想的策略是直接从大规模蛋白质序列中无监督寻找规律,从而减少对既有功能标签的依赖。
蛋白质语言模型为此提供了新的可能。ESM2等模型通过预测被遮盖的氨基酸,在数以百万计蛋白质序列上学习进化规律。已有研究表明,这些模型内部已经隐式编码蛋白质接触关系、结合区域、结构域和功能位点等信息。但问题在于,这些知识分散在高维神经网络表示中,研究人员难以回答一个更基础的问题:蛋白质语言模型究竟学习到了哪些具体的序列模式?
稀疏自编码器提供了一种解释途径。其基本思想是将复杂的pLM嵌入表示分解为大量潜在特征,而每个残基只激活其中少数几个特征。如果某个潜在特征稳定地在具有共同生物学功能的序列区域中出现,它就可能对应一种可解释的功能规律。然而,直接将为自然语言模型开发的SAE用于蛋白质时,并没有充分考虑蛋白质序列的局部连续性。研究人员因此提出MotifAE,希望利用蛋白质基序本身具有局部连贯性的特点,提高潜在特征的生物学可解释性。
方法
研究人员以ESM2-650M最后一层的1,280维残基嵌入作为输入,将其通过MotifAE编码器映射至40,960维稀疏潜在空间,再通过解码器恢复原始ESM2表示。训练使用来自AlphaFold结构数据库聚类得到的约230万条代表性蛋白质,其中约220万条用于训练。与标准SAE相比,MotifAE除了保持嵌入重构能力和潜在特征稀疏性的约束,还加入局部平滑性约束,使一个残基的潜在特征激活至少与邻近窗口中的某个残基保持相似,从而促进沿序列形成连续或规律的激活区域。研究人员利用ELM数据库评价潜在特征对已知功能基序的识别能力,利用CATH评价结构域相关模式,并结合ProteinGYM深度突变扫描数据分析潜在特征与不同功能关键残基之间的关系。对于短序列模式,将每个特征激活的5–30个残基区域进行比对并构建位置特异性评分矩阵。最后构建MotifAE-G,通过实验稳定性数据学习一个特征选择门,在固定ESM2和MotifAE参数的情况下筛选与折叠稳定性相关的潜在特征,并探索利用这些特征进行稳定性导向的序列重设计。

图1:MotifAE整体框架——ESM2嵌入、稀疏潜在空间、平滑性约束以及蛋白质适应度预测。
结果
MotifAE将蛋白质语言模型分解为连贯的稀疏特征
研究人员首先验证加入平滑性约束是否会破坏ESM2原始表示。MotifAE和标准SAE均能够以较低误差重构ESM2嵌入,而且平均每个残基只激活约46个潜在特征,相比原始1,280维表示大幅提高了稀疏性。
随后利用ProteinGYM深度突变扫描数据和ClinVar致病/良性错义突变评价重构表示。MotifAE重构后的表示在零样本突变效应预测中基本保持ESM2原有性能,说明模型在进行稀疏分解时没有明显丢失与蛋白质适应度相关的信息。
真正的差异体现在潜在特征的空间组织上。MotifAE相邻残基之间的潜在特征更加相似,而且更容易形成连续成簇的激活区域。长度约5–30个残基的连续激活可能对应短功能基序,而超过30个残基的区域则可能反映更长的结构域模式。因此,平滑性约束并没有简单增加特征数量,而是将原本零散的SAE激活重新组织为更符合蛋白质序列结构特点的模式。

图2:MotifAE与标准SAE在重构误差、稀疏性、突变效应预测和特征激活连续性方面的比较。
MotifAE能够重新发现已知功能基序
研究人员随后利用ELM数据库中的实验验证基序测试MotifAE。分析覆盖配体结合、蛋白对接、翻译后修饰、靶向信号、蛋白降解以及蛋白水解切割等六类功能,共选择270种具有足够实验注释残基的基序。
对于每种基序,研究人员寻找最能区分基序内部和外部残基的潜在特征。MotifAE最佳匹配特征的中位AUROC达到0.88,而标准SAE仅为0.80。在270种基序中,193种的最佳MotifAE特征AUROC超过0.8,其中114种超过0.9。无论基序位于有序还是无序区域,MotifAE均明显优于标准SAE。
一个代表性案例是Src家族蛋白C端的Csk磷酸化基序。MotifAE特征f13268在12种含有该已知基序的蛋白质中实现0.97的AUROC,而且最高激活位置恰好位于发生磷酸化的酪氨酸残基附近,说明潜在特征不仅识别一段相似序列,还捕获了其中具有核心功能意义的位点。
不同特征还表现出不同层次的生物学粒度。一些潜在特征高度特异,只对应一种功能基序;另一些则反映更一般的序列属性。例如f27416能够匹配17种不同ELM基序,但这些基序全部位于蛋白质C端。在具有已知C端基序的320种蛋白质中,96%出现该特征激活,而随机蛋白中仅为39%。这表明部分潜在特征可能编码“C端功能模式”这样的高层次概念,而非某一种具体基序。

图3:MotifAE潜在特征对ELM已知功能基序的识别及典型C端磷酸化基序案例。
潜在空间包含丰富的未知序列模式
已知数据库只能覆盖有限的功能基序,因此研究人员进一步分析MotifAE是否能够从蛋白质语言模型内部发现尚未注释的序列规律。
在40,960个潜在特征中,共有6,421个形成5–30个残基长度的连贯激活区域。这些区域的氨基酸组成明显不同于随机肽段,说明它们并不是随机激活。约400个特征几乎只由单一氨基酸驱动,而其他特征则表现出更加复杂的多残基组合偏好。
研究人员将同一潜在特征激活的肽段进行比对,并构建位置特异性评分矩阵,从而把抽象的神经元特征转换为可以直接阅读的序列模式。结果出现了多种清晰规律,包括富含特定残基的重复模式,以及类似“RRHRR”“LPLP”和间隔排列谷氨酰胺等组合模式。
更重要的是,越能够准确定位已知ELM基序的潜在特征,其序列模式与相应ELM规则表达式也越一致。同时,在MotifAE解码器权重空间中彼此接近的特征往往具有相似序列模式。这说明这些功能序列规律并非后续分析人为产生,而是已经实际编码在模型内部的权重空间中。
因此,MotifAE不仅可以重新发现已知基序,也提供了从pLM中系统挖掘未知候选基序的方法:寻找具有高度连贯激活和明确序列偏好的潜在特征,再进一步通过实验确定其生物学功能。

图4:MotifAE发现的序列模式谱系、PSSM序列特征以及潜在权重空间中的模式组织。
MotifAE进一步捕获结构域的功能组织
研究人员随后将分析从短基序扩展到更长的结构模式,在400种CATH结构域上测试潜在特征能否区分结构域内部和外部残基。结果显示,在主要α螺旋、主要β折叠以及α/β混合结构域中,MotifAE总体明显优于标准SAE。
以AUROC超过0.8作为结构域与特征匹配标准,共获得181个匹配关系,涉及105种结构域和106个潜在特征,其中大多数特征只对应一个结构域。不过,对于需要复杂长程残基接触形成的结构域,MotifAE性能会下降,说明基于局部序列平滑性的设计仍然难以完整描述远距离三维相互作用。
更有意义的是,MotifAE不仅能够识别结构域边界,还能一定程度解析结构域内部“哪些残基为什么重要”。研究人员利用177项ProteinGYM深度突变扫描实验,以每个残基的平均突变效应作为功能重要性指标,覆盖稳定性、生长适应度、酶活性、表达和结合等不同功能。
最佳MotifAE特征激活与残基重要性的中位Spearman相关达到0.41,而标准SAE为0.33;约80%的实验中MotifAE表现更好。其中稳定性相关性从0.21提高至0.38,活性从0.40提高至0.52,生物适应度从0.36提高至0.45。映射到三维蛋白结构后,高激活区域与实验确定的重要残基在多个蛋白中表现出明显一致性。

图5:MotifAE对CATH结构域的识别以及潜在特征与不同蛋白功能关键残基的对应关系。
MotifAE-G从实验数据中提取蛋白质稳定性特征
最后,研究人员提出一个更进一步的问题:如果不同MotifAE特征分别对应不同生物学约束,能否从中筛选出专门控制某一种性质的特征?
为此,他们开发了MotifAE-G,在MotifAE潜在空间加入可学习的二元门控。ESM2和MotifAE参数保持完全固定,只利用深度突变扫描实验训练门控,选择哪些潜在特征参与嵌入重构。研究人员以412个蛋白质结构域的大规模折叠稳定性数据作为实验体系,并通过结构聚类严格划分训练、验证和测试集合。
最终筛选得到1,583个稳定性相关潜在特征。使用这些特征预测突变稳定性时,训练、验证和测试集的中位Spearman相关分别达到0.60、0.54和0.55,测试性能达到与基于生物物理能量计算的方法相近的水平。
这些特征还表现出合理的生物物理含义。稳定性相关特征的激活与残基突变对稳定性的影响具有更强相关性,而且明显偏向蛋白质内部的低溶剂暴露残基,与疏水核心对维持蛋白质折叠稳定性的作用一致。
研究人员进一步提高稳定性相关特征的权重,引导模型进行多轮序列重设计。随着权重增加,模型更倾向于在蛋白内部位置引入疏水氨基酸,同时由FoldX预测具有稳定性改善的设计比例总体增加。虽然这些设计仍然只是计算验证,但结果表明,从pLM中分离出的可解释潜在特征不仅能够用于解释模型,还可能进一步作为控制蛋白质设计方向的“功能旋钮”。

图6:MotifAE-G筛选稳定性相关潜在特征及其用于稳定性导向蛋白质序列重设计。
讨论
MotifAE的核心意义在于尝试打开蛋白质语言模型内部的“黑箱”。过去研究已经知道ESM2等pLM能够预测突变效应、结构和功能,但这些能力通常表现为一个整体性的高维表示,很难解释某个残基为什么被模型认为重要,更难判断这种重要性究竟来自折叠稳定性、结合、催化还是翻译后修饰等因素。
MotifAE提出了一种分解思路:将pLM表示拆分成大量稀疏潜在特征,并利用蛋白质序列的局部连续性作为生物学先验,使潜在特征更容易形成连续的功能模式。实验结果说明,这种看似简单的平滑性约束并没有明显损害ESM2的信息,却显著增强了潜在特征与真实功能基序和结构域之间的对应关系。
这一框架尤其有价值的地方在于,它并不完全依赖已有注释。使用已知功能数据库只能判断某个特征是否对应已知基序,而无法发现数据库中不存在的模式。MotifAE因此通过PSSM直接描述每个潜在特征对应的序
列模式,从而把“第几个潜在神经元被激活”转化为研究人员可以直接理解和比较的氨基酸偏好。具有明确PSSM但无法匹配现有ELM注释的特征,因此可能代表尚未被系统描述的候选功能基序。未来可以针对这些候选模式寻找富集蛋白、细胞定位、相互作用伙伴或实验表型,再通过突变实验验证其真实功能。研究人员也强调,目前这些模式只能被视为候选序列规律,不能仅凭MotifAE激活就认定其具有新的生物学功能。
MotifAE-G则进一步把“无监督解释”与实验数据连接起来。普通蛋白质语言模型给出的适应度实际上混合了多种进化约束:一个高度保守的残基可能因为维持折叠稳定性而重要,也可能参与配体结合、催化或翻译后修饰。仅依赖传统保守性分数很难区分这些原因。MotifAE的思路是把这种综合信号拆解为不同潜在特征,再利用特定实验数据筛选其中与某一种性质最相关的部分。这样,原本笼统的“这个残基很重要”就有可能进一步分解为“这个残基主要与稳定性相关”或“可能与另一类功能约束相关”。
本研究首先选择蛋白质折叠稳定性,是因为存在规模较大且实验条件相对统一的深度突变扫描数据。MotifAE-G证明,只需要训练潜在特征的门控,而保持ESM2和MotifAE本身完全冻结,就能够筛选出具有明显生物物理意义的稳定性特征。这些特征更偏向蛋白质内部残基,并且其激活程度与突变导致的稳定性变化更加一致。进一步提高这些特征的贡献后,模型设计序列时也开始更倾向于在埋藏位点选择疏水残基。这说明可解释特征不仅能够用于事后解释,还有潜力成为主动调控蛋白质设计的变量。
这种策略理论上并不限于稳定性。如果拥有足够规模的酶活性、蛋白结合、表达水平、亚细胞定位或其他高通量实验数据,同样可以利用MotifAE-G寻找与这些性质对应的潜在特征。由此可以形成一种更细粒度的蛋白质语言模型解释框架:首先无监督地将pLM内部表示拆解成大量潜在生物学特征,再利用不同实验数据分别为这些特征赋予稳定性、结合、催化或表达等功能标签。研究人员认为,这可能有助于把pLM内部混合在一起的进化约束逐步拆分成具有明确生物学含义的组成部分。
不过,MotifAE目前仍存在明显局限。首先,其平滑性约束主要沿一维蛋白质序列建立,因此最擅长捕捉局部连续模式。对于依赖序列上相距很远、但三维结构中彼此接触的残基形成的复杂功能单元,模型能力明显下降。这一点也体现在结构域分析中:随着结构域接触序增加,MotifAE的识别性能降低。未来如果将三维空间邻近关系直接加入平滑性约束,可能更适合解析由远距离残基共同组成的活性中心、结合口袋以及复杂结构域。
其次,当前模型使用传统稀疏约束来限制潜在特征激活数量。其他稀疏自编码器方法可能产生不同的潜在特征组织方式,因此未来需要探索新的稀疏策略如何与蛋白质序列平滑性结合。与此同时,潜在特征本身存在不同的“粒度”:有些对应非常具体的单一功能基序,有些则像f27416一样编码更宽泛的“蛋白质C端功能区域”。如何主动控制这种粒度,将直接影响模型解释的精确程度和实际用途。
另一个不能忽视的问题是数据偏倚。MotifAE所能够发现的规律首先受到ESM2预训练数据影响,同时还受到用于训练MotifAE的230万条代表性蛋白质的组成影响。深度学习模型学习到的并不是一个完全无偏的“自然蛋白质规律全集”,而是训练数据中可观察进化规律的映射。因此,不同蛋白质家族、物种或功能类别在训练数据中的覆盖程度可能影响潜在特征的组成。未来比较不同pLM、不同训练数据库以及不同结构聚类策略产生的潜在特征,将有助于判断哪些模式具有普遍生物学意义,哪些可能更多反映特定模型或数据集的偏好。
最后,本研究的蛋白质重设计结果仍然停留在计算验证阶段。稳定性改善主要由结构预测和FoldX等计算方法评价,尚未通过蛋白表达、热稳定性测定或其他实验直接确认。因此,目前更适合将这一部分理解为“可解释潜在特征能够用于定向设计”的概念验证,而不能据此认为MotifAE已经建立成熟的稳定蛋白设计方法。研究人员明确指出,后续实验验证是判断这一策略能否真正用于蛋白质工程的重要步骤。
总体而言,MotifAE提供了一条从蛋白质语言模型表示 → 稀疏潜在特征 → 可读序列模式 → 生物学功能 → 定向蛋白质设计的解释路径。与直接利用ESM2预测突变效应不同,它更关注模型为什么产生这样的预测,以及隐藏表示中是否能够分离出不同功能约束。通过引入符合蛋白质序列特点的局部平滑性,MotifAE能够更有效地恢复已知功能基序,同时发现大量具有明确氨基酸偏好的候选模式,并进一步捕获结构域内部与稳定性、活性和适应度相关的残基组织。
因此,这项工作的意义并不只是开发一个新的基序识别工具,而是展示了一种研究蛋白质基础模型内部知识的新思路:不再仅把pLM当作产生embedding或适应度分数的黑箱,而是尝试将其内部学习到的进化规律拆解成可以观察、注释、实验关联甚至主动操控的生物学特征。 如果未来能够进一步加入三维结构信息、更多高通量功能实验以及真实蛋白质工程验证,类似MotifAE的可解释框架可能成为连接蛋白质基础模型、功能机制研究和理性蛋白质设计的重要桥梁。
整理 | DrugOne团队
参考资料
Hou, C., Liu, D. & Shen, Y. Unsupervised discovery of functional sequence patterns from protein language model with MotifAE. Nat Commun (2026).
https://doi.org/10.1038/s41467-026-77333-2

内容为【DrugOne】公众号原创|转载请注明来源
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢