近日,由 Syneron Opal、同济大学、德州学院和阿卜杜拉国王科技大学(KAUST)组成的联合研究团队在 Advanced Science 发表题为“Similarity-Enhanced Representation Learning of Non-Canonical Amino Acids for Therapeutic Peptide Modeling”的研究论文。许陈成和魏乐松为共同第一作者,曾强成和高欣为通讯作者。该研究提出面向非天然氨基酸(non-canonical amino acids,ncAAs)的相似性增强预训练框架 SinCAA,通过“构象相似性引导的对比学习 + 掩码节点恢复”同时学习 ncAA 之间的功能关系和每种 ncAA 的独特化学身份。SinCAA 在 387,482 种 ncAA 上进行预训练,却能够从单个氨基酸结构迁移到完整治疗肽,在 KRAS 宏环肽亲和力、NRAS/KRAS 选择性、环肽细胞通透性以及蛋白质-肽结合位点预测等任务中持续优于现有分子预训练模型,并在未见 ncAA、低化学相似度和公共数据向药物研发数据迁移等困难场景中展现出较强的零样本与分布外泛化能力,为含 ncAA 治疗肽的计算筛选和定向优化提供了新的表征基础。

研究背景
治疗性肽兼具小分子药物和大分子生物制剂的部分优势:一方面,其分子尺寸和药代性质通常比抗体等大分子更灵活;另一方面,肽分子又能够通过较大的相互作用界面实现较高的靶标特异性。目前已有 80 余种肽类药物获批,但仅由天然氨基酸组成的肽往往面临体内稳定性不足、膜通透性有限和可开发性受限等问题。引入 ncAA 可以扩展侧链化学空间、调节构象并改善抗蛋白酶降解、细胞通透性和选择性,因此已经成为环肽和治疗肽优化的重要策略。
然而,ncAA 也使治疗肽建模面临两个相互关联的难题。首先,潜在 ncAA 种类可达数万甚至更多,将其组合进长度有限的肽链后仍会产生巨大的序列与拓扑空间,难以依赖实验逐一筛选。其次,公开数据中同一种 ncAA 往往只出现一次或少数几次,传统序列模型通常只能将 ncAA 统一编码为未知占位符,而为小分子设计的预训练模型又没有专门学习氨基酸替换所对应的细微构象变化。结果是模型既难以表达不同 ncAA 的独特化学身份,也难以判断哪些 ncAA 可以在保持肽整体构象与功能的前提下相互替换。
针对这一问题,研究团队提出一个面向治疗肽设计的核心假设:如果两种氨基酸具有相似的三维构象分布,那么在肽链中进行替换时,它们通常只会对整体构象和功能产生较小扰动。SinCAA 以此为出发点,不再依赖每一种 ncAA 的大量任务标签,而是从大规模 ncAA 化学结构中同时学习“谁与谁相似”以及“每种结构由什么组成”,从而把稀缺的肽级监督问题转化为可扩展的氨基酸构件预训练问题。
方法概述
SinCAA 由 ncAA 数据构建、肽感知构象相似性计算、关系-身份双任务预训练以及下游任务适配四部分组成,目标是获得能够从单个 ncAA 原子图迁移到完整线性肽和宏环肽的通用原子级表示。
大规模 ncAA 预训练数据
研究团队从 PubChem 收集并清洗得到 387,482 个 ncAA 结构,其中 309,986 个用于训练、77,496 个用于验证。为了增强模型对通用化学组成和键连接模式的学习,节点恢复任务还引入了 1,000 万个 ZINC15 分子作为辅助数据。考虑到下游对象是完整肽而非孤立氨基酸,训练中进一步将一个或两个 ncAA 连接成短链,使模型提前接触肽键邻域和更高阶局部子结构,缩小预训练分子图与下游肽图之间的尺度差异。
面向氨基酸替换的构象相似性度量
传统 Morgan 指纹等相似性指标主要比较二维子结构,难以区分侧链立体化学和细微构象变化。SinCAA 首先在 ncAA 两端连接甘氨酸,以近似氨基酸进入肽链后的化学环境;随后利用 ETKDG 生成多种三维构象,并以 Cα 原子、氨基氮和羧基碳建立统一坐标系。每个构象被离散为带有元素类型和部分电荷的三维体素集合,构象之间采用集合相似性比较,而两个 ncAA 的构象分布则通过最优匹配进行对齐。由此得到的构象相似性不仅关注“是否含有相同片段”,还描述侧链在肽骨架参考系中的空间占据和化学性质。
“关系-身份”双任务预训练
SinCAA 以 GPS Graph Transformer 为骨干网络,并在每个模块中使用两层 GIN 扩大局部化学结构的感受野。第一项任务是构象相似性引导的对比学习:对于一个锚点 ncAA,从其最相似的候选中构造正样本和困难负样本,使表征空间能够保留细粒度的可替换关系。第二项任务是掩码节点恢复:随机遮蔽分子图中的部分原子,要求模型根据邻域恢复原子身份,从而学习每种 ncAA 的组成和键连接特征。
从 ncAA 构件迁移到完整治疗肽
在下游任务中,SinCAA 直接接收完整肽的分子图并输出原子级嵌入,再与 MLP、浅层 GIN 或蛋白质-肽交互模型结合,可用于亲和力回归、选择性分类、细胞通透性预测以及双方结合位点预测。该设计既支持含 ncAA 的线性肽,也能够保留单环和多环肽的真实拓扑,不需要将复杂残基压缩为统一的未知符号。

图 1. SinCAA 总体框架、ncAA 构象相似性计算方法及其在治疗肽建模任务中的应用。
结果与讨论
构象相似性能够刻画单残基替换引起的功能变化
研究团队首先检验构象相似性是否真正对应肽工程中的残基可替换性。在一个包含 9 种单氨基酸替换的环肽案例中,构象相似性与结合亲和力变化排序的 Spearman 相关系数达到 0.83,高于 Morgan 指纹相似性的 0.60;同时,该度量对 ncAA 立体化学差异表现出更强的区分能力。这说明将氨基酸置于统一肽骨架参考系并比较其构象分布,可以比二维指纹更接近“替换后会对肽造成多大扰动”这一实际问题。
在来自专利 US20240158446A1 的 2,761 条 KRAS 宏环肽数据上,SinCAA 进一步用于预测 Kd 和 IC50。该数据包含 10-12 个残基的单环与多环肽,能够较真实地反映先导肽优化中的局部结构变化。无论下游采用两层 MLP、单层 GIN 还是两层 GIN,SinCAA 在两项任务上的 Spearman 相关性相对最佳基线均提高超过 10%。对于测试集中含有训练阶段未出现 ncAA 的肽,SinCAA 仍明显优于各类小分子和肽预训练方法;其中,在两层 MLP 的 IC50 设置下,SinCAA 的 Spearman 相关系数为 0.492,而多数基线已经出现负相关。
研究还构建了仅在单个位置发生替换的肽组,模拟湿实验中的单残基扫描。在不训练任何任务预测器的零样本条件下,SinCAA 表征距离与 Kd 变化的平均 Spearman 相关系数达到 0.452,高于 Morgan 相似性的 0.421,并显著优于其他预训练表征。由此可见,SinCAA 学到的并不仅是用于回归任务的整体分子特征,也保留了局部 ncAA 替换与功能扰动之间的连续关系。

图 2. SinCAA 在 KRAS 宏环肽 Kd、IC50、未见 ncAA、低相似度测试集及单残基替换零样本分析中的表现。
SinCAA 同时支持选择性和细胞通透性建模
靶标选择性需要模型识别同源蛋白之间非常细微的结合差异。研究团队按照 NRAS 与 KRAS 亲和力倍数差异,将肽划分为高选择性、中等选择性和低选择性三类。结合两层 GIN 后,SinCAA 的加权 F1 和宏平均 F1 分别达到 0.708 和 0.657,均高于所有比较方法。UMAP 可视化进一步显示,SinCAA 表征能够较清晰地将最高选择性类别与其余类别分离,真实标签对应的轮廓系数达到 0.442,说明其在监督分类之前已经编码了与选择性相关的化学差异。
在 CycPeptMPDB 的 6,889 条环肽通透性数据上,SinCAA 配合两层 GIN 获得 Spearman 相关系数 0.888 和均方误差 0.251,不仅优于所有分子预训练基线,也略优于依赖人工特征和专用结构设计的既有细胞穿透肽模型(MSE 为 0.253)。部分 SinCAA 嵌入通道与实验通透性之间的相关性还超过分子量、LogP、tPSA、氢键供受体数量等常用描述符,两个代表性通道组合后相对于实验值的 Moran's I 达到 0.315,表明预训练表示中形成了可解释的通透性相关方向。
为了验证低数据条件下的可用性,研究进一步在两组 Arylomycin 非核糖体肽数据上评估六种大肠杆菌抑制实验。使用 Ridge 回归时,SinCAA 在六项实验中全部排名第一;使用 Bayesian Ridge 时,在六项实验中的五项排名第一。这一结果表明,即使下游样本只有数十个,ncAA 预训练仍能为同时受细菌穿透与靶标结合影响的复杂表型提供有效信息。

图 3. SinCAA 在 NRAS/KRAS 选择性预测、环肽细胞通透性预测及表征解释分析中的结果。
在新蛋白、新肽和双方均新的场景下保持结合位点预测优势
为检验 SinCAA 是否能够迁移到更一般的蛋白质-肽相互作用任务,研究团队从 PDB 构建了包含 12,131 个蛋白质-肽相互作用实例的数据集,并将 SinCAA 原子表征接入 PepNN,同时增加肽侧结合位点监督。评估采用按序列相似度聚类的数据划分,分别设置新蛋白、新肽以及蛋白质和肽同时未见三种情景,并逐步降低训练集与测试集之间的相似性。与将所有 ncAA 统一表示为占位符、且无法完整描述环肽拓扑的 CAMP 和 PepGPL 相比,SinCAA 在不同划分和相似度阈值下均取得更高的肽侧结合位点 AUPRC 和 MCC。
当评估范围进一步限定为含 ncAA 的肽时,SinCAA 的优势更加明显:随着训练与测试数据相似度下降,其 AUPRC 几乎没有明显衰减,并且在新蛋白、新肽和双方均新三种条件下持续优于基线。分层分析还显示,尽管肽链变长会因阳性结合位点比例降低而增加预测难度,SinCAA 在不同相似度阈值下仍较稳定;同时,模型性能并未随着 ncAA 占比升高而系统性下降。这说明模型不是通过记忆少数高频 ncAA 工作,而是能够处理不同长度、拓扑和化学组成的肽。

图 4. SinCAA 在新蛋白、新肽和双方均新划分下的蛋白质-肽结合位点预测,以及对肽长度和 ncAA 比例的稳健性分析。
从公共结构数据迁移到药物研发型 KRAS 宏环肽筛选
论文最后考察了更具挑战性的跨任务迁移:模型仅在公共 PDB 蛋白质-肽结构上学习空间接触位点,却直接用于排序来自药物专利的 KRAS 宏环肽亲和力。研究将 PepNN 的肽侧表示由残基级改为原子级,以保留 ncAA 的细粒度化学信息,并严格排除与测试肽高度相似的蛋白质-肽复合物。训练数据与评估数据不仅肽化学分布差异显著,训练目标也从结合位点分类转变为亲和力排序,因此这一实验同时包含化学空间偏移和任务偏移。
在 7YV1、8JJS、7YUZ 和 7ROV 四个 KRAS 结构上,SinCAA 预测分数与实验 -log(Kd) 的 Spearman 相关系数分别为 0.255、0.200、0.263 和 0.177,均高于采用 Hi-GMAE 小分子预训练表示的对应结果。对于 7YV1 和 7YUZ,排名前 10 的预测能够分别以 4.09 和 2.53 的富集因子识别高亲和力肽,说明模型可以在大规模候选库中优先推送更有希望的分子,从而降低实验筛选负担。

图 5. SinCAA 从公共数据向独立 KRAS 宏环肽数据迁移时的亲和力相关性、候选富集能力和蛋白质侧口袋定位结果。
总结
SinCAA 建立了一条从 ncAA 构件预训练到完整治疗肽建模的技术路径。其关键并非简单扩大分子预训练数据,而是围绕肽工程中的“残基替换”问题设计构象相似性,并通过“关系-身份”双重监督同时保留 ncAA 之间的可替换关系和单个 ncAA 的独特化学结构。由此获得的原子级表示能够自然描述线性肽、单环肽和多环肽,在亲和力、选择性、细胞通透性以及蛋白质-肽结合位点等不同任务之间迁移。
更重要的是,SinCAA 的优势在未见 ncAA、低序列或化学相似度、少样本和跨任务迁移场景中仍然存在,说明模型具有超越训练集记忆的泛化能力。它既可在缺少任务标签时通过表征距离和构象相似性辅助单残基替换排序,也可在获得少量实验数据后作为下游预测器的预训练编码器,提高候选肽筛选效率。当前工作主要采用既有实验数据进行回溯性验证,尚未开展由模型设计新肽并进行湿实验验证的前瞻性闭环;未来若进一步结合生成模型、蛋白质口袋定位和实验筛选,SinCAA 有望成为含 ncAA 治疗肽发现与优化流程中的通用表征模块。
参考资料
Xu, Chencheng, Lesong Wei, Jianmin Wang, Yuanpeng Xiong, Ruochi Zhang, Yu Wang, Chao Zha, Qiangcheng Zeng, and Xin Gao. "Similarity‐Enhanced Representation Learning of Non‐Canonical Amino Acids for Therapeutic Peptide Modeling." Advanced Science (2026): e77511.
https://doi.org/10.1002/advs.77511
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢