
点击蓝字 关注我们
Let's go!

前言
2026年5月21日,美国匹兹堡大学医学院atice Ulku Osmanbeyoglu团队在Nature Communications上发表了一篇题为《DGAT: a dual-graph attention network for inferring spatial protein landscapes from transcriptomics》的论文。这篇文章提出一种基于深度学习的框架DGAT(Dual-Graph Attention Network,双图注意力网络),可利用空间转录组与空间蛋白组配对数据学习 RNA–蛋白关系,从而根据 ST 数据推断空间蛋白表达。在多个公开数据集及自建数据集上的基准测试表明,DGAT 在蛋白表达推断准确性方面优于现有方法。进一步地,将该框架应用于缺乏蛋白测量的空间转录组数据时,能够揭示仅依赖转录组难以发现的空间异质性细胞状态、免疫表型以及组织结构特征。

01
背景
空间转录组学(ST)技术能够在组织背景下提供全基因组范围的转录组图谱,但缺乏对蛋白质水平的直接测量,而这对于解读细胞功能及微环境组织状态至关重要。
为弥合这一差距,我们开发了DGAT(双图注意力网络)这一深度学习框架,它能够通过从空间转录组和蛋白质组数据中学习RNA-蛋白质关系,来从转录组数据中推断出空间层面的蛋白质表达情况。该模型构建了融合转录组、蛋白质组及空间信息的异质性图谱,并通过图注意力网络进行编码。针对特定任务的解码器会从共享的隐式表示中重构mRNA并预测蛋白质丰度。
通过对比使用公共和内部数据集进行的基准测试,表明DGAT在蛋白质补全准确性方面优于现有方法。应用于缺乏蛋白质测量值的ST数据集时,该框架揭示了空间上各不相同的细胞状态、免疫表型和组织结构,而这些信息仅凭转录组学分析是难以显现的。在此研究中,我们展示了该框架能够准确重构空间蛋白质景观,揭示具有生物学意义的组织结构,并能够从仅基于转录组学的空间数据中实现蛋白质层面的解读。
02
方法
文章提出的 DGAT,该框架旨在从包含有配对mRNA和蛋白质测量的空间CITE-seq参考数据集中进行学习。经过训练后,DGAT便可从仅包含转录本的空间转录组学(ST)数据集预测蛋白质表达情况。
DGAT作为输入接收带有空间坐标的一对基因和蛋白质表达矩阵(见图1)。它针对每个样本构建两种类型的图:一种是基于物理邻近关系的空间图,另一种是基于转录组和蛋白质组特征的相似性图。每张图均通过一个独立的图注意力网络(GAT)进行处理,该网络包含特征注意力层和残差连接,以生成具备空间感知能力的嵌入表示。
DGAT包含针对特定模式的编码器:mRNA编码器将基因表达与空间背景相结合,而蛋白质编码器模型则刻画了空间共表达模式。来自这两个编码器的嵌入信息以两种方式被解码:(i)多层感知器(MLP)重构基因表达;(ii)多分支蛋白质解码器预测蛋白质水平,每个分支专门用于分析一种特定的蛋白质。为了在维持基因与蛋白质模式特征表征的同时平衡两者间的对齐关系,我们在训练过程中应用了三种类型的损失函数,并辅以跨模态监督机制。
首先,一种潜在的对齐损失有助于促进转录物与蛋白质嵌入之间的融合。其次,交叉预测损失使得每个编码器能够引导与之相对的解码器。最后,两种模态上的重构损失进一步约束了学习过程。经过训练后,可通过将ST数据的mRNA特征图谱传递至预先训练的mRNA编码器和蛋白质解码器,来执行空间蛋白质推断。

图1. DGAT 工作流程。

03
结果
该研究系统评估了DGAT模型在空间CITE-seq数据中从转录组预测蛋白质表达的性能(见图2)。研究使用了6个空间CITE-seq样本(包括2个自建间皮瘤样本和4个公共数据集:扁桃体、雌激素受体阳性乳腺癌和胶质母细胞瘤),每个样本均包含空间分辨转录组和约30种匹配的蛋白质表达数据。评估采用留一样本法和跨组织留一法两种策略,以对应基因的归一化RNA表达值为基线,通过Spearman相关系数和均方根误差衡量预测精度。结果显示,DGAT在所有组织中均显著优于RNA基线,例如在扁桃体样本中,中位Spearman相关系数从0.308提升至0.610,均方根误差从1.61降至0.226;且在CCR7、CD14、CD19、CD68等临床相关免疫标志物上均有明显改善。在与Seurat v4、sciPENN、cTP-net等七种不考虑空间结构的单细胞蛋白推断方法的对比中,DGAT的中位相关系数和综合平均排名得分均为最高,证明了融入空间邻域信息对提升预测精度的关键作用。跨组织评估进一步证实DGAT能够泛化至训练中未见过的组织类型,且对免疫、上皮、内皮和基质等不同细胞类型的标志蛋白均表现出稳定的预测优势。该研究充分表明,DGAT通过利用空间上下文信息,能够在空间转录组数据中实现准确、稳健且具有生物学意义的蛋白质表达推断。

图2. DGAT在保留空间CITE-seq样本中的蛋白质预测性能。
我们通过系统性数据库检索,在公开可用的空间CITE-seq数据集中进行了跨队列基准测试。这些独立的验证样本涵盖多种组织和疾病背景,且均经过独立处理,严格排除在模型训练和超参数调优之外。独立样本在转录组覆盖深度上存在显著差异:训练集每个spot的中位基因检测数约为4,000至8,000个,而多个独立验证集则显示出明显较低的基因检出率(低于2,000个,部分甚至不足1,000个),这种宽广的动态范围为评估模型在不同数据稀疏程度下的表现提供了极具挑战性的测试环境。
对于每个独立数据集,我们直接应用预训练的DGAT模型从转录组数据预测空间蛋白丰度,并将预测值与实测蛋白值进行比较,通过蛋白水平和spot水平的Spearman相关系数量化性能。结果表明(见图3),在中高覆盖度数据集(如ALD_Liver_1/2、N-ALD_Liver_2和扁桃体)中,DGAT的中位相关系数均高于其他对比方法;而在极低覆盖度样本中,所有方法的性能均有所下降,这反映了转录本检测深度不足所带来的固有局限。为综合评估各方法在多个队列中的表现,我们计算了每种方法在蛋白水平上的平均排名得分,DGAT在独立数据集上获得了最高的平均排名得分,表明其在当前可用空间多组学数据所涵盖的组织类型、疾病状态和转录组覆盖度变化范围内,均保持了稳定的相对性能优势。这些分析为DGAT的跨队列鲁棒性提供了超越原始留一样本评估之外的额外证据。

图3. DGAT在独立验证样本和转录组覆盖范围下的性能。
为了展示DGAT在缺乏蛋白质测量的空间转录组数据集中的应用价值,我们将预训练模型应用于公开的人淋巴结和三阴性乳腺癌Visium数据,预测31种蛋白质的表达(见图4)。在淋巴结数据中,基于DGAT推断蛋白表达的聚类成功识别出生发中心区域,准确率达0.967,F1分数达0.828,显著优于基于转录组的聚类(F1=0.749);在与cTP-net、scLinear、sciPENN、Seurat等七种非空间蛋白推断方法的比较中,DGAT同样取得最高F1分数(0.828)。进一步分析表明,DGAT推断的蛋白在生发中心的富集模式与两个扁桃体样本中观察到的蛋白-生发中心关联高度一致,且经典生发中心标志物(PAX5、CD19、CD20、CXCR5、CR2、CD40、PDCD1、PCNA)的富集信号比mRNA水平更具统计显著性,证明DGAT能够恢复转录水平掩盖的生物学空间模式。在三阴性乳腺癌数据中,基于DGAT推断蛋白的聚类相较于纯转录组聚类获得更高的调整兰德指数(0.504 vs 0.452),并正确将免疫标志物定位至淋巴细胞富集区、将增殖和上皮标志物定位至导管原位癌区域。通过计算空间自相关Moran's I,DGAT显著提升了各蛋白的空间结构化程度(免疫标志物Moran's I达0.75-0.86),揭示了转录水平模糊的空间结构。双变量Moran's I分析进一步恢复了生物学上合理的蛋白-蛋白互作邻域,包括CD274-CD68共定位(I=0.79)、CD14-FCGR3A单核-巨噬细胞偶联(I=0.78)、HLA-DRA-ITGAX抗原呈递树突状细胞结构(I=0.77)以及CCR7-CD4淋巴细胞归巢区(I=0.76)。基于高置信度边构建的空间蛋白关联网络呈现出清晰的模块化组织结构,包括巨噬细胞模块、抗原呈递模块、T细胞募集模块和上皮模块。此外,DGAT在雌激素受体阳性浸润性导管癌中也取得最优聚类性能,并恢复出与该亚型低免疫浸润特征一致的紧凑型空间蛋白组织模式。这些分析共同表明,DGAT不仅能提升聚类精度和单一标志物定位能力,更能从仅含转录组数据的空间转录组中重建功能性、高阶的微环境空间蛋白结构,从而实现更丰富的生物学机制解读。

图4. DGAT推断空间蛋白表达并识别人类淋巴结组织中与生发中心相关的蛋白质。
为检验DGAT在分布外数据上的泛化能力,我们将预训练模型应用于人类黑色素瘤(见图5)和前列腺癌的空间转录组数据集(见图5)——这两种组织类型均未出现在训练集中。在黑色素瘤数据中,DGAT推断的蛋白表达展现出清晰的空间特异性:肿瘤区域富集KRT5、PCNA、EPCAM、SDC1等上皮和增殖标志物;间质区域高表达ACTA2、PECAM1、CEACAM8、VIM等纤维血管和间充质标志物;淋巴组织区域则呈现CXCR5、MS4A1、PAX5、HLA-DRA、CD8、CD3、PTPRC等免疫和B/T细胞标志物的升高表达。在更高层次上,DGAT预测的蛋白共表达模式揭示了黑色素瘤中的模块化免疫结构,B细胞和T细胞标志物形成紧密连接的网络,与上皮和增殖程序在空间上分离,这种组织特征与免疫活跃型黑色素瘤中三级淋巴结构样免疫微环境相一致。在前列腺癌数据中,DGAT同样有效泛化,恢复了对应于上皮、间质和免疫富集区域的差异化空间蛋白表达模式,并以0.683的调整兰德指数显著优于所有基线方法(mRNA-only模型为0.638,其他方法介于0.243至0.535之间)。在前列腺癌组织中,肿瘤区域特异性富集CD63、CD9及上皮标志物EPCAM和VIM,间质区域富集免疫相关蛋白CD14和CD68,部分萎缩区域则呈现反映过渡性微环境的混合表达谱。与黑色素瘤不同的是,DGAT预测的前列腺癌蛋白网络更为密集且高度互联,上皮、髓系和免疫检查点相关标志物之间存在强耦合,这与前列腺癌更具免疫抑制性和异质性的肿瘤微环境特征相符。在两个数据集中,尽管存在训练组织的领域偏移,DGAT预测的蛋白景观仍紧密映射已知的组织学边界。这些结果表明,DGAT捕捉到了广泛保守的RNA-蛋白关系,这些关系在不同组织背景下依然具有信息价值。更重要的是,DGAT在缺乏配对蛋白质组数据的情况下恢复具有生物学意义的蛋白谱的能力,凸显了其作为回顾性空间转录组分析、跨组织蛋白图谱绘制以及低表征疾病场景中假设生成的强大工具的潜力。综合而言,这些结果证明DGAT不仅能空间泛化至未见过的组织类型,还能保留下疾病特异性的蛋白组织和微环境结构。

图5. DGAT准确推断出在以前未见过的组织中的空间蛋白表达类型。
为评估DGAT在训练组织类型之外的泛化能力,我们将预训练模型应用于五个独立的自建空间转录组数据集(见图6),包括三个肾脏样本(两个慢性肾病样本和一个正常肾脏样本)和两个慢性肺病肺脏样本,这些数据集代表训练中未涉及的器官系统和疾病背景。我们将空间转录组切片预测的蛋白存在分布与相邻切片的免疫荧光染色结果进行比较,选取了分别代表平滑肌、内皮和间质 compartments 的三种标志蛋白——ACTA2(αSMA)、PECAM1(CD31)和VIM。结果显示,DGAT推断的蛋白存在模式在所有样本中均与免疫荧光空间模式高度吻合,准确捕捉了血管网络、平滑肌区域和间质结构域等关键组织特征。定量分析进一步证实了DGAT预测的准确性:预测蛋白阳性区域与免疫荧光检测蛋白阳性区域的比值在所有标志物和器官中均与1无显著差异(单样本t检验,p>0.05),表明DGAT对蛋白存在与否的估计既不存在系统性高估也不存在系统性低估。这些发现共同证明,DGAT能够在独立于训练的器官系统和疾病背景下实现稳健、生物学一致的蛋白预测,突显了其超越训练数据集的强大泛化能力。

图6. DGAT预测蛋白表达在独立组且织类型和疾病背景下的免疫荧光验证。
04
讨论
研究表明,DGAT不仅能恢复具有生物学意义的蛋白分布,还能增强空间聚类和空间域识别等关键下游分析,并在罕见癌症恶性胸膜间皮瘤中展示了其拓展空间蛋白质组学分析的价值。DGAT的核心优势在于其跨多种验证设置的性能稳定性:通过训练队列内的留一样本交叉验证和对14个独立空间CITE-seq样本的评估,DGAT在组织类型、疾病状态和转录本检测深度(包括每spot低于1,000个基因的数据集)的显著变化下保持了稳定的相对性能优势。进一步的独立验证显示,DGAT预测的蛋白分布与慢性肾病、正常肾和慢性肺病样本的免疫荧光信号具有高度的空间一致性。
然而,该方法也存在若干局限性:其蛋白解码器针对固定蛋白面板设计,更换蛋白靶标时需要重新训练;操作分辨率受限于可能包含混合细胞类型的空间转录组spot;依赖于有限的配对空间转录组-蛋白质组参考数据集;当前仅能预测约30种共享蛋白。未来发展方向包括扩展训练数据多样性、整合组织病理学图像以纳入形态学上下文,以及支持配体-受体互作图谱、细胞间通讯推断和空间轨迹重建等更广泛的空间分析。
总之,DGAT提供了一种可扩展且数据高效的计算解决方案,能够在无法进行蛋白质测量的情况下从转录组数据中获取空间蛋白质组学见解,在基础研究和转化研究中具有重要的应用价值。
原文链接:
https://doi.org/10.1038/s41467-026-73114-z



相关历史文章:
Nature Communications | Hatice Ulku Osmanbeyoglu团队开发基于空间转录数据
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢