
浙江大学-阿里巴巴集团人工智能安全联合实验室专场
直播回顾
《追AI的人》&浙江大学-阿里巴巴集团人工智能安全联合实验室专场来咯
🌟往期分享:
周 之 遥
浙江大学计算机科学与技术学院四年级博士生,研究方向为图机器学习与图-语言模型,已在NeurIPS、KDD、WWW发表等顶会发表论文若干。
现实世界中的大量数据天然具有图结构——社交网络中用户之间的关注关系、学术圈内论文之间的引用网络、电商平台上商品之间的共购关系等。这些数据以节点为实体、以边为关系,支撑着节点分类、链路预测、图分类等一系列下游任务。
过去数年间,图神经网络(GNN)一直是处理图结构数据的主流范式。其核心机制是邻居信息聚合:每个节点的表示通过迭代地聚合其邻居特征来更新,从而学习节点级和图级的结构表示。然而,GNN 的致命短板在于对标注数据的高度依赖——训练一个引文网络领域分类器需要大量带标签的论文;一旦切换数据集或任务,模型往往需要从头训练。尽管后续研究提出了预训练、元学习等改进方案,GNN 在零样本泛化任务上的能力始终有限。

与此同时,大语言模型(LLM)在零样本推理方面展现出强大能力。GPT、Claude 等系统无需针对特定任务训练即可泛化回答各类问题。这一能力已从纯文本拓展至视觉-语言、音频-语言等多模态领域。由此引出一个自然的研究问题:能否将图(Graph)作为一种新模态纳入 LLM,借助其推理能力实现图结构数据的零样本泛化? 这便是图语言模型(Graph Language Model)研究方向的出发点。

然而,图与语言是两种本质不同的模态。语言是有序序列,词序携带重要语义;图则是置换不变的拓扑结构,节点顺序不影响图的整体含义。将两种模态强行嵌入同一模型,不可避免地会产生模态干扰(Modality Interference)。
当前图语言模型的主流方案是对齐-连接范式(Alignment-Connector Paradigm),沿用了多模态领域常见的模块化设计:图编码器(通常为 GNN)将图结构压缩为一组向量 Token;轻量级连接器(Projector)将这些 Token 映射到 LLM 的语义空间;LLM 解码器基于映射后的 Token 生成答案。
该设计的初衷是通过模块隔离来减少模态干扰,但代价同样显著:图编码器将丰富的拓扑结构压缩进一个狭窄的接口中,必然导致信息损失。LLM 无法直接感知原始图拓扑,仅能访问经编码器提取的摘要信息,其结构理解能力天然受限。
模块化架构在"融合"与"干扰"之间并未达成有效平衡——交互有限,干扰也未被真正解决。

近两年,"原生多模态"(Native Multimodality)概念兴起,部分工作已证明无需额外视觉/音频编码器,仅凭单体 Transformer 即可让 LLM 理解图像和音频。借鉴这一思路,我们在图领域探索了单体图语言模型(Monolithic Graph-Language Model):使用统一 Transformer 架构同步处理图与语言两种模态,实现端到端的深度融合,让 LLM 直接感知原始图拓扑结构。
单体架构虽挑战更大,但其深度融合的潜力使其更具前景。本文提出 MOBI——首个系统性解决模态干扰的单体图语言模型。

在提出解决方案之前,我们将模态干扰精确定义为三个层面。
优化层面:灾难性遗忘若。直接对 LLM 进行全参数微调以适应图任务,模型在学习图结构的过程中会将原有语言知识覆盖。实验表明,全参数微调会导致下游任务中不合法输出的概率激增——模型丧失了正常生成语言的能力。这是典型的灾难性遗忘(Catastrophic Forgetting)。
表示层面:无约束交互。在单体架构中,Graph Token 和 Text Token 从第一层开始即可互相注意(attend)。但在浅层注意力层中,两种模态的表示尚未成熟——过早交互会将噪声混入各模态,经深层传播后被进一步放大。实验证实了这一现象:不加约束时,Graph Token 从第一层起便将约 80% 的注意力投向文本 Token,而非聚焦于同模态内部的结构编码。这与期望的行为相悖——浅层应优先完成各模态内部的表示构建。
数据层面:文本捷径。在带有文本属性的图数据上,LLM 会自然地找到一条"捷径":直接根据节点文本描述猜出标签,无需理解图结构。例如,一篇标题为"Graph Neural Networks"的论文几乎可以单凭文本被归类到 AI 领域——无需参考其引用关系。模型一旦发现这条捷径便会依赖它。但当迁移到文本信息稀疏、结构信号更为关键的下游数据集时,模型完全失效——因为它从未真正学会结构理解。
这三层干扰分别对应了 MOBI 的三项核心技术设计。

MOBI处理图机器学习任务。以节点分类为例:给定一个引文图,目标是判断目标论文所属的研究领域。MOBI 将图的节点特征直接作为特殊 Token,与文本 Token 混合拼接后输入模型——无需外部图编码器,仅用一个 Transformer 同时处理文本和图两种模态。训练时在某数据集上进行指令微调,测试时迁移至未见过的数据集。

MOBI的核心思路是将图与语言视为两种不同模态,在 Transformer 的前 K 层中为它们分配独立的参数路径。Graph Token 拥有专属的 QKV 矩阵,文本 Token 使用另一套独立参数。前 K 层参数解耦,后续层共享参数进行深度融合。训练策略是仅更新图路径的参数,文本路径参数完全冻结。LLM 原有语言知识不受扰动——相关参数未被修改;图路径参数从零开始学习结构表示,充分发挥可塑性。
需要强调的是,虽然参数分开设置,但在自注意力层中 Graph Token 和文本 Token 仍然可以互相看到——这与模块化架构中二者完全隔离有本质区别。从一开始就保留了跨模态交互的通道。

为解决无约束的注意力交互,MOBI 在注意力计算中引入动态偏置项,作用于注意力得分之上,精准控制哪些注意力被鼓励、哪些被抑制。
具体采用线性衰减的偏置函数。在浅层,为同模态内部的注意力得分施加正向偏置,鼓励Graph Token先聚焦于Graph内部编码、Text Token先聚焦于文本语义;在深层,偏置逐渐衰减并转为负值,抑制同模态内部交互,转而鼓励跨模态注意力,促使两种模态深度合作,做出准确的下游任务预测。
这是一种课程式学习策略:先各自打好基础,再深度协同。与完全禁止浅层交互的硬掩码方案相比,该软掩码策略允许少量关键跨模态信息(如领域类型、任务类型等全局信号)在浅层通过注意力传递——这些信息可帮助Graph Token 更好地指导结构感知,同时防止文本噪声污染图结构表示。

针对文本捷径问题,MOBI 提出一种轻量级的三步扰动策略:首先定位捷径节点:使用预训练模型计算每个节点的文本特征与其标签 Embedding 之间的余弦相似度。相似度越高,说明该节点越容易被文本直接"猜中",即捷径嫌疑越大。
随后筛选 Top-P 节点:在所有节点中选择相似度最高的 Top-P 节点作为扰动目标。最后双重扰动,一方面进行文本移除,彻底删除该节点的文本特征,防止 LLM 直接利用文本获得正确预测;另一方面数值特征随机置零:对节点的数值特征随机将部分维度置零,弱化节点自身特征。
通过这种扰动,LLM在这些节点上无法依赖文本捷径,被迫关注周围邻居信息来获取答案。模型由此习得真正的图拓扑理解能力,确保在下游文本信息不充分的场景下依然保持良好表现。

我们在 11 个数据集上进行全面评测,涵盖引用网络(Cora、PubMed 等)、电商网络和社交网络等多个领域。核心测试协议为零样本跨数据集泛化:在一个数据集上训练,在完全未见过的数据集上测试。
主要观察如下:
传统 GNN 在零样本场景下几乎完全失效。GCN 在 Cora 上仅获 1.7% 的准确率,接近甚至低于随机猜测水平。
模块化方法虽有改进但极不稳定。LLaGA 及近期热门的 GoFA 等方案表现均不理想,印证了前文的判断:模块化方法难以赋予 LLM 可泛化的结构理解能力,因为 LLM 无法直接感知原始图结构。
MOBI 在多个指标上达到最优,展现出稳健且一致的优越性。更重要的是,无论是文本丰富的引文网络还是文本信息稀少的电商数据,MOBI 均保持领先——证明其真正获得了可迁移的结构理解能力,而非依赖数据集特有的偏差。

我们进一步在更具挑战性的跨域迁移场景测试:在WebKB上(网页链接图,文本特征丰富),纯 LLM(不做任何结构建模)即可达到 0.641 准确率;大多数模块化方法反而产生负迁移,表现不如纯 LLM。MOBI 在此取得最佳效果——在不破坏原有语言能力的同时有效引入了结构信息。在Instagram上(社交网络,文本信息稀疏),结构信号是关键,MOBI 同样展现出稳健性能。
更具挑战的是跨任务迁移:在节点分类任务上训练后,直接迁移至未见过的链路预测任务。该任务要求判断两个节点之间是否存在连边,考验模型对图拓扑连通性的深层理解。
大多数基线方法的准确率接近 0.5,与随机猜测无本质区别,说明并未学到真正有用的拓扑理解。MOBI 在此表现优越,证明其捕获的结构信息真实有效,且能迁移至完全不同类型的任务。

系统的消融实验得出以下结论:相比直接全量微调或仅微调 Projector,优越性显著;简单的线性衰减即可达到优异性能;更复杂的可学习 Gated 函数虽然表现接近,但会引入额外计算开销。因此默认采用线性衰减策略。

MOBI 是首个系统性解决模态干扰问题的单体图语言模型。我们首次从优化、表示、数据三个层面系统性定义了图语言建模中的模态干扰问题;我们提出双路径传送门防止灾难性遗忘,渐进交互调度约束注意力流并抑制浅层噪声,相关性引导的文本特征扰动阻断文本捷径。在跨数据集、跨域、跨任务的零样本场景下,MOBI 一致性地优于现有模块化方案,证明其习得了真正的、可迁移的结构理解能力。
未来工作将 MOBI 拓展至图级别任务、异构图与动态图任务,并进行更大规模的预训练。
📌往期推荐








AAIG课代表,获取最新动态就找她👇
关注公众号发现更多干货❤️


内容中包含的图片若涉及版权问题,请及时与我们联系删除




评论
沙发等你来抢