QC-MHM团队 投稿
量子位 | 公众号 QbitAI
向ChatGPT问一个看起来挺简单的问题:“Lasha Talakhadze之前的奥运举重纪录是多少?”
结果让人哭笑不得——模型能认出这个人是谁,也说得出来他拿过金牌,但给出来的答案却是他现在的纪录,而不是“之前”的。同理,“第25届奥运会期间布达佩斯的市长是谁?”这种带时间窗口约束的问题,Google和ChatGPT都翻了车。
这不是某个模型的bug,而是所有基于知识图谱的问答系统共有的结构性问题:它们看得见实体,看不见时间。
北航、复旦、浙大联合团队在AAAI上提出的QC-MHM(Question Calibration and Multi-Hop Modeling),用一个三件套方案——问题校准+时序嵌入+多跳图推理——让模型真正拥有了“时间感”。

作者单位:北京航空航天大学·复旦大学·浙江大学
发表:AAAI(CCF-A类顶会,Pages 19332–19340)
背景
场景与痛点
时序知识图谱问答(Temporal KGQA)的任务是:给定一个带时间约束的自然语言问题,从知识图谱中找到落在正确时间窗口内的答案。
听起来只是在普通KGQA上加了个时间字段?实际上差距巨大:

举个例子:(布达佩斯,市长,某人,1992)和(布达佩斯,市长,另一人,2024)在KG里是两条不同的事实。传统模型很容易把两条混在一起,问“92年谁当市长”时给出2024年的答案。
现有方法的两大硬伤
学界已经有了CronKGQA、TMA、TSQA等一系列时序KGQA模型,但这篇AAAI论文犀利地指出,它们都没绕过两个坎:
硬伤一:PLM对时间“视而不见”。Bert等预训练语言模型编码问题时,注意力天然落在实体名词上(人名、地名),对“之前/之后/期间”这类时间词汇缺乏敏感性。结果就是——模型相当于读了一道“不带时间约束”的问题。
硬伤二:图结构信息被浪费。即使用了知识图谱,多数方法也只把它当作答案查询的索引,没有真正利用其中蕴含的多跳关系结构。遇到需要“两步以上跳转”的问题就掉链子,而且推理过程完全黑箱。
论文做了什么
QC-MHM用一个端到端框架把三个模块串起来:
时序感知嵌入:让KG中的时间戳知道“谁在前、谁在后” 问题校准:让问题向量主动去KG中“找时间线索”,再回来更新自己的表示 多跳GNN推理:单层GNN一次性访问任意跳邻居,同时输出可解释的推理路径

技术方案
模块一:让时间戳“懂顺序”的KG嵌入
KG里每条事实是(主体,关系,客体,时间)四元组。QC-MHM选择TComplEx做基础嵌入,评分函数为:

但仅靠TComplEx,时间戳之间还是“散装”的——模型不知道1992在2024之前。为此作者借鉴Transformer的sinusoidal编码,为每个时间戳叠加位置编码:

进而构造辅助任务——让模型判断“时间m是否早于时间n”:


总训练损失:
。这个辅助任务就像给模型做“时间排序”的专项训练——嵌入空间里,1992的向量自然排在2024前面。
模块二:问题校准——让问题主动“找时间”
这是QC-MHM最具想象力的设计。常规做法是:问题→PLM编码→直接查询答案。QC-MHM在中间加了一步:让问题先去KG中检索与时序相关的SPO(主体-关系-客体三元组),再回来修正自己的表示。
第一步:候选SPO召回。把问题和KG中的所有SPO分别过SentenceBERT,用余弦相似度排名,保留Top-10:

第二步:三注意力多视角匹配。用三种注意力机制同时比较“问题词×SPO候选”:

三种视角各看各的:Concat看“这两个向量放一块合理吗”,Dot看“关键维度上对齐了吗”,Minus看“哪里不一样”。
第三步:门控自适应融合。让模型自己决定“原始问题语义”和“从KG检索到的时序信息”各占多大权重:

经过校准后的问题向量
,从此具备了“时间感”。相当于原本的问题是“XXX是谁?”,校准后变成了“XXX在1992年是谁?”。
模块三:多跳GNN推理——一层看穿整条路径
传统GNN的问题是:一层只能看1跳邻居,要想看2跳需要堆2层,看3跳得堆3层,效率和可解释性都不好。
QC-MHM的做法是:先把子图裁剪出来,再一次性做多跳注意力聚合。
子图裁剪:以问题中的实体为起点,抽取k跳范围内的子图,把搜索空间收窄。
路径打分(注意力矩阵):

一次性多跳聚合:

核心公式在D:通过加权和把1跳、2跳、…、ℓ跳的注意力矩阵一次性合并,让单层GNN就能访问任意跳邻居。经验设置
已能取得理想效果。
最终图向量:
注意力权重本身也可以直接可视化,展示模型的“思考轨迹”——哪条边被高权重激活,推理路径一目了然。
模块四:双通道答案预测
把语义向量
(问题校准后的表示)和图向量
(GNN聚合后的表示)拼接,过一层Transformer融合:

然后分别投影到实体空间和时间戳空间,用TComplEx评分做双通道预测:

两个通道的分数拼接后softmax,交叉熵优化。这意味着——同一个模型可以同时回答“是谁”和“什么时候”两类问题。
实验结果
CronQuestions:逼近性能天花板

复杂多跳问题Hits@1绝对提升5.1%,Hits@10提升1.2% 实体型答案与时间型答案两条赛道都打赢 整体Hits@1达0.971——再往上提升已经非常困难
TimeQuestions:跨数据集泛化验证

迁移到第二个基准同样SOTA,说明方法具有可迁移性,不是针对某个数据集的特化方案。
细粒度问题类型拆解

Before-After这种典型时间排序题,QC-MHM的优势被放大得最明显——这正是“问题校准”模块的主场:只有显式建模了时间约束,模型才知道“之前”意味着什么。
消融实验:三件套缺一不可


三个模块互相成就,不是简单的“拼盘”,去掉任何一个都会导致特定类型问题大幅退化。
可视化:“白盒”推理路径

可以清晰地看到模型如何在图中逐跳推进,哪些边被高权重激活——这是过往黑箱模型不具备的能力。

图中高亮的92%、95%等数值,正是问题对最相关时序SPO高度关注的证据,表明门控机制确实抓住了“哪些SPO该被重视”。

梯度分析印证了问题校准模块确实把关键时序事实反映到了问题向量中。
项目价值
学术贡献
首创“问题校准”机制:多视角注意力+门控融合,让PLM编码的问题向量主动从KG中提取时序知识,根治“时间盲区” 单层多跳聚合:用加权组合的方式让单层GNN访问任意跳邻居,同时输出可解释推理路径 顺序感知的嵌入辅助任务:以“判断时间先后”作为额外监督信号,让嵌入空间隐式编码时间序
落地场景
搜索引擎:精准应答带时间限定词的复杂查询(“之前”“期间”“最早”) 金融合规:跨时间维度查询股权变更、监管事件、诉讼时序 医疗药学:追踪疾病演进、用药史、临床试验时间线 档案管理:跨年代事件因果与关联推理 企业BI:基于时间链路的趋势与因果分析
在LLM普遍强调“事实可追溯”的当下,QC-MHM所代表的“PLM×时序KG×多跳GNN”思路,是构建可信时序推理系统的关键拼图。
论文(arXiv):https://arxiv.org/abs/2402.13188
代码(GitHub):https://github.com/zhouyan0614-sys/QC-MHM-TKGQA
会议:AAAI(CCF-A),Pages 19332–19340
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢