SemVID团队 投稿 
量子位 | 公众号 QbitAI

长视频理解,正在成为多模态大模型的重要能力。

用户开始不再只问“视频里有什么”,而是希望模型能进一步回答:这个事件从什么时候开始?到什么时候结束?这类任务被称为视频时序定位(Video Temporal Grounding, VTG)。

但视频越长,visual tokens越多,推理成本也越高。

一个直接思路是:剪掉一部分视觉token。

SemVID正是围绕这个问题展开。它的核心观点是:相比传统针对VideoQA的剪枝,VTG剪枝不是简单删掉“不重要画面”,而是要保住一条支撑时间定位的evidence chain。该工作已被ECCV 2026会议录用。

VideoQA剪枝和VTG剪枝,根本目标不同

以往很多token pruning方法主要服务于VideoQA。VideoQA的目标通常是回答“视频里有什么”“人物在做什么”“物体是什么颜色”。这类问题往往只需要少数关键帧展示相关画面就可能答对。

但VTG的目标完全不同。VTG要定位“什么时候开始、什么时候结束”。模型不仅要看到query相关对象,还要看到动作前后的状态变化。

比如查询是“一个人从柜子里拿出包”,模型不仅要看到“人”“柜子”“包”,还要看到动作发生前后的状态变化:手什么时候伸向柜子,包什么时候被拿出。

如果剪枝方法只保留几个最显著或最相关的画面,模型可能知道事件确实出现过,却无法判断准确边界。

换句话说,VideoQA剪枝回答的是:哪些画面够回答问题?VTG剪枝真正要回答的是:哪些证据能支撑时间定位?

这就是SemVID与既有方法的根本差异。

SemVID的核心动机:保住Evidence Chain

下图展示了SemVID的核心motivation,即VTG需要的不只是局部证据,而是一条跨帧连接的证据链。

在VTG中,事件往往不是由最显著的某几帧决定的,而是由一系列状态变化共同定义的。

事件边界附近的token负责告诉模型“变化从这里开始和结束”,而中间的relay token负责连接前后状态。

一旦这些中间节点被剪掉,证据链就会断裂。模型可能仍然看到若干高相关画面,却无法显式地将这些画面关联起来,组成连续推理路径。

结果就是:语义理解还在,时间定位变差。

因此,SemVID提出两个面向VTG的剪枝目标,意于组成支撑定位的证据链:

  • Evidence Retention:保留与query语义高度相关的token,尤其是事件边界附近的关键证据。
  • Connectivity Strength:保留跨帧连接,让证据能沿时间传播,而不是变成孤立碎片。

方法:从语义角度分离每个token在视频中的角色

围绕证据链,SemVID设计了一个training-free token pruning框架。它不需要重新训练backbone,只在推理阶段决定保留哪些视觉token。

整个方法分两步。

先决定每一帧保留多少token

如果平均分配预算,无关片段会浪费token;如果只根据query相关度,预算又可能集中到少数高相关帧,导致中间帧被剪空,时间链路断裂。

SemVID因此同时考虑query相关度和帧间变化两个信号。

相关帧包含目标事件,而变化帧往往靠近动作转折或事件边界,从而保证预算分配涵盖完整时间轴和证据链。

在每帧内部选择具体token

如下图所示,SemVID显式保留三类语义角色不同的token:Object、Motion和Context。

Object token保留与query相关的对象证据,负责回答“发生了什么”。

为了防止反复选中同一物体附近的patch,导致预算被相似的局部区域占满,SemVID使用MMR,让选出的object token既相关又互补,从而覆盖更完整的对象证据。

Motion token保留动作转折,负责回答“什么时候发生变化”。

SemVID根据相邻帧之间的局部特征变化选择motion token,并结合相关度过滤与query无关的背景运动。

它们不是普通运动区域,而是连接事件前后状态的relay node。

Context token保留场景锚点,负责回答“证据发生在什么环境中”。

极端剪枝下,如果只留下对象局部,视频会变成一组碎片化证据。少量context anchor可以维持场景连续性,帮助模型把对象和动作放回正确语境中。

实验:SemVID是否真的保住了证据链?

论文在Charades-STA和ActivityNet-Grounding上使用Qwen3-VL和Qwen2.5-VL进行评测。实验验证了SemVID是否在强压缩下仍能保持VTG所需的边界定位能力。

上图表明在相同token预算下,SemVID在mIoU、ER和CS上整体优于现有剪枝方法。

尤其在低保留率下,其他方法往往出现明显性能下降;而SemVID仍能稳定保持较高mIoU。这说明SemVID的优势不只是“压缩token”,而是把有限token留在了真正影响时间定位的位置。

其中,mIoU衡量最终定位精度,ER衡量关键证据是否被保留,CS衡量证据是否能跨帧连起来。

可以看到,SemVID的mIoU提升通常伴随ER和CS的提升,这与团队的核心动机一致:VTG剪枝不能只保留高相关画面,还必须保留一条可追踪的evidence chain。

消融实验进一步解释了SemVID为什么有效。

去掉Object Token后,mIoU和ER下降,说明query相关的对象证据是定位基础;去掉Motion Token后,mIoU和CS下降最明显,说明动作变化token是连接事件前后状态的关键relay;去掉Context Token后,CS也会下降,说明少量场景锚点能帮助维持时间连续性,避免证据碎片化。

可视化:SemVID能稳定保留动作相关证据

下图展示了不同剪枝方法的attention热力图。

相比VisionZip和FastVID,SemVID即使在12.5%的极低预算下,仍能稳定聚焦在动作发生前后的语义相关区域,例如人物手部、物体和动作交互位置。

总结

SemVID最重要的启发是,VTG剪枝不能只保留“看起来相关”的画面,而要保留能支撑边界定位的证据链。

通过object/motion/context三种语义角色,SemVID能在training-free条件下,把有限token更准确地分配给对象证据、动作转折和场景锚点,从而实现更稳定的长视频时序定位。

当然,SemVID也还有进一步改进空间。当前motion token主要依赖帧间特征变化来刻画运动,在镜头移动、背景剧烈变化或遮挡较多的场景中,仍可能受到干扰。

论文标题:Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
论文作者:Jiaqi Li, Shuntian Zheng, Yixian Shen, Jia-Hong Huang, Xiaoman Lu, Minzhe Ni, Yu Guan
作者单位:University of Warwick;University of Amsterdam;Amazon AGI
论文地址:https://arxiv.org/abs/2603.05663
代码地址:https://github.com/JiaqiLi404/SemVID

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —


【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目/主页链接,以及联系方式

🎓 我们会 (尽量) 及时回复你 :)


🌟 点亮星标 🌟

科技前沿进展每日见

内容中包含的图片若涉及版权问题,请及时与我们联系删除