
浙江大学-阿里巴巴集团人工智能安全联合实验室专场
直播回顾
《追AI的人》&浙江大学-阿里巴巴集团人工智能安全联合实验室专场来咯
🌟往期分享:
王 毅
浙江大学计算机科学与技术学院博士生在读,研究方向为多模态大模型加速、多模态统一生成理解。已在CVPR、AAAI等定义会议发表论文若干。

CVPR当前有一个明显的动向:研究者主要将视觉模态的研究重心放在视频、3D以及第一视角的VLM模型和视频生成模型上。这是此次CVPR参会过程中感受到的主要方向。因此在多模态领域,未来的发展趋势——包括报告人自身的研究方向——也将逐步向视频领域以及3D世界模型领域靠拢。
本次报告的核心内容为CVPR中稿论文"Recursive Token Reduction for Large Vision Language Models",中文题目为"面向多轮视觉问答的学习式Token压缩框架"。报告人长期专注于多模态领域,此前从事统一生成与理解方向的研究,目前与阿里安全团队合作完成本项多模态视觉加速的研究工作。报告将从四个角度展开:背景、动机、探究与方法,分别回答四个核心问题。

第一个问题:为什么视觉语言大模型需要Token压缩,以及什么是Token压缩?第二个问题:为什么多轮对话场景会使现有的Token压缩方法失效?第三个问题是本次研究的核心探究内容:为什么常用的启发式指标(如注意力分数)并非可靠的Token压缩依据?第四个问题是核心观点:如何让模型自主学习合适的压缩策略,而非持续依赖人工定义的规则?

首先回答第一个问题:为什么视觉语言大模型需要Token压缩方案?此处的Token压缩主要针对视觉部分。这源于一个现实问题——当前视觉语言大模型(VLM)的能力日益增强,为了捕捉图像中细腻的细节信息,模型会使用更高分辨率甚至多尺度的视觉输入。其优势显而易见:模型能够理解更精细的信息,如小物体、文本、背景建筑以及人物细节动作等。但代价同样直接——大量视觉Token的产生使得输入VLM的序列长度急剧增加,而Transformer本身的二次复杂度注意力机制使得计算量随Token数量增长而快速膨胀。
这带来了几个应用层面的问题。第一,生成延迟显著增加,导致用户体验下降。例如在多图输入场景及视频输入场景下,视觉Token的增长使得首个Token的生成延迟很高,用户在等待过程中容易产生不耐烦情绪,交互体验不够流畅。
第二,显存和算力需求显著提升。在手机、嵌入式设备等终端场景中难以部署,甚至在自动驾驶等车载设备上同样面临部署困难。第三,在多轮对话中,KV Cache会反复使用这些长序列的视觉信息。多轮对话的累积次数越多,累计成本也相应更高。

在明确了为什么需要Token压缩之后,有必要对Token压缩进行准确定义。Token压缩需要解决的核心问题是:在不明显损失视觉理解能力的前提下,将大量视觉Token压缩为更少的Token,同时保持模型能够正确回答问题,并降低计算和显存开销。需要注意的是,Token压缩并非简单地删减内容——真正的难点在于,在删减或合并Token之后,仍需使模型保留足够的信息,尤其是能够应对后续多轮问答过程中反复使用的关键信息。
根据Token压缩的实现形式,当前主流方案可分为两类。第一类是Token Pruning(剪枝),即直接丢弃不需要的Token。第二类是Token Merging(合并),即将相似的Token进行合并,以更为柔和的方式保留信息。
同时,主流方案还可按照依赖条件进一步分类:文本有关和文本无关。文本有关指的是在视觉Token压缩过程中引入文本信息的指导,即根据输入的Prompt对视觉Token进行筛选。文本无关则直接根据视觉Token本身的内容进行选择,不依赖具体的文本问题。

接下来分析第二个问题:为什么多轮场景下现有的Token压缩方案会失效?当前的Token压缩方案主要针对单轮视觉问答设计。单轮场景相对简单——用户提出一个问题,模型回答一次。例如图例中"山上的物体有什么"这一问题,模型主要关注山上的小房子、灯塔及建筑群等视觉区域。此时压缩较为简单,可以采用贪心策略,仅保留与当前问题相关的视觉信息。
然而在真实交互场景中,对话并非一问一答。用户第一轮可能追问前景主体(如灯塔),第二轮突然转向背景内容(如海上的小船),第三轮又可能询问图像的整体风格和构图。在现有Token压缩方案下,如果模型在第一轮压缩时仅保留灯塔区域的Token,后续轮次所需的信息就会丢失。因此,多轮场景的核心难点在于:压缩时不能仅服务于当前问题,而是要尽可能保留未来未知问题可能需要的通用视觉信息。这使得现有两类主流方案均面临一定限制。
就文本有关方法而言,以FastV为例,它会根据首轮问题筛选Token。这种方式容易将当下看似无关、但后续可能具有关键作用的信息提前丢弃,导致后续多轮问答出现错误甚至严重的幻觉。就文本无关方案而言,如ToMe等方法,不直接依赖具体的文本问题,从直觉上看更适合多轮对话场景。
但文本无关方案存在另一个弊端——很大程度上依赖人工设计的规则,如注意力分数。所谓注意力分数,是指某个视觉Token对图像的CLS Token(即ViT产生的图像表征Token)所产生的注意力权重。具有高注意力权重的Token会被认定为更重要,从而被优先保留。这一规则看似自然且易于理解,在诸多工作中也被广泛引用。但核心追问是:注意力分数高是否真的等价于最优的压缩指标?它对多轮视觉问答是否一定是最重要的?
这一问题正是重新思考Token压缩的起点。为此,本研究首先对Token压缩的最优依据进行了系统探索。为了开展这一探索,首先对现有的Token压缩方案进行了形式化的统一重构——将各类方案统一到同一个优化视角下,才能在此基础上探索什么是最优的压缩方案。从形式上看,无论是Token Pruning(直接删减部分Token)还是Token Merging(合并Token),本质上都可视作在学习一个压缩映射。

具体而言,目标是找到一个压缩映射矩阵P,将原来的N个Token压缩为M个更少的Token(M远小于N),从而使模型推理更为高效。同时需要达到的目标是:压缩前后模型对问题的问答响应分布尽可能接近。
在建立了统一的定义和视角之后,便可以开展探究实验分析。如训练框架图所示,为每一张图片单独设置一个可学习的压缩矩阵,通过训练该矩阵来获得最优的压缩策略。随后将学习到的压缩策略与基于注意力分数保留的Token分布进行对比分析。
实验结果颇具启发性。研究发现,学习到的最优压缩策略与基于注意力筛选的Token分布之间并不存在明显的相关性。即并未出现"高注意力Token被极大程度保留、低注意力Token被极大程度丢弃"的现象。最优保留策略实际上与原始注意力分布相对近似。即使部分高注意力Token被保留,其在全部Token中也仅占少数(约1.71%)。这一发现表明,注意力分数虽然是一个便捷的启发式信号,但并非Token压缩的最优指引。特别是在多轮对话场景下,模型真正需要保留的不是当前最显眼的区域,而是有助于维持全局语义以及应对未来可能问题的视觉信息。这直接引出了本研究的核心思路。
既然人工规则不可靠,就不应依赖手工设定的策略来判断Token的重要性,而应让模型从数据中自主学习合适的压缩策略。由此产生了本论文提出的方法——MetaCompress(通用压缩)。其设计目标明确:在不依赖文本Prompt、仅依赖输入图像本身的条件下,动态生成适合当前图像的最优Token压缩映射。之所以强调不依赖文本,是因为在多轮对话过程中后续问题不可预测。如果与某一轮问题产生强依赖关系,就容易提前丢失未来可能需要的信息。仅依赖图像本身时,目标就转变为尽量保存图像中的通用视觉信息。

当然,这里存在一个现实挑战。前述训练方式为每张图片设置可学习的压缩矩阵以获得最优策略,但对所有图像进行这样的显式训练开销庞大,且无法实现统一的训练方案。因此需要一种针对不同图片、不同分辨率以及不同压缩比例均能生成合适压缩映射的方案。压缩模块不能局限于固定维度的压缩矩阵,而需要能够自适应地适配Token数量。MetaCompress正是为了解决这一问题——面对不同图像、不同分辨率、不同压缩条件均能生成相匹配的压缩策略。
MetaCompress的放置位置在视觉编码器之后、语言模型(LLM)之前。视觉Encoder转化出的视觉Token进入MetaCompress模块(即P-meta模块),由其中的生成器接收这些Token,并根据图像的视觉特征生成压缩矩阵P。这里的压缩矩阵并非人为设定,而是由MetaCompress模块自主生成。
该模块利用生成的压缩矩阵P对Token进行压缩,再将压缩后的Token输入LLM。MetaCompress的整体训练流程与此前展示的训练流程基本一致,但需要强调三个关键点。
第一是多尺度适配。由于输入Token数量不同,需要对不同的压缩比例进行自适应下采样。DQ(Downsample Query)模块根据目标压缩比率进行分数间的下采样,再进行Query映射,使模型能够灵活匹配输入规模。值得注意的是,该方法不局限于整数比例的压缩,可以适应不同的分数比例。Key部分仍保留Token原始数量,再通过Attention过程(即相似性分析)自适应地选择所需的Token权重。
第二是自适应策略生成。MetaCompress使用轻量化的特征投影网络来学习Token的重要性。整个过程采用数据驱动方式,不需要人为定义"注意力高则重要"的规则。
第三是轻量化设计。在压缩领域,如果为了实现压缩而引入大量额外参数和训练代价,反而会拖累压缩所要追求的目标,得不偿失。因此MetaCompress在整体构建过程中仅采用少量线性层,额外训练开销很小。同时其推理代价与等距采样相近,能够在实际部署中产生真正的推理加速效果。

实验主要聚焦于多轮视觉问答基准,采用多轮GQA、多轮VQAv2以及CombinCh等数据集。基准覆盖的模型包括LLaVA-1.5、LLaVA-NeXT、InternLM-XComposer 2.5以及Qwen2-VL等7B和13B模型。对比方法包括:基础的Random(随机采样)和Sample(均匀采样);文本有关方法FastV;文本无关方法ToMe等。
评价指标主要包含两个方面:精度(多轮问答的平均准确率)和效率(Token的整体生成延迟、首Token生成延迟、端到端推理耗时和显存占用)。这样可以同时回答两个核心问题:压缩后准不准、压缩后快不快。由于时间关系,仅展示部分实验结果进行说明。
在高压缩率(如90%)条件下,随着压缩率提高,大多数方法均出现明显的性能下降——这是可以理解的,因为视觉Token被大量减少,模型能够获取的信息随之减少。但MetaCompress的下降曲线更为平缓,其保留的信息更为有效。特别是在70%和90%的极限压缩比例下,很多方法出现断崖式下降,MetaCompress仍保持了较好的精度。以LLaVA-NeXT 7B为例,在90%压缩率下,MetaCompress仍能保持57.5%的精度,明显高于PreMerge、FastV及其他基线方法。右侧的时间指标也辅助说明MetaCompress找到了更好的平衡——一方面大幅减少了视觉Token,降低了计算和显存成本;另一方面尽可能保留了更多的通用信息。

本论文的贡献可以总结为以下四点。第一,系统分析了多轮视觉问答下Token压缩的特殊挑战——其与单轮场景最大的不同在于不能仅围绕当前问题进行贪心压缩,而需要更多考虑未来问题所需的通用信息。
第二,从统一的优化视角分析了现有人为定义指标(如注意力分数)并非最优策略,解释了为什么诸多方法在多轮场景下表现不稳定。第三,提出了MetaCompress——一个可学习式的Token压缩框架,不依赖人工定义的先验,而是通过完全数据驱动的方式让模型自主学习压缩映射。第四,在整体实验中验证了压缩部署的实际效益——在较低的额外开销下达到了压缩率与精度之间的较好平衡,为视觉语言大模型在端侧及实时高吞吐场景下的部署提供了一种可行的技术路径。


📌往期推荐








AAIG课代表,获取最新动态就找她👇
关注公众号发现更多干货❤️


内容中包含的图片若涉及版权问题,请及时与我们联系删除




评论
沙发等你来抢