- 简介我们提出了S³T(时序自监督自蒸馏,Self-Supervised Self-Distillation over Time),据我们所知,这是首个完全自包含的连续视频状态跟踪框架。本方法将时间采样密度视为“特权信息”(privileged information),其理论依据在于:对同一视频片段采用更密集的时间采样,能够更准确地重建其动态运行状态。该密集采样视角作为“教师”,而具有相同参数权重的稀疏采样视角则作为“学生”,通过学习匹配教师模型的下一标记(next-token)分布来完成训练。整个模型自主生成训练目标,因此训练过程无需人工标注、无需额外的独立教师模型,也无需任何外部奖励信号,且在推理阶段不引入任何额外计算开销。在LLaVA-OneVision-2-8B模型上,仅使用S³T单模型即可将VSTAT基准的准确率提升+1.74;若进一步结合模型集成(souping),提升达+2.38;若再辅以视觉编码器的额外适配优化,则提升可达+2.70;相比之下,此前各类自演化(self-evolving)方法对状态跟踪能力的提升几乎可以忽略不计。此外,模型从无标注合成视频片段中习得的能力可有效迁移至真实视频场景,在VSTAT-YouTube状态跟踪问答任务上带来+7.95的性能提升,在MVBench动作计数(Action Count)任务上亦提升+4.50。
-
- 图表
- 解决问题连续视频状态跟踪(continuous video state tracking)缺乏高质量标注数据,现有方法依赖监督信号或外部教师模型,难以在无标签、无奖励、无额外推理开销的前提下实现模型自我演进。本文验证的核心假设是:同一视频片段中更高时间采样密度的视图能更准确地表征动态运行状态,该密度差异可作为‘特权信息’驱动自监督学习——这是一个此前未被系统建模的新问题。
- 关键思路提出S³T(Self-Supervised Self-Distillation over Time):将密集时序采样(teacher)与稀疏时序采样(student)构造成同一模型的双视图蒸馏任务,student通过匹配teacher的next-token分布进行自监督训练;全程无需外部标签、独立教师或强化信号,且推理时仅用稀疏视图,零额外成本。其新颖性在于首次将时间采样密度本身作为可利用的特权信息,并实现完全自包含(fully self-contained)的时序状态蒸馏。
- 其它亮点在LLaVA-OneVision-2-8B上实现VSTAT绝对精度提升+1.74(单模型)、+2.38(souping)、+2.70(+视觉编码器适配);跨域泛化显著:在真实视频基准VSTAT-YouTube和MVBench Action Count上分别提升+7.95和+4.50;实验基于合成视频clip预训练,零人工标注;未提及其是否开源代码;值得深入的方向包括:特权信息形式的泛化(如空间/分辨率密度)、S³T与世界模型的结合、以及对长时程状态漂移的鲁棒性建模。
- Prior self-evolving methods (e.g., 'Self-Rewarding Language Models', 'RLAIF-Vision'); LLaVA-OneVision and related vision-language foundation models for video; VSTAT and MVBench as emerging video state reasoning benchmarks; Contrastive or masked modeling approaches for video representation (e.g., 'VideoMAE', 'InternVideo'); Distillation-based continual learning (e.g., 'TinyCLIP', 'Distill-LLM') but none leveraging temporal sampling density as privileged signal.


提问交流