- 简介在“下一个词预测”这一目标的驱动下,自然语言处理(NLP)领域已从面向特定任务的模型范式,转向具备强大泛化能力的通用基础模型。那么,计算机视觉领域要实现通用型视觉模型,其对应的同等关键驱动力又是什么?本文提出,大规模文本到视频生成(text-to-video generation)可作为计算机视觉领域一种极具潜力的预训练范式,它能为通用视觉智能提供所必需的时空先验知识、视觉与语言的跨模态对齐能力,以及良好的可扩展性。为此,我们提出了GenCeption模型:该模型以一个预训练的视频生成扩散模型(video generative diffusion backbone)为基础,将其重构为一种前馈式感知模型(feed-forward perception model),能够根据文本指令灵活执行多种视觉任务。实验结果表明,GenCeption在一系列多样化任务上均达到当前最优性能,涵盖深度估计、表面法向量估计、相机位姿估计、表情指向性分割(expression-referring segmentation)以及3D关键点预测等任务;其表现常常媲美甚至超越各类专用模型(例如DepthAnything3、SAM3、D4RT、VGGT-Omega、Sapiens、David、Genmo及Lotus-2)。此外,在同等实验设置下,该基于视频生成的预训练主干网络,亦显著优于其他主流预训练范式(如V-JEPA和Video MAE)。尤为关键的是,GenCeption初步展现出良好的数据规模与模型规模扩展特性,并具备极高的数据利用效率——仅需使用领先模型(如D4RT和VGGT-Omega)七分之一至五百分之一的训练数据量,即可达到与其相当的性能水平。最后,GenCeption还展现出若干引人注目的涌现行为:一个仅在合成人类视频数据上训练的模型,竟能成功泛化至真实世界视频,并有效识别分布外(out-of-distribution)的物体类别(例如动物与机器人)。上述发现表明,视频生成绝非仅限于内容合成的工具,而是一条通向面向物理世界的通用视觉智能的奠基性路径。项目主页:https://genception.github.io
-
- 图表
- 解决问题如何构建通用视觉基础模型(general-purpose vision foundation model),而非依赖任务特定架构或监督信号;论文验证‘大规模文本到视频生成预训练’能否 serve as the equivalent catalyst for vision that next-token prediction was for NLP — 即是否能通过生成式视频建模自然习得时空表征、跨模态对齐与泛化能力,从而支撑零样本/少样本多任务感知。
- 关键思路提出‘生成即理解’(generation-as-perception)范式:将预训练好的文本到视频扩散模型(video generative diffusion backbone)逆向重构为一个可提示的、纯前馈的感知模型(GenCeption),无需微调即可通过文本指令驱动执行多样化视觉任务(如depth estimation, expression-referring segmentation等);核心创新在于将生成式视频预训练视为统一的视觉表征学习引擎,隐式编码物理世界动态先验(spatiotemporal priors)与语言-视觉联合语义结构。
- 其它亮点在depth、surface normal、camera pose、expression-referring segmentation、3D keypoint等10+异构任务上达到SOTA,多数任务匹敌或超越专用模型(如SAM3、DepthAnything3、D4RT);视频生成预训练显著优于对比方法(V-JEPA、Video MAE);仅用1/7–1/500数据量即达D4RT/VGGT-Omega性能;展现强泛化性:纯合成人类视频训练模型可零样本迁移到真实动物/机器人视频;已开源项目页(https://genception.github.io),含模型卡、推理示例与评估协议;值得深入:生成-感知映射的可解释性、物理一致性约束注入、长时序因果推理扩展。
- VideoMAE: Masked Autoencoders are Scalable Vision Learners for Video (ICLR 2023); V-JEPA: Self-Supervised Learning of Visual Features Through Embedding Predictive Abstraction (NeurIPS 2023); Make-A-Video: Text-to-Video Generation without Text-Video Data (ICML 2023); Sora: Creating Video with Diffusion Models (OpenAI Tech Report 2024); UniAD: Unified Autonomous Driving Foundation Model (CVPR 2024); Video-LLaMA: Towards Multimodal Instruction Tuning for Video-Language Understanding (ACL 2024)


提问交流