- 简介在视频模型中评估物理推理能力十分困难,因为绝对运动的测量结果依赖于帧率、物体尺度以及相机标定参数——而这些信息在生成的视频中往往模糊不清,甚至完全不可获取。为此,我们提出一种不同的评估思路:当同一场景中的两个物体遵循相同的物理规律时,它们的运动之间必然存在可预测的关系;而这类关系的成立并不依赖于任何相机或场景的标定信息。我们由此构建了评测基准“Principia”,它通过成对物体之间的关系一致性来评估模型对牛顿力学原理的掌握程度。“Principia”覆盖八大物理现象——重力、恢复系数(碰撞反弹)、摩擦力、转动惯量、抛体运动、动量守恒、单摆运动以及质量-弹簧振荡系统——并涵盖平动、转动、碰撞及振荡等各类动力学过程,所有测试视频均采用受控实验协议采集的真实世界场景。此外,我们还设计了一种无需标定的“一致性得分”,该指标直接在图像空间内量化物理规律被违背的程度。在对六种当前最先进的视频生成模型所产出的数千段视频进行测试后,没有任何一个模型在 Principia 上得分超过 0.42,尽管它们在 VBench 基准上的平均得分均接近 0.8。我们还进一步评估了多模态视觉-语言模型识别此类关系性物理错误的能力:表现最优的模型准确率仅为 67%,而大多数模型的表现则接近随机猜测水平。
-
- 图表
- 解决问题现有视频生成模型的物理合理性评估困难,因为绝对运动测量依赖于帧率、物体尺度和相机标定等易缺失或模糊的参数;论文试图验证:当前SOTA视频生成模型在遵循牛顿力学基本规律(如重力、碰撞、摆动等)方面存在系统性缺陷,且该缺陷无法被传统视频质量基准(如VBench)检测。这是一个新问题——首次提出不依赖标定的、基于关系一致性的物理推理评测范式。
- 关键思路摒弃对绝对物理量(如速度、加速度)的估计,转而构建成对物体在相同物理场景中的**相对运动约束**(如自由落体中两物体垂直位移比恒为1,弹性碰撞中动量守恒导出的速度关系),设计校准无关的图像空间一致性得分(Consistency Score)直接量化违反程度。这是首个将物理定律转化为图像像素域可验证关系约束的基准。
- 其它亮点• 构建Principia基准:覆盖8类经典牛顿力学现象,使用真实世界可控采集的高质量视频(非合成);• 提出校准无关一致性得分:在原始像素空间计算关系偏差,无需3D重建或标定;• 大规模评测:测试6个SOTA视频生成模型(如Sora、Pika、Runway Gen-3等),所有模型Principia得分≤0.42,远低于VBench≈0.8,揭示‘视觉逼真≠物理合理’的根本鸿沟;• 首次评估VLM对物理关系违规的判别能力,最佳模型仅67%准确率,多数近随机(50%);• 代码、数据集、协议已开源(principia-benchmark.github.io)。值得深入:如何将关系物理约束嵌入视频生成训练目标?能否构建轻量级物理验证模块作为生成后处理?
- • 'Physion: Evaluating Physical Prediction from Vision' (ICLR 2022) —— 基于合成3D场景的物理预测评测,依赖完美标定与仿真;• 'VideoLLM: Towards Multimodal Large Language Models for Video Understanding' (NeurIPS 2023) —— 侧重视频语言理解,未建模物体间动力学关系;• 'Object-Centric Physics Reasoning in Videos' (CVPR 2023) —— 关注单对象轨迹预测,未设计跨对象守恒律验证;• 'VBench: A Comprehensive Benchmark for Video Generation' (arXiv 2023) —— 当前主流视频质量基准,但完全忽略物理一致性。


提问交流