Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States

2026年09月03日
  • 简介
    我们提出了“Puffin-World”——一种统一的多模态架构,无需依赖任何外部离线模块,即可融合物理理解、空间仿真以及三维世界生成与重建能力。为可靠地构建并交互式操作三维世界,本框架联合建模三种原生世界状态:物理状态(重力场与纬度)、几何状态(深度)和外观状态(图像),并引入一种统一的“全向相机”(Omni-Camera)表征,以支持多样化的任务需求与灵活的相机运动。除对上述状态进行建模外,我们还提出了一种跨未来帧传播物理动力学的策略:通过将相机的绝对物理属性(如位置、朝向、焦距等)锚定于真实世界坐标系中,Puffin-World 实现了物理上自洽且视觉上稳定的三维世界生成。进一步地,我们在单一生成过程中耦合外观与几何信息,同步合成每一帧未来视角图像,并同步反演其底层三维几何结构。这一统一范式支持需多任务协同的交织式闭环应用,例如动作模仿(mimic)与自校准的世界探索(self-calibrated world exploration)。为将 Puffin-World 扩展至更复杂的实际场景,我们构建了大规模数据集 Puffin-16M,包含 1500 万组视觉–语言–相机三元组样本,以及 100 万条涵盖多样化、高挑战性运动模式的轨迹数据。为推动该方向的后续研究,我们已开源全部代码、预训练模型及数据集。
  • 作者讲解
  • 图表
  • 解决问题
    如何构建一个统一的、无需外部离线模块的多模态3D世界建模框架,以实现物理一致、几何准确、外观逼真且支持闭环交互的实时世界生成与重建——该问题直指当前具身智能与生成式世界模型中物理 grounding 缺失、模态割裂、相机建模抽象化(如纯内参/相对运动)导致的长期不稳定性等根本性挑战,属于新兴的‘物理感知生成式世界模型’方向的核心问题。
  • 关键思路
    提出Puffin-World统一架构:首次将物理状态(重力场+纬度)、几何状态(深度)和外观状态(图像)作为原生、联合建模的世界变量,并引入‘Omni-Camera’表示——将绝对相机位姿(含地理坐标、朝向、海拔)直接嵌入模型,使生成过程天然受真实物理约束;创新性地在生成过程中显式传播物理动力学(如自由落体、惯性运动)至未来帧,而非后处理或独立仿真。相比主流方法(如NeRF变体、扩散视频模型、或分离的SLAM+物理引擎),其核心新意在于‘物理即先验、相机即传感器、生成即重建’的一体化范式。
  • 其它亮点
    1)首创Puffin-16M数据集(15M vision-language-camera triplets + 1M physically diverse trajectories),覆盖复杂运动(急转、俯冲、悬停、长时序惯性滑行)与真实地理变化;2)实现外观与几何的单阶段联合生成(非两阶段pipeline),每帧输出同步包含RGB+深度+物理状态;3)支持真正闭环应用:mimic(动作克隆)与self-calibrated exploration(无需预标定的自主探索);4)代码、模型、数据集全部开源;5)值得深入的方向包括:扩展至动态物体级物理交互、与大语言模型协同进行因果世界推理、轻量化部署于边缘机器人。
  • 相关研究
    1) 'Gaussian Splatting for Real-Time Radiance Field Rendering' (Kerbl et al., SIGGRAPH 2023); 2) 'PhysDreamer: Physics-Informed Generative World Models' (Zhang et al., CoRL 2023); 3) 'VidSplat: Real-time 3D Gaussian Splatting for Dynamic Scenes' (Liu et al., CVPR 2024); 4) 'World Model as a Foundation Model: Learning Latent Dynamics for Planning' (Hafner et al., NeurIPS 2023); 5) 'OmniMotion: Unified Motion Modeling for Egocentric Video Prediction' (Chen et al., ICCV 2023)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问