Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

2026年09月03日
  • 简介
    在线三维重建模型在处理长视频时性能较差。其根本原因在于:将相机位姿回归至一个固定的首帧参考坐标系,迫使模型进行远超训练分布范围的外推;由此产生的微小位姿漂移会不断累积并逐级放大,最终导致严重的几何结构坍塌。然而,我们观察到,尽管整体重建失败,但每一帧预测的深度图却始终保持稳定——即模型主干网络所学习的局部几何结构依然完好无损,仅全局位姿预测头(pose head)出现失效。受此“局部几何与全局位姿可解耦”现象的启发,我们提出了 Scal3R 方法。该方法将在线重建任务重新建模为一种面向多参考帧的相对位姿查询问题。具体而言,我们引入轻量级、可学习的嵌入标记(tokens),其参数量仅占整个模型约 1%;再通过非对称注意力机制,将这些标记注入一个完全冻结的主干网络中。由此构建的架构能够以多个历史关键帧为参考,动态查询当前帧的相对位姿。此外,我们还集成了一套支持闭环检测的在线位姿图优化系统,从而有效抑制长距离累积漂移。Scal3R 在单块 GPU 上仅需 8 小时即可完成训练收敛;在 KITTI 数据集上,其平均绝对位姿误差(ATE)相较现有在线基线方法降低超过 60%;同时,在 Virtual KITTI、Sintel、TUM-Dynamic、ScanNet 及 7-Scenes 等多个主流数据集上均达到当前最优(state-of-the-art)性能。项目主页:https://linjohnss.github.io/scal3r/
  • 作者讲解
  • 图表
  • 解决问题
    在线3D重建模型在处理长视频时性能急剧下降,核心问题在于传统方法将所有相机姿态回归到固定的第一帧锚点,导致姿态估计随时间推移发生累积漂移(extrapolation beyond training distribution),最终引发全局几何坍塌;而深度预测本身却保持稳定——表明问题本质是全局位姿估计失效,而非局部几何表征退化。这是一个长期存在但尚未被结构化解耦解决的实际部署瓶颈问题。
  • 关键思路
    提出Scal3R,彻底摒弃单锚点(first-frame)姿态回归范式,转而构建‘多参考帧相对姿态查询’机制:引入仅占约1%参数量的轻量可学习token,通过不对称注意力注入冻结的预训练视觉骨干网络,动态查询当前帧相对于多个历史关键帧的相对位姿;再耦合在线位姿图优化与闭环检测,实现漂移抑制。其新意在于首次显式解耦并重参数化姿态估计的参考系结构,以极低成本激活冻结大模型的时序几何推理能力。
  • 其它亮点
    • 在单GPU上8小时完成端到端训练(显著低于同类方法);• 在KITTI上平均绝对轨迹误差(ATE)降低超60%,大幅超越在线基线;• 在Virtual KITTI、Sintel、TUM-Dynamic、ScanNet、7-Scenes五大跨域数据集均达SOTA;• 深度预测稳定性与姿态崩溃的解耦现象为领域提供重要实证洞见;• 代码与项目页已开源(https://linjohnss.github.io/scal3r/);• 值得深入的方向包括:token时序压缩机制、闭环触发的自适应稀疏化、以及向NeRF-based在线重建迁移。
  • 相关研究
    • DROID-SLAM (2022, CoRL): 基于因子图的深度学习SLAM系统,强调鲁棒性但计算开销大;• RAFT-SLAM (2023, ICCV): 光流驱动的在线重建,依赖密集匹配易受运动模糊影响;• MonoRec (2021, CVPR): 单目在线重建框架,采用递归姿态传播,未建模长期漂移;• BA-Net (2022, ECCV): 将BA嵌入网络训练,但需离线优化且不可扩展至长视频;• S3L (2023, NeurIPS): 自监督序列学习用于深度+位姿联合估计,仍基于单锚点设计。
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问