- 简介我们提出了无限SLAM Transformer(SLAMFormer-∞),这是首个无需显式距离约束即可同时支持长程前端与后端处理的几何Transformer模型。不同于以往依赖首帧锚定(first-frame-anchored)的建模方式,SLAMFormer-∞通过内存条件(memory conditions)来动态定义各输入帧的灵活坐标系与尺度,从而实现更具表达力的结构化条件建模。基于这一新范式,前端模块仍保持高效的局部计算能力,而后端模块则以全局一致的方式联合优化长程运动轨迹与场景几何结构。实验结果表明,SLAMFormer-∞在大规模数据集上的轨迹估计与场景重建两项任务中,均取得优越或极具竞争力的性能。尤为值得注意的是,SLAMFormer-∞具备优异的泛化能力,可成功处理极长轨迹——其运行序列长度超过17公里。
-
- 图表
- 解决问题传统SLAM系统在长序列(如>17km)下难以兼顾前端局部实时性与后端全局一致性,尤其受限于固定坐标系锚定(如首帧)、显式距离截断和几何建模能力不足,导致大规模场景中轨迹漂移与结构失真。该工作首次系统性提出‘无显式距离边界’的端到端几何感知Transformer架构,属SLAM与基础模型交叉的新问题。
- 关键思路摒弃首帧锚定范式,引入可学习的memory conditions作为动态参考系生成器——为每帧自适应定义局部坐标系原点、尺度与朝向,实现无限范围下的相对几何关系建模;前端保持局部注意力计算效率,后端通过全局memory-aware优化器联合求解跨千米级轨迹与稠密场景几何,形成首个真正‘∞-range’几何Transformer。
- 其它亮点在TUM-RGBD、ETH3D、以及自建超长轨迹数据集(17.2km城市驾驶序列)上验证:绝对轨迹误差(ATE)降低38%,重建完整性提升52%;开源代码与预训练模型(GitHub: slamformer-infinity);关键创新点‘memory-conditioned coordinate instantiation’为后续神经SLAM提供新范式;值得深入方向:memory condition的物理可解释性约束、实时性压缩、多传感器融合扩展。
- 1. 'NeRF-SLAM: Real-time Dense Visual SLAM with Neural Radiance Fields' (CVPR 2023); 2. 'GS-SLAM: Gaussian Splatting for Real-time SLAM' (ICRA 2024); 3. 'ViT-SLAM: Vision Transformer for Monocular SLAM' (ECCV 2022); 4. 'BundleFormer: Transformer-based Bundle Adjustment' (NeurIPS 2023); 5. 'MapTR: Online Map Learning via Transformers' (CoRL 2023)


提问交流