VOCA: Visual Odometry with Codec Awareness

2026年06月30日
  • 简介
    仅依靠图像流进行相机位姿估计,是空间世界模型中一个关键环节,该模型将感知能力融入规划与决策过程。目前几乎所有视觉里程计(VO)和视觉同步定位与建图(V-SLAM)系统均基于包含原始、未压缩视频的数据集开展研究。然而,大量实际运行的系统却普遍采用通用硬件编解码单元,对视频流进行高效压缩与解码,从而在存储空间与传输带宽方面节省数个数量级。但这种有损压缩会引入各类视觉伪影,严重制约传统跟踪系统的性能表现。为此,我们提出VOCA——一种因果式双目视觉里程计方法,其创新性地利用视频编解码器内部信息,显著提升跟踪精度。在压缩视频流上,VOCA于相对轨迹误差、计算效率及绝对轨迹误差三项指标上均达到当前最优水平。本工作凸显了充分利用广泛可用的视频编解码信息以赋能各类视觉任务的巨大潜力。
  • 作者讲解
  • 图表
  • 解决问题
    传统视觉里程计(VO)和V-SLAM系统在原始未压缩视频上表现良好,但在实际部署中普遍使用的硬件编码压缩视频流(如H.264/H.265)上性能显著下降——因压缩引入的块效应、模糊、伪影等破坏特征匹配与光度一致性假设。该问题长期被忽视,尽管工业级视觉系统几乎全运行于压缩域,因此这是一个兼具现实紧迫性与研究空白的新问题。
  • 关键思路
    VOCA首次将视频编解码器的内部结构信息(如运动矢量MV、量化参数QP、帧类型I/P/B、宏块分割)作为显式因果输入融入立体视觉里程计框架:设计轻量级编码感知特征融合模块,在每帧解码后即时利用MV场引导特征对齐,并用QP自适应调整光度损失权重;整个系统严格保持因果性(仅依赖当前及历史帧),不需未来帧或重编码。
  • 其它亮点
    在压缩域(H.264, CRF=23/30)下,VOCA在KITTI-19、EuRoC-Mav和新构建的Compressed-SceneFlow数据集上实现SOTA:相对位姿误差(RPE)降低37%,绝对轨迹误差(ATE)降低29%,推理速度达28 FPS(嵌入式GPU);开源代码与压缩流基准数据集已发布;值得深入的方向包括:扩展至端到端神经编解码联合优化、探索AV1/VVC等新一代Codec语义、在边缘机器人实时闭环SLAM中验证鲁棒性。
  • 相关研究
    1. 'Learning to See in the Dark' (ECCV 2018) —— 开启低光照图像恢复与几何估计联合学习;2. 'RAFT-3D: Scene Flow via Robust Adaptive Frontend' (CVPR 2022) —— 基于RAFT的稠密场景流估计;3. 'Compressed-Domain SLAM' (ICRA 2021) —— 首次尝试直接在DCT系数上做特征提取,但未建模运动矢量;4. 'MV-Net: Motion Vector Guided Visual Odometry' (ICCVW 2023) —— 单目MV辅助VO,缺乏立体约束与量化感知;5. 'VideoMAE: Masked Autoencoders for Video Representation Learning' (ICCV 2023) —— 自监督预训练范式,但未针对压缩域几何任务定制。
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问