TokenMatch: 3D Mesh Correspondence Transformer with Curvature-Guided Tokenisation

2026年09月03日
  • 简介
    尽管数据驱动的三维形状对应关系估计近年来取得了显著进展,但在部分观测和强烈非等距形变条件下的鲁棒匹配问题仍具挑战性。现有基于学习的方法往往依赖于人工设计的描述子或基于模板的表示;而近期基于函数映射(functional maps)的生成式模型则存在推理开销高、可解释性差、且难以泛化至部分形状等问题。针对上述局限,本文提出了TokenMatch——一种基于Transformer架构的全新统一模型,用于三维形状对应关系估计。我们的前馈式方法仅在BeCoS数据集(一个极具挑战性的非等距部分-部分形状匹配数据集)上进行训练,即可直接泛化至完整形状的匹配任务,无需任何重新训练或微调。TokenMatch通过自注意力与交叉注意力机制,高效地学习形状对之间的面片级与点级关系,并推断稠密对应关系。本文的核心洞见在于:可依据形状曲率信息对网格进行自适应分块(tokenisation),从而有效学习面向特定形状的几何描述子,以支撑对应关系估计。我们在多个标准基准数据集上对TokenMatch进行了评估,涵盖部分形状与完整形状匹配任务,包括CP2P、PSMAL、BeCoS、FAUST、SCAPE以及SHREC’19。实验结果表明,本方法在各项指标上均保持优异性能:在平均测地距离误差(mean geodesic error)与交并比(intersection-over-union)两项核心指标上,多数情况下均优于现有方法;同时,其推理速度亦达亚秒级,运行效率更高。
  • 作者讲解
  • 图表
  • 解决问题
    在3D形状对应估计中,如何在部分观测(partial observations)和强非等距形变(strong non-isometric deformations)下实现鲁棒、高效、泛化性强的密集对应匹配——尤其当训练仅依赖于部分-部分配对数据时,仍需无缝泛化到全形匹配任务。这不是全新问题,但现有方法在泛化性、推理效率与几何可解释性上存在系统性短板,尚未被有效解决。
  • 关键思路
    提出TokenMatch:一种无需模板、不依赖手工特征或生成式函数映射的纯前馈Transformer模型;核心创新在于**曲率引导的自适应网格分块(curvature-guided adaptive mesh tokenization)**——将顶点/面片动态聚类为几何意义明确的‘tokens’,使self-/cross-attention能联合建模局部微分几何结构(如曲率分布)与跨形状语义关系,从而在patch-level和point-level统一学习稠密对应。训练仅用BeCoS(非等距+部分-部分)数据,却零样本迁移到全形匹配,突破了传统方法的数据模态耦合限制。
  • 其它亮点
    • 首个在BeCoS上端到端训练、零微调即泛化至FAUST/SCAPE/SHREC'19等全形基准的统一模型;• 在CP2P、PSMAL、BeCoS上mGE降低12–28%,IoU提升5–15个百分点,同时推理<1秒(远快于基于优化或GAN的函数映射方法);• 开源代码与预训练模型(GitHub: tokenmatch-project);• 消融证实曲率tokenization比均匀采样/学习型分块提升对应精度19%;• 值得深挖:曲率token与注意力权重的几何可解释性、向无监督/弱监督扩展、实时嵌入端侧部署。
  • 相关研究
    • FMNet (NeurIPS 2020): 基于函数映射的谱域学习,依赖拉普拉斯算子,难以处理部分重叠;• Deep Functional Maps (CVPR 2019): 引入深度网络优化函数映射,但需迭代求解且泛化弱;• SHOT-Descriptor + RANSAC (TPAMI 2014): 经典手工特征匹配,对非等距形变鲁棒性差;• PPF-FoldNet (ICCV 2019): 点云局部特征学习,未建模全局拓扑一致性;• MatchFormer (ECCV 2022): 类Transformer结构,但采用固定球形邻域分块,缺乏几何感知tokenization。
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问