Conference

Zero-Shot 3D Shape Correspondence

Ahmed Abdelreheem, Abdelrahman Eldesokey, Maks Ovsjanikov, Peter Wonka

KAUST; École Polytechnique

一句话总结

本文提出一个完全零样本、无需训练的 3D 形状对应流水线,借助语言-视觉基础模型(BLIP2、ChatGPT、Grounding-DINO、SAM)的推理能力,专门解决”强非等距、跨类别”形状(如人 vs. 牛)之间的语义匹配问题。

研究背景

  • 领域现状:形状对应是计算机视觉的基础任务,深度学习方法(监督/无监督/自监督)主要围绕函数映射(functional maps)等框架,学习点级描述子来做匹配。
  • 核心痛点:现有方法几乎都聚焦于同类别、近等距形状对(人 vs. 人),对强非等距、跨类别形状对(人 vs. 动物)研究很少。根本原因是缺乏跨类别配对数据集,且异类形状几何结构差异巨大,传统共分割(co-segmentation)要求两形状共享同一套语义区域名,这一假设在跨类别场景下不成立。
  • 本文 idea:3D 数据太少、难以直接训练大模型,那就复用已有的语言/视觉基础模型来完成零样本对应。关键创新是不再强求两形状共享区域集,而是让 LLM 分别为每个形状生成各自的语义区域集,再生成两套区域之间的语义映射,从而让”人的手臂”能对上”鸟的翅膀”。

方法

整体框架分三大模块串联:先零样本识别两个形状的类别,再由 LLM 生成各自的语义区域集及跨形状映射,然后用零样本 3D 语义分割落到网格面上得到稀疏对应,最后可选地用函数映射框架致密化为逐点对应。

flowchart LR
  A["输入网格对 S1, S2"] --> B["多视角渲染 + BLIP2 生成类别候选"]
  B --> C["ChatGPT 归并为单一类别"]
  C --> D["ChatGPT 上下文学习: 生成区域集 R1/R2 与映射 M12"]
  D --> E["SAM-3D 零样本分割 (Grounding-DINO + SAM)"]
  E --> F["按 M12 匹配得到稀疏对应"]
  F --> G["函数映射 BCICP 致密化为逐点对应"]
  • 零样本 3D 形状分类:对每个形状在 3 个仰角、4 个方位角下渲染 \(k\) 个视图,喂给 BLIP2 得到 \(k\) 个类别候选。由于文本标签存在同义词与形容词,简单多数投票不可靠,于是交给 ChatGPT 归并为每个形状一个单一类别。
  • 语义区域生成与匹配(核心创新):这一步跳出传统共分割框架。利用 ChatGPT 的上下文学习(在 prompt 里给几组”输入-期望输出”示例),为两个形状分别生成语义区域集 \(R_1, R_2\),并给出一个映射 \(M_{12}: R_1 \leftrightarrow R_2\)。映射允许一对多,例如狗的腿可同时对应人的手臂和腿。正是这一步让强非等距形状可被匹配。
  • 零样本 3D 语义分割(SAM-3D):单独用 SAM 的文本引导分割能力有限,故将目标检测器 Grounding-DINO 与 SAM 组合。对形状密集渲染 180 个视图(3 个半径各采样一批),DINO 对每个语义区域检测 2D 框,SAM 依框产出分割掩码,把得分累加到面片-区域矩阵 \(X_i \in \mathbb{R}^{\lvert F_i \rvert \times \lvert R_i \rvert}\),最后逐面片取最高得分区域作为标签 \(FL_i = \arg\max_j X_i[j,:]\)。
  • 稠密对应:以 SAM-3D 的区域匹配为初始化,套用经典函数映射框架,用区域内点的 WKS 描述子构造函数约束,结合 Laplace-Beltrami 交换性正则求解映射矩阵 \(C\),再转成逐点映射并用 BCICP 迭代细化。虽然函数映射本为近等距设计,但好的分割初始化让它在非等距对上也能出高质量稠密图。

实验结果

作者构建了强非等距形状数据集 SNIS(250 对,第一形状来自 FAUST/DeformingThings4D,第二来自 SMAL 动物),每对标注 34 个关键点对应与稠密分割图,并提出多个分阶段指标。主实验是稠密形状对应,以平均测地误差衡量,比较用不同分割初始化函数映射框架 BCICP 的效果:

初始化方法 平均测地误差 ↓
SEG + BCICP 0.41
SATR + BCICP(本文) 0.37
SAM-3D + BCICP(本文) 0.36

用 SAM-3D 分割初始化明显优于传统 SEG 分割,且对应更连续、无区域断裂。其余阶段的结论:零样本分类上 ChatGPT 归并(73.90%)远超朴素投票(44.80%);语义区域生成 F1 上 ChatGPT(80.31%)大幅超过 BLIP2(41.28%);3D 语义分割 SAM-3D 在 SRIoU(73.55%)与关键点标签匹配精度(59.72%)上均优于 SATR。消融显示视图数增加会稳定提升分类与分割精度。

亮点与局限

  • 亮点:
    • 完全零样本、零训练/微调,纯靠现成基础模型组合即可处理跨类别形状匹配,思路简洁而有效。
    • 用”分别生成区域集 + 生成跨集映射”替代共分割的”共享区域集”假设,是打通强非等距匹配的关键设计。
    • 贡献了新基准 SNIS 与一整套分阶段评估指标,便于后续工作评测。
  • 局限:
    • 只能匹配较粗的语义区域(头、躯干、腿),无法给出眼、嘴、手等细粒度区域,受限于无纹理网格渲染上图像分割模型的粒度。
    • 稠密化仍依赖为近等距设计的函数映射框架,强非等距情形下逐点图可能出现伪影。
    • 流水线依赖闭源大模型(ChatGPT)的推理输出,结果稳定性与可复现性受其影响。

延伸思考

  • 该工作是”用 2D/语言基础模型撬动数据稀缺的 3D 任务”这一范式的代表,与作者此前的 SATR(零样本 3D 语义分割)一脉相承,后续的零样本 3D 关键点检测等工作沿此方向延伸。
  • 一个自然的追问是:能否训练把 3D 形状、图像、文本映射到同一潜空间的基础模型,从而免去多视角渲染这一信息损失环节?
  • 稠密对应仍是瓶颈——如何设计一个真正面向强非等距形状、能从高质量区域匹配出发的致密化算法,是留给未来的开放问题。