Conference

Adaptive Local Basis Functions for Shape Completion

Hui Ying, Tianjia Shao, He Wang, Yin Yang, Kun Zhou

Zhejiang University

一句话总结

本文提出用”端到端学习、不限定形状”的自适应局部基函数来表达深度隐式场,并配合一个”局部到局部”的补全流水线,从残缺点云补全出细节丰富、计算量更低的完整三维形状。

研究背景

  • 领域现状:从残缺扫描点云补全三维形状是自动驾驶、AR、机器人等应用的基础问题。近年来深度隐式函数(DIF)成为主流表达——把 SDF 或占据场写成基函数的加权组合。早期方法用单个全局隐式函数(DeepSDF、OccNet),后来转向局部化:要么把空间离散成体素网格并在网格里嵌入局部隐编码(IF-Net),要么用一族解析基函数(LDIF 用 3D 高斯)做自适应分解。
  • 核心痛点:体素网格类方法为了保细节需要高分辨率,计算代价随之暴涨;而以高斯为基的方法虽然紧凑,但基函数被限定在固定函数族里,表达能力有限,遇到小孔、细杆等精细几何时会丢失细节。
  • 本文 idea:主张基函数的具体形式本身应该是可学习的、不被限定在某个函数族。既然基是可学习且局部的,它就更容易靠数据驱动捕捉局部细节;又因为基的中心和形状都可学,用更少的基就能达到与解析函数相当甚至更好的表达,从而以更低的计算量补出更多局部细节。

方法

整体框架是一个”观测到未观测”的渐进式流水线:先把可见的残缺点云编码成一组局部基函数(紧凑地记录可见区域的细节),再用 Transformer 以序列到序列的方式预测缺失区域的局部基并精修可见区域的基,最后把所有局部基融合成完整形状。

flowchart LR
  A["残缺点云"] --> B["PointNet++ 编码<br/>+ 基于域的降采样"]
  B --> C["可见局部基 (N_vis)"]
  C --> D["缺失中心预测<br/>Transformer"]
  D --> E["整体局部基预测<br/>Transformer"]
  C --> E
  E --> F["完整局部基 (N_comp)"]
  F --> G["RBF 加权融合 → SDF"]
  G --> H["可选后优化"]

关键设计:

  1. 可学习的 DIF 局部基 + RBF 域。每个局部基是一个以 \(\boldsymbol{\mu}_i\) 为中心、带隐编码 \(\boldsymbol{z}_i\) 的深度隐式函数 \(f_\phi(\boldsymbol{x}-\boldsymbol{\mu}_i, \boldsymbol{z}_i)\)。查询点的 SDF 是若干局部基的加权和,权重 \(\alpha_i\) 由一个可学习参数的径向基(RBF)核给出:

    \[sdf(\boldsymbol{x}) = \sum_{i} \alpha_i f_\phi(\boldsymbol{x}-\boldsymbol{\mu}_i, \boldsymbol{z}_i), \quad g_i(\boldsymbol{x}) = \exp\!\left(-\lVert \boldsymbol{A}_i(\boldsymbol{x}-\boldsymbol{\mu}_i)\rVert_2^2\right)\]

    其中 \(\boldsymbol{A}_i\) 是由缩放与旋转组合成的线性变换矩阵,控制该基”域”的形状与朝向。RBF 域和 DIF 基一起端到端联合训练。这里的关键洞察是用 RBF 核显式建模每个基的”局部域”来强制局部性:离基越近的点越可能落在它域内。实践中只取离查询点最近的两个基(索引 \(p, q\))参与计算,天然稀疏。

  2. 紧凑点云编码 + 基于域的自适应降采样。用 PointNet++ 把输入点下采样并编码成中心与嵌入,再用 MLP 解出隐编码和域参数。作者指出均匀采样不合理——几何复杂处该密、简单处该疏。于是提出基于预测域的降采样:定义 \(s(j)=\sum_{i\ne j} g_i(\boldsymbol{\mu}_j)\) 近似”第 \(j\) 个基被其它基覆盖的概率”,迭代地删除 \(s(j)\) 最大的基并更新其余分数,让复杂区域保留更多基。

  3. 局部到局部的 Transformer 补全。分两步:先由”缺失中心 Transformer”根据可见基预测缺失区域的中心坐标,用 Chamfer 距离监督;再由”局部基 Transformer”吃进可见基与缺失中心的查询嵌入,输出完整形状的全部 \(N_{comp}=N_{vis}+N_{miss}\) 个基(含隐编码、域参数和中心偏移)。自注意力机制模拟局部基之间的两两交互,实现可见基与缺失基之间的序列到序列翻译——这也是跨类别泛化的来源:不同类物体的局部(如椅子腿与桌子腿)往往共享相似分布。

  4. 训练技巧与后优化。补全阶段发现只用带权重的 SDF 损失会让可见基学得太快、域过度膨胀而”吞掉”缺失区域,导致缺失基权重趋零;为此加入丢弃权重的 \(\mathcal{L}_{sdf}^{euc}\),并配合平滑损失和偏移正则。得到的初始形状已足够好,还可对隐编码与中心做一次后优化进一步精修(后优化会改善 CD,但 IoU/F1 略降,说明网络直接预测已经很准)。

实验结果

在 ShapeNet 上训练 8 类、用 3000 个残缺输入测试。与 DIF 类方法(DeepSDF、IF-Net、LDIF、ShapeFormer)及点云补全方法(PoinTr、SnowflakeNet 经 NDC 转网格)对比。下表为 8 个已训练类别上的平均指标:

方法 IoU↑ CD↓ (×10⁻³) F1↑
DeepSDF 0.377 6.25 0.322
IF-Net 0.753 0.747 0.781
LDIF 0.637 0.893 0.595
ShapeFormer 0.647 0.860 0.659
PoinTr-NDC - 0.310 0.739
SnowflakeNet-NDC - 0.321 0.737
本文 0.822 0.371 0.843

本文在 IoU 与 F1 上分别比第二名高出约 6.2% 和 6.9%。PoinTr/SnowflakeNet 因其目标就是最小化 Chamfer 距离,在 CD 上略优,但 F1 明显落后。在 5 个未见类别上本文同样领先(IoU 0.771、F1 0.812),显示出优秀的跨类泛化能力。

计算成本方面差距悬殊:单次前向的 FLOPs,本文仅 1.65 B,而 IF-Net 20.6 B、LDIF 7.07 B、ShapeFormer 高达 112.5 B——受益于紧凑表达和避免 2D/3D 卷积。消融显示:局部基数量从 128 降到 32,IoU 仅从 0.836 降到 0.793,证明基确实紧凑高效;平滑损失、基于域的降采样各自都带来可测量的提升;用两个最近基已足够(用三个 IoU 反降 0.2%)。在 ScanNet 与自采 Kinect 真实扫描上也能得到高质量补全。

亮点与局限

  • 亮点:
    • 把”基函数的形状”本身变成可学习对象,摆脱高斯等固定函数族的表达上限,用更少的基捕捉小孔、细杆等精细几何。
    • RBF 显式域 + 只取两个最近基的设计,兼顾了局部性、稀疏性与端到端可训练性。
    • 局部到局部的 Transformer 翻译带来强跨类泛化;整体计算量比同类方法低一个数量级以上。
  • 局限:
    • 整体基预测不保证恢复目标拓扑——当缺失区域局部基的连通性与真值不同时,会出现如椅子横杆未与腿紧密相连的问题。
    • 对补全度差异鲁棒,但在结构存在歧义时(如椅腿附近是否有横杆)会产生漂浮伪结构。
    • 依赖 ShapeNet 的水密预处理与多视深度扫描生成输入,方法评测主要在物体级形状。

延伸思考

  • 作者提出的未来方向是引入高层的图结构表达来约束全局拓扑,这与近年”隐式场 + 显式结构先验”的融合趋势一致;把局部基组织成图,用图上的连通性约束来修正拓扑,或许能直接缓解横杆断连问题。
  • “可学习基函数”的思路本质上介于解析基(高斯、多项式)与纯体素/网格特征之间,用极少的自由基元逼近复杂场,与后来兴起的以少量可学习原语(如 3D 高斯泼溅)表达场景在动机上遥相呼应——都是在追求”紧凑原语 + 数据驱动形状”的表达效率。
  • 局部到局部的补全把跨类共享的是”局部形状翻译先验”而非整体类别原型,这一视角对小样本、开放类别的三维补全颇有启发;能否把这种局部先验迁移到带纹理/语义的补全任务,是值得追问的方向。