Journal

Interaction-Driven Active 3D Reconstruction with Object Interiors

Zihao Yan, Fubao Su, Mingyang Wang, Ruizhen Hu, Hao Zhang, Hui Huang

Shenzhen University

一句话总结

让一台真实机器人自动地去”开抽屉、开门”,通过与物体的物理交互暴露并扫描其内部结构,从而完整重建出物体的外部与内部几何,同时还能得到各部件的运动属性。

研究背景

  • 领域现状:传统的几何或学习式三维重建,无论方法多先进,本质上都只能捕获相机/扫描仪能”看到”的外表面。这类模型好看,但内部是空的,也无法交互。
  • 核心痛点:在 VR/AR、游戏、智能家居、具身智能等应用里,我们既想要物体的内部结构(抽屉打开后的隔层、柜内的搁板),也想要部件级的运动属性(门怎么转、抽屉怎么拉)。已有的”主动视觉”工作大多只优化相机视角,并不改变物体本身;少数会暴露内部的工作(如需要人手动开抽屉的主动扫描)则严重依赖人力,且人本身成了新的遮挡与运动源,跟踪困难。
  • 本文 idea:用机器人替代人来做交互。系统交替执行”交互分析”和”交互驱动重建”两个阶段:先分析物体哪些部件可被操作、该怎么操作,再让机器人真的去开合部件、暴露内部、逐个扫描并重建,最后补全所有非活动部件(含被暴露的内部)。机器人与相机的运动都可精确控制,从而把难点从”分离人与相机运动”转移到”可交互性分析与部件操作”上。

方法

整体框架:给定处于静止状态的目标物体,Fetch 机器人先在物体前扫描得到初始点云,并推断一张逐点的”可交互性图”来预测动作;随后迭代地对每个可动部件执行操作(如拉开抽屉),到达新状态后再次扫描、分割出该部件、完成补全与网格重建,并把已重建部件从可交互性图中屏蔽掉;当图中足够可动的点数低于阈值时停止,最后对剩余的非活动部件(含被暴露的内部结构)做整体重建,合并所有网格与运动信息得到最终结果。

flowchart LR
  A["初始扫描 C0"] --> B["交互分析: 可交互性图 I"]
  B --> C["动作选择 + 机器人操作"]
  C --> D["新状态扫描 + 部件分割"]
  D --> E["部件补全 + 网格重建"]
  E --> F["屏蔽已重建部件, 更新 I 与 C0"]
  F -->|"仍有可动部件"| B
  F -->|"低于阈值, 停止"| G["非活动部件与内部整体重建"]
  G --> H["合并网格 + 运动参数"]

关键设计:

  1. 基于物理规则的可交互性学习。以往方法(Where2Act)要在仿真里逐个采样动作并测试成败,既慢又只有二值标签。本文观察到”可交互性与部件运动强相关”(比如门在远离铰链的一侧更好开),于是利用数据集里已有的部件运动信息,直接用物理规则解析地算出每个动作的分数。旋转部件按力矩打分(力垂直分量产生力矩、减去平行分量的摩擦阻力):

    \[Score_r = d \times F_{\perp norm} - \mu F_{\parallel norm}\]

    平移部件则按沿轴驱动力减去垂直阻力打分:

    \[Score_t = F_{\parallel axis} - \mu F_{\perp axis}\]

    分数归一化到 \([0,1]\) 作为训练标签,采样一个动作分数比仿真快约一万倍。

  2. 交互感知网络。基于 PointNeXt 编码器 + 三个解码器:动作评分解码器先训练(预测某动作成功概率),再用它监督”逐点可交互性解码器”(对每点采样 100 个方向取平均分作为标签)和”动作提议解码器”(预测每点成功率最高的操作方向)。总损失按 \(L_i = \omega_d L_i^p + \omega_s L_i^s + \omega_a L_i^a\) 加权,权重取 \((1,1,50)\)。

  3. 利用交互反馈的运动获取与部件分割。机器人换用吸附式夹爪,无需预知动作类型即可推拉。操作时记录夹爪轨迹并采样 20 个点,用最小二乘拟合圆或直线来判定运动类型(转动/平移)、运动轴与运动范围——这一步用真实交互反馈校正了网络的预测。分割网络把交互前后两帧点云拼接成一份(固定区域点更密、变化区域更易被网络识别),再拼上 7 维运动参数,用两个残差 MLP 分别预测两帧的分割掩码,从而同时分出可动部件与新暴露的内部结构。

  4. 补全与网格化。因自遮挡,即便完全打开部件的扫描也不完整,故先用改编自 SeedFormer 的补全网络(非活动部件的运动参数置零)预测缺失区域,再直接用预训练的 NDC 生成高质量网格。

实验结果

在 iGibson 仿真环境训练与测试,选取 PartNet-Mobility 的七个类别共 434 个形状、827 个部件,并在真实 Fetch 机器人上验证。与最相关的 A-SDF 和 Ditto(均从两个不同关节状态的形状对预测几何与关节参数)在 Ditto 数据集上比较:

方法 \(mIoU_{end}\)↑ \(A_{seg}^{end}\)↑ \(E_{recon}^{cd}\)↓ \(E_{recon}^{emd}\)↓ \(E_{mo}^{dir}\)↓ \(E_{mo}^{pos}\)↓
A-SDF - - 4.377 10.436 - -
Ditto 0.935 0.978 0.861 3.308 9.68 5.21
本文 0.963 0.990 0.448 0.999 2.00 1.13

(\(E_{recon}^{cd}\) 乘 \(10^3\),其余误差项乘 \(10^2\)。)本文在重建误差、分割精度和运动参数精度上均优于两个基线,尤其运动参数得益于轨迹拟合而非纯网络预测,误差大幅降低,且能自动重建多部件物体。消融显示:规则化数据生成使动作生成快约一万倍、动作预测精度约为 Where2Act 的两倍;把两帧点云拼接并注入运动信息,也显著提升了分割(尤其初始状态)的精度。

亮点与局限

  • 亮点:
    • 首次演示了全自动、机器人辅助、交互驱动的三维重建,能恢复被遮挡的内部结构并附带部件运动属性,且真机可跑。
    • 用物理规则解析地生成可交互性标签,绕开了昂贵的仿真采样,速度与精度双赢。
    • 充分利用真实操作的轨迹反馈来拟合运动参数,比纯网络预测更准,也反哺了分割。
  • 局限:
    • 吸附式夹爪无法平行于门面滑动,对滑动门这类运动会失败;拾取式的自由部件(如茶壶盖)拿起后难以继续下一步操作。
    • 运动范围受机械臂长度限制,可能开不到最大角度;要求物体初始处于静止无关节状态,机器人操作不精确会带来误差累积。
    • 未利用相机 RGB 信息,重建质量受限于输入点云稀疏;合成数据集内部大多是空的。

延伸思考

论文本身指出两条值得追的方向:一是构建”内部含真实物品”的数据集(比如打开的抽屉里放一个笔记本),当前 ShapeNet/PartNet 的内部几乎都是空的,限制了内部重建的研究价值;二是处理层级化交互(如柜门里还套着抽屉),需要优化交互感知流程。更广地看,这项工作把”重建”从被动感知推向了”具身交互式感知”,与近年具身智能、可操作数字孪生的趋势高度契合——把吸附夹爪换成更通用的灵巧手、引入 RGB 与触觉、或用可微渲染联合优化运动与几何,都可能显著突破当前吸附式操作与稀疏扫描的瓶颈。