Conference

AGILE: Hand-object Interaction Reconstruction from Video via Agentic Generation

Jin-Chuan Shi, Binhong Ye, Tao Liu, Xiaoyang Liu, Yangjinhui Xu, Junzhe He, Zeju Li, Hao Chen, Chunhua Shen

Zhejiang University

SIGGRAPH 2026Reconstruction

一句话总结

AGILE 用”智能体式生成”取代传统重建思路:让视觉语言模型(VLM)监督生成模型合成完整、水密、带高保真纹理的物体网格,再用”锚定—跟踪”策略绕开脆弱的 SfM 初始化,从单目视频中重建出可直接用于物理仿真的手-物交互 4D 序列。

研究背景

  • 领域现状:从单目视频重建动态手-物交互(HOI)是计算机视觉与图形学的核心问题,目标是产出既视觉逼真、又几何显式、物理合理的”数字孪生”,可用于机器人模仿学习和物理仿真。当前主流方法依赖神经渲染(NeRF、3D Gaussian Splatting)优化场景表示。
  • 核心痛点:现有流程有两道难以逾越的障碍。其一,基于重建的几何依赖多视角一致性,而 HOI 场景中手部严重遮挡频繁破坏这一前提,导致几何碎裂、有噪声、非水密,无法喂给物理引擎;其二,也是更关键的,位姿初始化依赖 SfM(如 COLMAP),在无纹理物体、快速运动、大遮挡的动态场景中极易失配,一旦注册失败整条流水线就崩溃。近期生成式方法(如 MagicHOI 用扩散先验、SAM3D 单视图生成)要么过度平滑、仍绑定 SfM,要么因单视图信息缺失产出粗糙几何。
  • 本文 idea:把范式从”重建”转向”智能体式生成”。既然标准 3D 生成器需要动态视频里拿不到的规范相机、而 2D 扩散先验又会产生与视频不符的幻觉,那就引入一个 VLM 充当”智能评审”,负责挑选信息量大的关键帧、并对生成的多视图做拒绝采样过滤,从而可靠地把生成先验与视频证据融合起来。

方法

整体框架:给定固定相机拍摄的单目手-物交互视频,AGILE 分三个阶段产出手与物体的 4D 轨迹。先由 VLM 引导的智能体流水线生成一个高质量、带纹理的水密物体网格;再用”锚定—跟踪”完成免 SfM 的位姿与尺度初始化;最后通过接触感知优化逐帧对齐并保证物理合理性。

flowchart LR
  A["单目交互视频"] --> B["VLM 引导多视图合成 + 拒绝采样"]
  B --> C["3D 抬升 + 重拓扑 + 纹理精修"]
  C --> D["水密带纹理网格"]
  D --> E["尺度估计 + IOF 锚定位姿初始化"]
  E --> F["双向接触感知优化"]
  F --> G["仿真就绪 4D 手物轨迹"]

关键设计分为三块:

  1. 智能体式带纹理物体生成(是什么/为什么/怎么做)。为对抗遮挡,需从视频聚合多视角线索、用 2D 生成先验补全缺失视角,但扩散模型的随机性会产生幻觉。做法是让 VLM 当”critic”:先从视频里选出 1~4 个信息量最大的关键帧引导图像生成模型合成正交视图,再由 VLM 从几何、纹理、材质一致性等维度打分,低于严格阈值的候选被拒绝并重新生成(拒绝采样)。通过验证的多视图送入前馈 3D 生成模型得到初始网格,随后做自动重拓扑与 UV 展开得到轻量、干净、适合仿真的网格;最后用图到图编辑模型、以高分辨率多视图为条件做纹理精修(同样受 VLM 监督)。高质量纹理不只是为了好看:位姿初始化用的 FoundationPose 和后续的 DINO 语义损失都高度依赖清晰的表面特征。

  2. 免 SfM 的位姿与尺度初始化(锚定)。先做数据预处理:用 MoGe-2 估计相机内参 \(K\) 与逐帧度量深度图 \(D\),用 SAM2 得到手与物体的分割掩码;静态相机假设下以相机坐标系为世界系。手部初始化用 WiLoR 预测 MANO 参数(形状 \(\boldsymbol{\beta}\)、姿态 \(\boldsymbol{\theta}\)、全局旋转 \(R_h\)、2D 关键点 \(J_{2D}\)),固定旋转,用受约束 ICP 对齐深度点云求全局尺度 \(s_h\),再用 PnP 求逐帧平移 \(T_h\)。物体则采用”尺度优先”策略:先用同样的 ICP 估计全局度量尺度 \(s_o\),再定位交互起始帧(IOF,即物体掩码开始显著位移的时刻),在该单帧用 FoundationPose 求初始位姿 \([R_o^{IOF}, T_o^{IOF}]\)。只在一帧上锚定,避免了 SfM 的全局脆弱性。

  3. 接触感知的双向优化(跟踪)。从 IOF 出发同时向视频首尾双向逐帧传播。IOF 处联合优化手、物位姿与物体各向异性尺度 \(s_o\);其余帧冻结 \(s_o\),每帧两步:第一步只优化手平移 \(T_h\),靠关节重投影损失 \(NOTESMATHSPAN13ENDNOTESMATHNOTESMATHSPAN14ENDNOTESMATH(R_o, T_o)NOTESMATHSPAN15ENDNOTESMATHNOTESMATHSPAN16ENDNOTESMATHNOTESMATHSPAN17ENDNOTESMATHL_{mask}NOTESMATHSPAN18ENDNOTESMATHL_2NOTESMATHSPAN19ENDNOTESMATHL_{dino}NOTESMATHSPAN20ENDNOTESMATHL_{interact}NOTESMATHSPAN21ENDNOTESMATHNOTESMATHSPAN22ENDNOTESMATHNOTESMATHSPAN23ENDNOTESMATH\PhiNOTESMATHSPAN24ENDNOTESMATHNOTESMATHSPAN25ENDNOTESMATHNOTESMATHSPAN26ENDNOTESMATHd_i = \max(0, \Phi(\tilde{v}_{h,i}^{(t-1)}))NOTESMATHSPAN27ENDNOTESMATHCD_hNOTESMATHSPAN28ENDNOTESMATHCD_hNOTESMATHSPAN29ENDNOTESMATHL_{interact}NOTESMATHSPAN30ENDNOTESMATHCD_h\)$ 飙到 54.40,物体出现穿模与滑动。此外还展示了 Real-to-Sim 应用:把重建序列导入 Isaac Gym,通过运动学优化把人手运动重定向到灵巧机器人手(如 Shadow),验证网格水密可直接加载、抓握配置忠实可迁移。

亮点与局限

  • 亮点:
    • 首个把 VLM 质量评估与生成模型结合的智能体式 HOI 流水线,独立于视频遮挡即可产出水密、高保真、仿真就绪的网格。
    • “锚定—跟踪”策略彻底摆脱脆弱的 SfM——只在单个接触帧初始化位姿,再靠语义与几何对齐传播,在野外视频上达到 100% 成功率。
    • SDF 软门控的接触稳定性损失把物理合理性显式写进优化,显著改善交互质量并避免穿模。
    • 直接优化显式网格,便于把 2D 视觉监督与 3D 交互约束融合,且产物可直接进物理引擎、支持真到仿的重定向。
  • 局限:
    • 继承了底层基础模型(深度、分割、多视图生成)的能力边界,对透明或强反光物体可能出现尺度漂移或局部跟踪错误。
    • Real-to-Sim 目前只做运动学可视化,没有闭环的接触动力学与策略学习。
    • 方法针对刚体,尚未覆盖铰接体与可形变物体。

延伸思考

这项工作体现了”用生成先验补全被遮挡信息、再用几何/接触约束把生成结果拉回真实观测”的思路,与近期把大模型当”智能体评审”引入重建/生成回路的趋势一致。VLM 在这里不仅选帧和过滤幻觉,作者也指出它还能进一步充当”可重建性预筛”(筛掉不可靠片段)和”多锚点检测器”(对长序列做双向传播抗漂移),这是很自然的扩展方向。另一个值得追问的点是:把范式扩展到铰接体与可形变物体时,接触稳定性先验(假设手物近似刚性整体运动)还成不成立,可能需要更细粒度的部件级接触建模。对做机器人操作数据采集的人来说,这条”从无约束视频自动产出可重定向资产”的路径,是低成本规模化获取灵巧操作数据的一个现实起点。