Conference
Drivable Avatar Clothing: Faithful Full-Body Telepresence with Dynamic Clothing Driven by Sparse RGB-D Input
Meta Reality Labs Research; Carnegie Mellon University
一句话总结
本文构建可由稀疏 RGB-D 输入驱动的全身真实感虚拟人,通过”神经迭代最近点(N-ICP)”粗跟踪松散衣物表面、再以纹素对齐特征驱动化身模型,忠实重建衣物的动态形变与外观细节。
研究背景
- 领域现状:真实感虚拟人(avatar)是沉浸式远程临场(telepresence)的关键。现有路线大致两类——一类把衣物当作身体的一部分或作为独立层,纯靠身体姿态驱动动画;另一类靠体积融合、隐式函数或 NeRF 等重建方法,直接从传感器输入恢复几何与外观。
- 核心痛点:姿态驱动的方法无法保证输出”忠实”于衣物真实状态——松散衣物(裙子等)的动态无法由当前或前几帧的身体姿态唯一决定,相同动作可能对应完全不同的衣物轨迹。纯传感方法缺乏模型约束,对噪声/缺失输入敏感,时序一致性差、观测与非观测区域质量割裂。本文所基于的 DVA(Drivable Volumetric Avatars)只对贴身衣物有效,因其依赖粗糙的身体形状先验。
- 本文 idea:兼取两者之长——保留显式化身模型作为先验,同时把驱动信号从”仅身体姿态”扩展到稀疏 RGB-D。关键洞见是先引入一个跟踪阶段,把松散衣物表面与输入深度粗对齐,从而获得更准确、更有意义的纹素对齐特征,减轻后续编解码网络的负担。
方法
整体框架分两大模块:先用 N-ICP 从融合点云粗跟踪松散衣物几何,得到与表面对齐的形变网格;再据此把稀疏 RGB-D 驱动图像”展开”(unwrap)成纹素对齐特征,喂入纹素条件化的衣物化身模型,预测精细几何修正与视角相关纹理,最后光栅化成输出图像。衣物被建模为独立于身体化身之上的一层。
flowchart LR
A["稀疏 RGB-D 驱动图 + 身体姿态"] --> B["融合点云 P"]
B --> C["N-ICP 粗跟踪"]
C --> D["对齐形变网格 D"]
D --> E["展开为纹素对齐特征 FI / FD"]
E --> F["纹素条件化衣物化身"]
F --> G["几何修正 + 视角相关纹理"]
G --> H["光栅化输出图像"]
关键设计:
- 神经迭代最近点(N-ICP):经典非刚性 ICP 求解最近点残差最小化 \(\min_{\boldsymbol{\theta}} \sum_{p \in P} \lVert C(p, D(\boldsymbol{\theta})) - p \rVert^2\),但依赖良好初始化、需序列跟踪、难以从失败中恢复且 GPU 实现复杂。N-ICP 用 PointNet 网络替代求解器:每次迭代把点云、残差 \(r\) 与一阶梯度 \(g = J^T r\) 一起送入网络,预测参数更新 \(\Delta\boldsymbol{\theta} = M(P, r, g)\),迭代 \(N=3\) 次。把误差与梯度显式喂给网络是有效性的关键(消融验证)。
- 弱监督训练:不需要真值形变参数,仅用多视角立体(MVS)重建的完整衣物几何 \(\bar{P}\) 作监督(训练时可用全相机重建,测试时只有稀疏深度融合的带缺失点云)。损失为每次 ICP 迭代 ICP 损失的均值加正则。
- 层次化衣物形变模型:外层是相对身体姿态的线性混合蒙皮(LBS),内层是形变图(deformation graph),即 \(D(\boldsymbol{\theta}) = W(E(M, \boldsymbol{\theta}), \boldsymbol{\rho})\)。身体姿态 \(\boldsymbol{\rho}\) 由关键点检测加逆运动学求得并在 N-ICP 中固定,为迭代提供接近目标的良好起点,支持逐帧跟踪、避免序列跟踪的误差累积。
- 纹素条件化衣物化身:以 N-ICP 最终结果 \(D\)(已与衣物表面良好对齐)作展开起点,得到含更多外观细节的纹素对齐特征 \(F_I = U(\{I_c\}, D)\)。再额外提供”深度偏移”特征 \(F_D\)——把传感深度与跟踪几何渲染深度之差反投影到统一坐标系并展开,引导几何修正。网络预测几何修正与纹理 \([\delta G, T] = A(F_I, F_D, v)\)。训练额外使用部件分割损失与 ID-MRF 感知损失以促进高频纹理细节。
实验结果
在密集多视角棚拍的”松身 T 恤 + 长裙”序列上,与图像驱动合成基线及消融配置对比(整幅渲染图、双视角平均):
| 方法 | L1↓ | PSNR↑ | SSIM↑ | LPIPS↓ |
|---|---|---|---|---|
| DVA | 2.89 | 27.96 | 0.9218 | 0.0932 |
| DVA(两层变体) | 2.90 | 28.03 | 0.9219 | 0.0912 |
| ENeRF(Masked) | 3.07 | 27.21 | 0.9130 | 0.0772 |
| KeypointNeRF | 3.14 | 27.42 | 0.9111 | 0.1123 |
| 深度扭曲 + LookinGood UNet | 2.27 | 29.91 | 0.9382 | 0.0865 |
| 本文 去掉 N-ICP | 2.29 | 29.04 | 0.9299 | 0.0755 |
| 本文 去掉深度偏移 | 2.19 | 29.35 | 0.9327 | 0.0728 |
| 本文 去掉部件损失 | 2.11 | 29.63 | 0.9354 | 0.0724 |
| 本文 完整 | 1.93 | 30.25 | 0.9404 | 0.0686 |
完整方法在各项指标上均优于 DVA、生成式 NeRF(ENeRF、KeypointNeRF)与传感基线;消融显示 N-ICP 粗跟踪贡献最大,去掉后仅靠身体姿态初始化过粗、产生明显伪影,深度偏移特征与部件损失也各有增益。此外,与姿态驱动的 Clothing Codec Avatars、Dressing Avatars 在花纹短裙序列上对比(裙子区域指标),本文将裙区 L1 误差从约 25~28 降到 15.67,忠实度显著更高。N-ICP 相比 L-BFGS、非线性共轭梯度、Levenberg-Marquardt 等经典求解器收敛更快。方法还可直接泛化到背景与光照不同的新环境(九台 Kinect、取三路驱动),并可选微调以适配新外观。
亮点与局限
- 亮点:
- 把”显式化身先验 + 稠密 RGB-D 驱动信号”结合,实现对松散衣物动态的忠实重建,而非仅”看起来合理”。
- N-ICP 将神经网络作为优化求解器,显式利用残差与梯度,比经典非刚性 ICP 更快更鲁棒,且弱监督训练无需真值形变参数。
- 可泛化到不同背景/光照的新采集环境,逐帧跟踪避免误差累积。
- 局限:
- 训练依赖约 150 台相机的密集棚拍与 MVS 重建监督,数据采集成本高。
- 每套衣物/身份需单独训练,未面向跨身份泛化。
- 依赖身体姿态估计为 N-ICP 提供初始化,且松身衣物只建模大尺度形变,精细细节交由后续网络补足。
延伸思考
- 与 DVA、Clothing/Dressing Avatars 一脉相承,核心差异在”用可学习的粗跟踪换取更好的纹素对齐特征”,这一”粗到精 + 特征对齐”思路对其他传感驱动重建任务(头发、手部、非人物体)具有借鉴意义。
- “把网络当作迭代优化求解器、显式输入残差与梯度”的范式,与 learning-to-optimize 类工作呼应,可能扩展到更一般的非刚性配准与逆问题求解。
- 面向真实远程临场,如何降低采集与逐身份训练成本、走向少样本或跨身份泛化,以及在更稀疏/更嘈杂消费级传感器下保持忠实度,是值得追问的方向。