Journal

High-Fidelity 4D Cloth Capture Pipeline with a Two-Level Pattern

Ziheng Liu, Anka He Chen, Shu Chen, Yin Yang, Cem Yuksel, Jenny Han Lin

University of Utah; NVIDIA

SIGGRAPH 2026Reconstruction

一句话总结

用一套”稀疏 L 形标记 + 稠密噪声图案”的两级标记衣物,配合两阶段神经定位与基于物理的后处理,仅用 16 台 RGB 相机就实现了 1mm 空间分辨率、时序连贯且无自穿透的高保真 4D 布料捕捉。

研究背景

  • 领域现状:数据驱动方法(角色动画、虚拟试衣、数字时尚)越来越依赖真实布料动态数据。基于标记(marker-based)的捕捉在精度和分辨率上优于无标记方法,因为印在布料上的清晰标记极大简化了跨视角、跨时间的对应关系建立。
  • 核心痛点:高分辨率捕捉需要小而密的标记,而现有方法要么靠上百台相机(如 211 台)堆硬件来识别这些密集标记,成本高;要么在少相机下退化为静态特写或低分辨率动态捕捉。此外,自遮挡导致的缺失区域几乎不可避免,补全时既要物理合理、又要时空连贯、还要无自穿透,尤其在高分辨率、复杂自接触的衣物上极难同时满足。
  • 本文 idea:把”粗定位”和”精定位”解耦成两级标记与两阶段流水线——稀疏标记做鲁棒检测与朝向,再把每个标记单应变换(homography)到规范正方形,从而在规范坐标系里做亚像素级的稠密关键点定位;缺失与噪声则交给一个基于物理的优化后处理来补全并保证无穿透。

方法

整体框架:系统分两大块。前端是”两级标记图案 + 三个神经网络”的定位与三角化,从多视角 RGB 图像恢复出不完整的高密度 3D 点云;后端是基于物理的后处理,把一张模板网格逐帧形变去拟合捕捉数据,同时补全遮挡区域并全程保证无自穿透。

flowchart LR
  A["多视角 RGB 图像"] --> B["Marker Localizer<br/>检测 L 形标记四角"]
  B --> C["单应变换到规范正方形"]
  C --> D["Marker Recognizer<br/>识别标记 ID"]
  D --> E["Crosspoint Localizer<br/>定位 25x25 稠密交点"]
  E --> F["多视角三角化<br/>RANSAC + 拉普拉斯平滑"]
  F --> G["物理后处理<br/>VBD + OGC 形变模板网格"]
  G --> H["无穿透 4D 网格序列"]

关键设计:

  1. 两级标记图案。第一级是黄/品红交替、按棋盘布局的 L 形稀疏标记:交替色划分相邻标记边界,四个角作为唯一定位点,L 形朝向编码旋转信息。第二级在每个标记内叠加多频率高斯噪声生成的稠密图案,相邻最细层噪声元素的交点称为 crosspoint,每个标记含 \(25\times25\) 个,间距 6 像素、150 dpi 打印时对应约 1mm 物理分辨率。多频率设计的巧思在于:拍摄清晰时能提取最细层;模糊时高频成分相互抵消、露出较粗层,因而对运动模糊和失焦更鲁棒。

  2. 两阶段分层定位(三个网络)。Marker Localizer 用类 YOLO 结构把图像分格、判断标记中心是否落在格内并回归四个定位点。检测到的标记随后被单应变换成固定大小的规范正方形——这一步把透视畸变和大部分非刚性形变(拉伸、剪切)都因子分解掉了,而这些正是神经网络最难泛化的因素。Marker Recognizer 用 ResNet+MLP 把规范化后的标记图像分类到标记 ID。Crosspoint Localizer 则同时吃”矫正后的标记图 + 该标记的参考纹理”两路 CNN 特征,拼接后送入 U-Net,对每个交点输出可见性标志与 \((x,y)\) 坐标,最后用逆单应投回原图。让网络同时看参考纹理,使其无需死记每个标记外观,泛化更好。三个网络全部用合成数据训练(稠密特征点人工标注不可行),且 Localizer 类网络训练一次即可跨衣物复用,只有 Recognizer 在出现新标记时才需重训。

  3. 基于物理的后处理。建立在 Vertex Block Descent(VBD,高并行 GPU 求解器)和 Offset Geometric Contact(OGC,无穿透接触框架)之上,集成于 Newton 物理引擎。从一个无穿透的模板初始形状出发(模板直接由 2D 缝纫版片构造,天然无穿透),用类弹簧能量把每个重建顶点拉向其三角化目标位置,OGC 全程保证无自穿透;选一个重建率高、姿态接近模板的初始帧,向前向后传播到整段序列。

  4. 动态静止形状 + 多分辨率。为避免固定静止形状带来的伪影,对已捕捉区域用捕捉数据自身的二面角/形变梯度作为静止配置(弯曲与膜能量不再惩罚真实几何);对缺失区域用前一帧几何作静止形状以抑制时序抖动,并可再用前后帧平均做额外平滑。弹簧能量显著强于弯曲/膜能量,确保捕捉区忠实于观测。针对 VBD 在单个大自由度网格、大时间步下收敛慢的问题,采用多分辨率策略:先在数千顶点的粗网格上求全局形状,再逐级插值细化,让每级只需处理局部高频误差。

实验结果

作者做了四件衣物(长袖 T 恤、圆裙、连体衣、裤子,总成本不到 300 美元),用 16 台 4000×2160@30fps 相机、30 个柔光箱环绕捕捉,并用 SMPL+AMASS 驱动的合成数据训练网络。核心的流水线对比(表 1)最能体现方法价值:在仅 16 相机下达到毫米级分辨率与更优时序连贯性,并且是唯一保证无穿透的:

方法 相机数 分辨率 (mm)↓ 漂移率 (mm/s)↓ 无穿透
本文 16 1.06 0.75
Chen 等 2021 16 30 N/A
Halimi 等 2022 211 2.67 1.50

其余实验以文字补充:合成数据上全流水线每顶点平均误差 0.67mm,而只用粗标记的”coarse-only”退化配置为 1.10mm(误差增加 64%),验证了稠密层的必要性;消融中去掉单应矫正的”dense-only”配置定位误差从 0.075 像素恶化到 0.403 像素,说明粗标记提供的规范化矫正对亚像素定位至关重要。图案对模糊鲁棒:图像降采样到 4× 仍保持高恢复率与精度,8× 才明显退化。Crosspoint Localizer 分类准确率 99.36%、图像空间定位误差仅 0.075 像素。计算上后处理是主要瓶颈(裙子达 2.1M 顶点、每帧约 250 秒),流水线定位为离线数据采集而非实时。

亮点与局限

  • 亮点:
    • 两级”粗定位—精定位”解耦是核心巧思,用单应矫正把神经网络最怕的透视/非刚性形变消掉,让密集定位专注亚像素精度,从而仅 16 相机就做到 1mm 分辨率。
    • 把重建问题转化为”带无穿透约束的物理形变优化”,同时解决了缺失补全、噪声去穿透、时序连贯三件事,且全程保证无自穿透——这是相较前作的实质进步。
    • 多频率噪声图案对模糊自适应、网络全用合成数据训练且大部分可跨衣物复用,工程上很实用。
  • 局限:
    • 后处理极慢(百万级顶点每帧数百秒),完全是离线管线,无法实时。
    • 缝线处恢复率低:固定大小的方形标记塞不进接缝,拉链等非图案元素也会打断布料;细长或不规则版片同样难覆盖。
    • 单应近似假设每个标记区域近似平面,当褶皱大于单个标记尺寸时定位会退化;且方法仍依赖专门印制的标记衣物,通用性不如无标记方法。

延伸思考

  • 作者自己提到可把 Recognizer 进一步泛化为”单一网络直接适配多种衣物无需重训”,因为跨衣物识别准确率已很高;这指向一个真正即插即用的通用捕捉系统。
  • 后处理瓶颈值得专门优化——如何在保持高分辨率网格的同时加速无穿透优化,是一个明确的开放问题,可能结合更好的多分辨率/预条件或神经代理。
  • 该管线定位为”给数据驱动方法提供高质量运动样本”,与虚拟试衣、缝纫版片估计、Gaussian Splatting 等表示可以互补;高保真且无穿透的 4D 布料数据正是这些学习方法当前稀缺的训练资产。