Super-Resolution Cloth Animation with Spatial and Temporal Coherence
Zhejiang University
问题背景
物理布料仿真是数字服装设计的核心,但在交互式应用里始终要在”精细褶皱”与”实时效率”之间做权衡。粗网格能高效地捕捉低频的整体运动,却因为离散化误差和线性有限元的锁死(locking)问题,无法表现细腻的高频褶皱;而直接在高分辨率网格上做仿真又太慢,难以满足实时需求。
一个自然的思路是”布料超分辨率”:用粗网格仿真低频特征,再补充生成高频褶皱细节到细网格上。但已有的准静态褶皱生成方法有一个被忽视的关键缺陷——不同分辨率下的低频特征本身就存在显著差异(源于离散化误差与锁死问题),如果直接把仿真得到的粗网格喂给超分辨率网络,就会因为输入的低频特征偏离真实细网格,导致生成质量下降。此外,逐帧独立生成还会带来时间上的不连贯(temporal incoherence),误差随帧累积后越来越难修正。
本文要解决的核心问题就是:如何在增强褶皱细节的同时,同时保证跨帧的空间一致性(低频特征对齐)和时间连贯性(褶皱随时间平滑演化)。
核心方法
作者提出一个通用框架,由两个基本模块、三个功能组件和一个关键的低维中间变量组成。低维中间变量用来连接两个模块,它封装低频特征、并驱动高频细节的生成;本文选择用一张显式的粗网格作为这个中间变量。
模块一:粗网格序列生成器(模拟器 + 校正器交替)
- 模拟器(Simulator):负责布料动力学。采用基于物理的仿真(相比纯神经网络更利于碰撞处理和泛化),生成粗网格序列。
- 校正器(Corrector):一个图神经网络(GNN),负责修正不同分辨率之间低频特征的偏差。它把模拟器输出的粗网格 \(M_c\) 校正为一个中间粗网格 \(M_{int}\),使其低频特征与真实细网格 \(M_f\) 对齐。
- 交替(Interleaving)策略:这是保证时间连贯性的关键。在第 \(t\) 帧,模拟器不是从上一帧的模拟粗网格 \(M_c^t\) 出发前进一步,而是从已校正的中间网格 \(M_{int}^t\) 出发得到 \(M_c^{t+1}\)。这样能即时打断误差在时间轴上的累积传播,也让校正器只需处理单步的即时误差,而不是不断膨胀的累积误差。
模块二:基于网格的超分辨率(MSR)
第三个功能组件负责把低维变量恢复成带有高频褶皱细节的细网格,实现从 20mm 到 2.5mm 的 8× 分辨率提升。因为在 2D 均匀网格上做分辨率操作比在 3D 三角网格上更方便,作者把 MSR 任务转化为图像超分辨率(ISR)问题:先把网格转成图像,用 ISR 网络(SwinIR)增强细节,再转回细网格。
技术细节
网格—图像互转与坐标图(Coordinate Map)
在 2D 材质空间建立均匀背景网格,每个格点对应一个 2.5mm 的像素。区别于以往用法线图(normal map)表达褶皱曲率的做法,本文用坐标图——直接把 3D 顶点坐标编码进图像三通道。原因是从法线图重建几何复杂且易产生伪影,而坐标图能让网络同时感知面外曲率(out-of-plane curvature)和面内应变(in-plane strain),从而正确处理如聚拢(gathering)这类复杂服装工艺。基于坐标图可用有限差分计算形变梯度与 Hessian:
\[g^u_{i,j} = (p_{i+1,j} - p_{i-1,j})/h, \quad g^v_{i,j} = (p_{i,j+1} - p_{i,j-1})/h\]
计算前会把 \(x, y, z\) 三个维度分别归一化到均匀分布,使网络对三个方向的敏感度一致。此外用边界掩码(boundary mask)标记像素是否含有有效信息。
GNN 校正器
遵循 Encode-Process-Decode 框架(类似 MESHGRAPHNET,但不考虑动态碰撞边)。编码器把粗网格转为图 \(G=(V,E)\),边上编码 2D 材质空间和 3D 世界空间的相对位移向量及其范数,节点上编码速度特征。处理器用带残差连接的 MLP 迭代更新边和节点嵌入:
\[e'_{ij} \leftarrow f_e(e_{ij}, v_i, v_j), \quad v'_i \leftarrow f_v\left(v_i, \sum_j e'_{ij}\right)\]
解码器输出每个节点的速度修正 \(p_i\),用 \(q'_i = q_i + p_i\) 更新得到 \(M_{int}\)。损失函数为 \(\mathcal{L}_{GNN} = |p_i - \bar{p}_i|\)。作者指出这个 GNN 校正器引入的是一种非物理的”补偿压缩能量”,几乎不影响动力学,但对解决锁死问题至关重要,机制上类似 Position-based Dynamics(PBD)。
ISR 网络与损失
基于 SwinIR(浅层特征、深层特征、高质量重建三部分,恰好对应低频/高频特征)。损失由两项组成:像素误差项与像素梯度约束项:
\[\mathcal{L}_{sp} = \mathcal{L}_{dist} + \mathcal{L}_{cons} = \alpha|I_f - I_{gt}| + \beta|G_f - G_{gt}|\]
梯度损失对复现局部约束(如 Ruffled Dress 的松紧带)非常关键。
初始化与重叠 patch
- 初始化策略:由于相邻帧网格形状接近,用上一帧的输出 \(I_f^{t-1}\) 作为当前帧预测的初始化,既加速收敛又增强时间连贯性。训练时对初始化数据用高斯核平滑并加入标准差 0.1mm 的噪声以增强鲁棒性。
- 重叠 patch:把每个版片图像切成等大的小 patch 分别送入 ISR,以适应多样的服装风格。相邻 patch 重叠两条像素线,并用拉普拉斯平滑处理重叠区,避免拼接处的不连续。
训练
GNN 用 Adam 训练 40 万步,采用 GNS 的训练噪声策略,并加入类似 Deep Fluid 的窗口 rollout 训练做第二阶段训练来抑制误差累积——rollout 约 1000 帧后仍能贴合真值。两个网络都采用 patch-based 训练以强调局部特征、提升泛化。硬件为单张 RTX 4090,GNN 朴素训练与 rollout 训练各约 2 天,ISR 约 2–4 天,用两台机器并行总计约 4 天。
实验结果
- 分辨率提升:从 20mm 粗网格提升到 2.5mm 细网格,实现 8× 提升,涵盖 Loungewear、Overcoat、Tea Dress、Ruffled Dress、Dress 等多种服装及 Three-Ball、Rabbit、Table 等布料场景。
- 空间一致性:通过顶点级欧氏距离色图可视化,大部分区域误差极小(呈蓝色),即使 Ruffled Dress、Tea Dress 的复杂褶皱区误差略高,仍保持高质量细节。
- 时间连贯性:Three-Ball 的 rollout 中,GNN 与 ISR 的误差均值和标准差在约 1000 帧后仍维持低位;Dress 在 50/150/250 帧误差都很小。
- 消融实验:交替策略对第一模块收敛至关重要(无交替时 GNN 损失无法降到 0.5mm 以下);ISR 初始化显著加速收敛;梯度损失对复现松紧带等局部约束不可或缺。
- 对比:相比 SOTA 方法 DDE(基于法线图),本文生成的法线图误差分布更小(\(\mathcal{N}_{ours}(0.0090, 0.0940^2)\) vs \(\mathcal{N}_{DDE}(0.0136, 0.1104^2)\)),重建网格更平滑;相比纯神经仿真方法 NCS 和 MGDDG,本文褶皱更真实、多层碰撞处理更容易,且对未见运动更鲁棒。
- 泛化性:对不同 avatar 运动(训练/测试用不同动作序列)泛化良好;为 Dress 训练的 ISR 可迁移到 Loungewear、Overcoat;对厚皮革等不同织物也有效。
- 性能:GNN 校正器速度与粗网格模拟器相当,第一模块可达约 30 FPS 实时;瓶颈在 ISR 模块(SwinIR),约 3 FPS。通过每 10 个时间步做一次 ISR,超分辨率动画整体耗时可缩短约 2–3 倍。
贡献与局限
主要贡献
- 提出一个通用的超分辨率布料动画框架,通过交替模拟器与校正器来对齐不同分辨率的低频特征,保证生成褶皱的空间与时间一致性;
- 用 GNN 校正器防止仿真误差传播,用 ISR 网络在三角网格上生成高质量褶皱细节;
- 引入 ISR 初始化策略提升褶皱时间连贯性,并用重叠 patch 增强对多样服装风格的适应性与几何连续性;
- 首创性地把 SOTA 的图像超分辨率方法应用到高质量布料动画的 MSR 任务,并用坐标图取代法线图,使网络能同时感知面内应变与面外曲率。
局限
- 训练效率不高(两网络合计约 4 天);ISR 模块(SwinIR)是推理瓶颈,只有约 3 FPS,难以支持完整实时;
- 未做碰撞后处理,少量情况下仍会出现对人体的穿透和自穿透;网格转图像时缺乏抗锯齿,折痕处(如 Loungewear 领口)有锯齿伪影;
- 不考虑织物属性(膜刚度、弯曲刚度),织物一变就要重新训练两个网络;
- GNN 校正器的泛化受限于特定网格拓扑,目前需为每件服装单独训练校正器;
- 框架与特定模拟器绑定,替换为 Projective Dynamics 等其他模拟器时结果会偏离真值(但仍优于粗仿真输入)。
未来方向:将可微分学习式模拟器与校正器结合,把第一模块统一进单个神经网络;借助如 Zhang et al. 2022c 的方法进一步提升 ISR 推理效率。