MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis
The Chinese University of Hong Kong, Shenzhen
一句话总结
MV-Performer 把预训练的视频扩散模型 Wan2.1 改造成多视角同步生成器,仅用单目正面全身视频作为输入,就能合成 360 度环绕、视角一致且时序连贯的 4D 人体新视角视频。
研究背景
4D 人体新视角合成在影视制作、AR/VR、沉浸式媒体中有广泛需求。传统做法要么依赖标定好的同步多相机阵列(成本高、部署复杂),要么用 NeRF/3DGS 从单目视频重建(对未观测区域难以补全,且优化耗时长)。
近期视频扩散模型展现出充当隐式 4D 新视角合成器的潜力,主要有两条技术路线:一是把相机位姿嵌入注入网络(如 Plücker 射线),但收敛慢,且需要训练集里有密集视角才能泛化;二是用深度做图像 warping 再做视频修补(inpainting),但难以应对大幅度视角变化。作者指出这两条路线在人体场景下失败的两个核心原因:\((i)\) 单目输入提供的 3D 线索不足,后视角的 warping 条件对前后朝向存在歧义;\((ii)\) 单目深度估计不准,视角变化大时 warping 会产生”漂浮物”(floater)伪影。
本文聚焦人体这一子领域,主张利用 MVHumanNet 这类多视角人体数据集,配合信息量更充分的条件信号来实现真正的 360 度同步多视角合成。
方法
整体框架
MV-Performer 以单目正面全身视频 \(V_{ref}\)(含 \(f\) 帧)为输入,目标是合成 \(m\) 路同步的新视角人体视频 \(\lbrace V_1, V_2, ..., V_m \rbrace\)。整体流程:先估计并精化深度得到彩色点云,把点云 warping 渲染到各目标视角作为几何条件,再送入基于 Wan2.1 改造的多视角视频扩散模型完成生成。
flowchart TD
A[单目正面视频 V_ref] --> B[MegaSaM 估计粗糙度量深度与相机参数]
A --> C[Sapiens 估计高质量相对深度与法线]
B --> D[深度对齐与精化得到干净点云]
C --> D
D --> E[已知相机参数 RGBD warping]
E --> F[各视角部分渲染 P_i]
E --> G[相机相关法线图 N_i]
F --> H[Wan2.1 3D-VAE 编码为几何条件]
G --> H
H --> I[多视角 DiT: Ref Attention + Sync Attention]
A --> J[参考潜变量 Z_ref]
J --> I
I --> K[WAN 解码得到多视角同步视频]
关键设计
-
深度 warping 几何条件:给定正面 RGB 图、度量深度 \(D\) 与相机内外参,先反投影得到世界坐标下的彩色部分点云 \(X(u) = R^{-1}D(u)K^{-1}u\),再按目标相机把点云渲染到各新视角,得到部分渲染 \(\lbrace P_1, ..., P_m \rbrace\)。相比隐式相机嵌入,显式几何先验更适合视角有限(32~60 个固定机位)的多视角数据集。
-
相机相关法线图条件:为解决大视角下前后朝向的歧义,作者对每个点计算法线 \(\vec{n}\) 与相机朝向 \(\vec{d}\) 的点积 \(o = \vec{n} \cdot \vec{d}\)。\(o > 0\) 表示表面朝向相机,\(o < 0\) 表示背对相机;把朝向相机的法线映射到 RGB,把背向区域涂黑遮蔽。这样既凸显几何结构又传达精确的朝向线索,是实现 360 度合成的关键。
-
Ref Attention 与 Sync Attention:在每个 DiT block 中加入两种机制。Ref Attention 用当前潜变量 \(Z_{in}\) 作 query、参考潜变量 \(Z_{ref}\) 作 key/value 做交叉注意力,补偿遮挡丢失的信息,\(Z_{out} = Z_{in} + proj(cross\_attn(Z_{in}, Z_{ref}))\);为简化设计复用了原有的文本交叉注意力层。Sync Attention 对拼接后的多视角潜变量 \(Z_{in} = concat(Z^{ref}_{in}, Z^1_{in}, ..., Z^m_{in})\) 做帧级空间自注意力,聚合跨视角信息以保证同步一致,且不引入相机位姿嵌入。
-
鲁棒的野外推理:针对野外视频深度估计不准的问题,用 MegaSaM 得到粗糙度量深度 \(\hat{D}_i\) 与相机参数、Sapiens 得到高质量相对深度 \(\tilde{D}_i\) 与法线 \(\tilde{N}\);先用最小二乘闭式解对齐尺度与偏移 \(\arg\min_{\alpha,\beta} \lvert\lvert(\alpha \cdot \tilde{D}_i + \beta) - \hat{D}_i\rvert\rvert^2\),再用法线进一步优化对齐后的深度,从而抑制漂浮物伪影、产生干净的几何条件。训练上采用渐进策略:先训视频修补(5 epoch),再冻结其他模块只训同步模块(5 epoch)。
实验结果
在 MVHumanNet 和 DNA-Rendering 两个多视角人体数据集上,与相机可控视频扩散模型 TrajectoryCrafter、ReCamMaster(含在 MVHumanNet 上微调的 ReCamMaster*)以及人体图像动画方法 Champ 对比。
| 数据集 / 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | FID ↓ | FVD ↓ |
|---|---|---|---|---|---|
| MVHumanNet · Champ | 11.23 | 0.813 | 0.328 | 55.92 | 5.54 |
| MVHumanNet · ReCamMaster | 6.97 | 0.600 | 0.620 | 154.03 | 10.78 |
| MVHumanNet · ReCamMaster* | 11.62 | 0.817 | 0.287 | 26.44 | 2.17 |
| MVHumanNet · TrajectoryCrafter | 4.18 | 0.493 | 0.722 | 154.00 | 17.25 |
| MVHumanNet · Ours | 24.35 | 0.926 | 0.066 | 24.47 | 0.12 |
| DNA-Rendering · Champ | 9.08 | 0.750 | 0.399 | 58.59 | 4.73 |
| DNA-Rendering · ReCamMaster | 6.46 | 0.595 | 0.602 | 138.25 | 7.80 |
| DNA-Rendering · ReCamMaster* | 10.02 | 0.769 | 0.342 | 36.78 | 4.28 |
| DNA-Rendering · TrajectoryCrafter | 4.72 | 0.498 | 0.758 | 154.66 | 15.52 |
| DNA-Rendering · Ours | 15.63 | 0.861 | 0.152 | 30.05 | 0.73 |
MV-Performer 在所有指标上大幅领先,尤其 FVD 显著优于基线,说明生成视频的时序与跨视角一致性更好;正面生成结果几乎与真值逐像素对齐,背面服饰纹理由扩散模型合理想象。消融实验进一步验证:去掉法线条件、去掉同步模块都会导致指标退化(FID 从 30.05 分别升到 36.60、38.96);采样步数上,25~50 步在质量与开销间取得平衡。全流程可在 24G 显存(如 RTX3090)上同时生成约 10 路 49 帧视频。
亮点与局限
亮点:
- 首个把单目人体视频转成密集多视角同步视频的生成式框架,实现真正的 360 度环绕合成。
- 用相机相关法线图巧妙化解大视角下的前后朝向歧义,是显式 warping 范式能扩展到 360 度的关键。
- Ref/Sync 双注意力设计简洁,尽量复用 Wan2.1 已有结构,训练与部署代价可控。
- 面向野外的深度精化流程显著提升鲁棒性。
局限:
- 仅接受正面全身视频输入,背面纹理为模型想象,与真值存在差异(作者也承认”合理但非精确”)。
- 依赖 MVHumanNet 等多视角数据集训练,视角分布受限于机位设置。
- 生成质量高度依赖深度估计与精化质量,深度不准仍会带来伪影。
- 缺少与 Human4DiT、Disco4D 等方法的直接对比(因无开源代码或复现成本高)。
延伸思考
- 显式几何条件(点云 warping + 法线朝向)相比隐式相机嵌入,在训练视角稀疏时更易泛化,这一思路对其他”数据有限但需大视角外推”的生成任务(如物体、场景级 4D 合成)具有借鉴价值。
- 背面纹理靠扩散模型”想象”填补,如何在保证真实感的同时提升与真人身份/服饰的一致性,是走向可信数字人的关键瓶颈。
- 把视频扩散模型的先验当作”隐式渲染器”配合几何条件驱动,是当前 4D 生成的重要范式;未来若能减少对度量深度精度的依赖、或引入自监督的几何一致性约束,有望进一步提升野外鲁棒性。