VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors
Tsinghua University; Kuaishou Technology; Wayne State University
一句话总结
VidSplat 用预训练视频扩散模型作为几何先验,通过一套免训练、分阶段的去噪策略迭代地”生成”缺失视角并补进重建流程,从而只用极稀疏(甚至单张)输入图像就恢复出完整、高保真的 3D 场景表面。
研究背景
- 领域现状:NeRF 与 3D Gaussian Splatting(3DGS)已成为多视图表面重建的主流范式。围绕稀疏视角,一类可泛化方法在大规模数据上预训练学习跨视图对应,另一类过拟合方法给单场景引入点云、法向、多视图立体等几何先验。
- 核心痛点:现有方法的优化都重度依赖多视图光度一致性,在稀疏输入下变成欠约束的病态问题;更关键的是它们只能恢复输入视角”看得见”的区域,无法推断视野之外、被遮挡或弱约束的区域,导致表面残缺、破碎。已有引入生成先验的做法又需要昂贵的 I2I / V2V 微调,且在外插视角上往往留下空洞、渲染好看但底层几何不一致。
- 本文 idea:借用在海量视频上预训练、天然编码了丰富几何与视角先验的通用视频扩散模型,沿采样出的相机轨迹”生成”新视角来补足覆盖,并把生成结果迭代地融入 3DGS 重建。关键是让生成保持 3D 一致,并把它无缝接进重建循环。
方法
整体框架:给定稀疏输入视角,先用 DUSt3R 初始化点云并建立 2D Gaussians;随后进入迭代循环——采样朝向欠覆盖区域的相机轨迹,用渲染出的 RGB 与 mask 图像喂给相机可控的视频扩散模型(VDM)合成新视角,再把新视角回灌到点云初始化与 Gaussian 训练中,逐轮扩大场景覆盖,最后用 marching tetrahedra 提取表面。整个过程免训练(不微调扩散模型与重建骨干)。
flowchart LR
A["稀疏输入视角"] --> B["DUSt3R 初始化点云 + 2D Gaussians"]
B --> C["可见性相机轨迹采样"]
C --> D["渲染 RGB 与 Mask"]
D --> E["几何引导分阶段去噪 VDM 生成新视角"]
E --> F["融合新视角: 补全点云 / 置信度加权训练"]
F --> C
F --> G["Marching Tetrahedra 提取表面"]
关键设计:
-
几何引导的分阶段去噪(3D 一致生成的核心)。采用免训练的相机可控生成:对渲染图做扩散反演得到含相机运动布局先验的噪声潜变量,无需注入层即可实现相机控制。但纯去噪会引入内容漂移,于是借鉴图像 inpainting 的思路,用已知区域的渲染参考去纠偏。每步把当前去噪潜变量 \(x'_{t-1}\) 与参考反演潜变量 \(x^{ref}_{t-1}\) 按空间 mask 混合:\(x_{t-1} = M(t)\,x^{ref}_{t-1} + (1-M(t))\,x'_{t-1}\)。\(M(t)\) 按三阶段调度:早期(高噪声)严格锚定渲染参考以确立结构、抑制动态与漂移;中期线性放松约束;末期完全释放,用于修复渲染瑕疵、合成真实局部细节。
-
可见性相机位姿采样。为了探索未覆盖区域又保留可靠几何参考,对每个输入视角求相机光线与场景表面的交点,让虚拟相机在球面上绕该点构造多条候选轨迹。用关键帧的深度与 mask 判定轨迹是否合格:\(S_{low} < \text{area}(M_i) < S_{high}\) 且最近深度 \(\min_{p} D_i(p) > d_0\),即既要有适度的新区域覆盖、又要避开近平面遮挡(相机穿出场景边界被墙/地面挡住)。生成时刻意把轨迹延长 25% 再丢弃尾帧,因为尾帧常因误差累积出现幻觉;再从中挑选清晰、位姿变化大的关键帧。
-
生成结果融入重建。训练阶段 RGB 由 Gaussian 光栅化得到,mask 则用周期性评估的网格做光线追踪计算,而非用 Gaussian 的 alpha 图(后者在未见区域因图元过大易产生伪影)。生成视角无法用于重新初始化,故用单目深度反投影生成额外 Gaussian 中心;这些新图元初始未必对齐,但在优化中逐渐精修对齐。
-
损失函数。总损失 \(L = L_{input} + L_{gen}\)。输入视角用光度损失、2DGS/MAtCha 正则项与法向先验损失 \(L_n = \lvert 1 - N^T \hat{N} \rvert\)。生成视角把光度损失换成 Laplacian 损失以缓解高频细节伪影,并乘上一张由点云融合得到的逐像素置信度图 \(U\),做置信度加权监督。
实验结果
实现上以 Wan2.1 I2V 为视频扩散骨干、MAtCha 为表面重建骨干;在 TanksAndTemples(5 视角)、Replica(10 视角)、DL3DV(6 视角)上评测。下面是稀疏视角表面重建精度的主实验对比(TNT 与 Replica,↓越低越好、↑越高越好):
| 方法 | TNT CD↓ | TNT F-Score↑ | Replica CD↓ | Replica NC↑ | Replica F-Score↑ |
|---|---|---|---|---|---|
| 本文 VidSplat | 0.66 | 12.80 | 0.06 | 88.42 | 80.79 |
| MAtCha | 0.84 | 6.47 | 0.08 | 83.18 | 71.77 |
| GuidedVD | 0.81 | 2.91 | 0.12 | 67.91 | 40.45 |
| FSGS | 0.93 | 3.00 | 0.12 | 67.36 | 39.46 |
| DIFIX3D+ | 0.82 | 0.21 | 0.70 | 51.11 | 4.77 |
VidSplat 在所有指标上明显领先,F-Score 大幅超出次优方法。新视角合成上(DL3DV 6 视角),无论室内还是室外场景,PSNR/SSIM/LPIPS 均取得最好成绩(室内 PSNR 19.78、室外 17.49)。视频生成质量对比中,相较 CamTrol、ViewCrafter、TrajectoryCrafter 等相机可控生成方法,本文在渲染一致性(PSNR/SSIM/LPIPS)与生成多样性(FID/FVD)上都更优。
消融方面:去掉几何引导(w/o Guiding)生成虽视觉合理但 3D 严重不一致(FID 从 56.42 恶化到 89.24);只保留第一阶段约束(Only Stage1)则无法修复渲染瑕疵、填不上缺失区域。初始化补全与训练补全两个模块均有效,二者齐备时 Replica 的 F-Score 从 72.10 升至 80.80。更换更早的视频骨干(HunyuanVideo 1.0、SVD)仍优于现有方法,说明策略对不同基座鲁棒、无需针对性微调。
亮点与局限
- 亮点:
- 免训练、免微调即可把通用视频扩散先验接入稀疏视角重建,摆脱了昂贵的 I2I/V2V 训练。
- 分阶段去噪把”结构锚定”与”细节修复”解耦,有效压制内容漂移与幻觉,显著提升生成的 3D 一致性。
- 能推断输入视野之外的区域,实现真正”完整”的场景恢复,甚至支持单张图像重建,泛化性强。
- 对视频骨干选择鲁棒(Wan2.1 / Hunyuan / SVD 均可用)。
- 局限:
- 依赖 DUSt3R 初始化与单目深度反投影,生成新 Gaussian 初始位置可能不准,需靠优化逐步对齐。
- 迭代生成+重建流程较重(15000 迭代、多轮网格评估与视频生成),生成模型推理成本高。
- 生成质量最终受限于视频扩散模型的先验;尾帧幻觉靠”延长 25% 再截断”的经验策略缓解,超参(\(S_{low}, S_{high}, d_0\) 等)需预设。
- 真实稀疏视角的曝光不一致需额外用 BracketDiffusion 预处理才能缓解。
延伸思考
VidSplat 展示了”生成即补全”的重建范式:把视频扩散当作可查询的几何先验库,而不是端到端训练目标,这条免训练路线降低了落地门槛。它与 GuidedVD、DIFIX3D+ 等”生成先验做新视角监督”的工作同源,但把重点从”修复插值视角”推向”外插未见区域并保证几何一致”。值得追问的方向包括:分阶段 mask 调度能否自适应场景/噪声而非固定超参;如何降低多轮扩散推理的时间成本使之接近实时;以及在动态场景或大范围室外场景下,视频先验的几何一致性能维持到多大尺度。对做稀疏重建或生成式 3D 的研究者,这套”轨迹采样—几何引导生成—置信度加权融合”的循环框架具有较强的可复用性。