Conference

A Construct-Optimize Approach to Sparse View Synthesis without Camera Pose

Kaiwen Jiang, Yang Fu, Mukund Varma T., Yash Belhe, Xiaolong Wang, Hao Su, Ravi Ramamoorthi

University of California, San Diego

一句话总结

面对”图像稀疏且相机位姿未知”的新视角合成难题,本文不去从零拟合信号,而是借助单目深度把像素反投影到三维、用 3D 高斯逐视角”构建”出一个粗解,并在构建过程中通过检测二维对应点统一优化相机位姿与深度、辅以一种新的”期望表面”渲染,最终经低通滤波与标准优化精修,仅用三到六张宽基线视图即可超越依赖估计位姿的方法。

研究背景

NeRF 及其变体在新视角合成上表现出色,但普遍要求稠密拍摄与精确标注的相机位姿。位姿通常靠 COLMAP 这类运动恢复结构(SfM)预处理得到,而 SfM 在视图稀疏时脆弱易失败;即便勉强注册成功,欠采样带来的三维歧义仍让稀疏视角合成成为病态问题。3D Gaussian Splatting(3DGS)同样受制于 SfM 初始化过于稀疏而难以处理稀疏视角。

一个直觉的做法是先估位姿、再按单目深度把像素反投影进场景。但问题在于:真实拍摄中位姿与深度是紧耦合、互相依赖的,而单目深度估计并不利用位姿信息、位姿估计也不对齐单目深度,导致同一场景在不同视角下的反投影相互不一致。作者据此提出核心思路——把优化嵌入构建过程,称为”构建-优化”(construct-and-optimize)方法,从而无需预先已知相机位姿。

本文假设:给定一组按顺序连续拍摄、相邻帧有重叠的 RGB 图像及其单目深度,且相机内参已知,外参未知。

方法

整体框架

流程是渐进式的:从第一帧开始逐帧注册、调整、反投影,逐步搭建场景得到粗解,再统一精修。

flowchart LR
    A[有序 RGB 图像<br/>单目深度估计<br/>内参已知/外参未知] --> B[第一帧设为单位位姿<br/>反投影为 3D 高斯]
    B --> C[第 k+1 帧注册<br/>初始化为第 k 帧位姿<br/>检测 2D 对应点优化 P]
    C --> D[调整 Adjustment<br/>联合优化所有位姿与单目深度]
    D --> E[按对齐后深度反投影<br/>新增 3D 高斯]
    E -->|遍历全部视图| F[粗解]
    F --> G[低通滤波去高频伪影<br/>标准 3DGS 精修]

关键设计

统一的可微注册与调整。注册与调整都在同一优化框架下完成:注册只优化新视图位姿,调整则联合优化此前所有外参 \(\{P_1,\dots,P_k\}\)、单目深度 \(\{D_1,\dots,D_k\}\) 以及当前的 \(P_{k+1}\)、\(D_{k+1}\)。新视图位姿先初始化为上一已注册帧的位姿。

对应点监督。对宽基线的稀疏视角,逐像素监督只含短程信息、优化效果差。作者改用现成检测器在真值图像 \(I\) 与当前渲染图 \(I_{\text{render}}(P)\) 之间检测二维对应点,把长程信息引入优化。设 \(I\) 上对应点为 \(\kappa\)、渲染图上为 \(\kappa'\),用可微的期望表面渲染器把 \(\kappa'\) 处渲染成屏幕空间坐标 \(q(\kappa')\),令其匹配 \(\kappa\):

\[\mathcal{L}_{\text{corr}} = \sum_{i=1}^{M} \lVert q(\kappa'^{(i)}) - \kappa^{(i)} \rVert_1\]

其中 \(q(\kappa'^{(i)})\) 数值上等于 \(\kappa'^{(i)}\),但构成了向底层表示反传梯度的计算图。相比对失配敏感、难以平衡匹配数与 RANSAC 阈值的 PnP 求解,该优化框架更稳健。当位姿接近真值时,再叠加逐像素监督稳定优化:

\[\mathcal{L}_{\text{rgb}} = \lVert I - I_{\text{render}}(P) \rVert_1\]

深度对齐。调整阶段需把单目深度对齐到渲染深度。尺度一致假设并不总成立,作者放松该假设,改为逐基元学习一个独立的仿射变换。设渲染深度在 \(\kappa'\) 处为 \(b(\kappa')\)、单目深度在 \(\kappa\) 处为 \(d(\kappa)\),并对 \(b\) 停止梯度(\(\mathrm{sg}[\cdot]\)):

\[\mathcal{L}_{\text{depth}} = \sum_{i=1}^{M} \lVert \mathrm{sg}[b(\kappa'^{(i)})] - d(\kappa^{(i)}) \rVert_1\]

总目标为 \(\mathcal{L} = \lambda_1 \mathcal{L}_{\text{corr}} + \lambda_2 \mathcal{L}_{\text{rgb}} + \lambda_3 \mathcal{L}_{\text{depth}}\),取 \(\lambda_1=1000\)、\(\lambda_2=10\)、\(\lambda_3=1\),梯度回传到相机参数与重建场景。

可微期望表面渲染。对应点监督要求把二维屏幕点的扰动映射到对应三维表面点的扰动,但 3DGS 是体积表示、无显式表面。以往方法把每个高斯核内的表面近似为常数点(如高斯中心 \(\boldsymbol{\mu}_i\)),会导致期望表面点 \(\Psi(s)\) 无法投影回 \(s\),破坏优化所需的”一致性”。作者提出用椭球壳近似高斯核表面:把中心 \(\boldsymbol{\mu}_i\) 替换为依赖于 \(s\) 的更优近似 \(\hat{\boldsymbol{\mu}}_i(s)\),即当前光线与该椭球壳的交点。壳的半轴由仅依赖高斯尺度参数的积分决定,为高效求梯度而用线性函数近似该积分。由此期望表面点满足投影一致性:

\[\Psi(s) = \sum_{i,\,\hat{\boldsymbol{\mu}}_i(s)\neq\varnothing} \hat{\boldsymbol{\mu}}_i(s)\,\alpha_i(s) \prod_{j=1,\,\hat{\boldsymbol{\mu}}_j(s)\neq\varnothing}^{i-1} (1-\alpha_j(s))\]

反向传播上,由于交点 \(\hat{\boldsymbol{\mu}}_i(s)\) 写成 \(o + l\,d(s)\) 会在同时优化相机参数时发生梯度相消,作者将其重参数化为仅由椭球壳的中心、旋转、尺度决定的独立壳上点,使梯度正确传到壳的属性、再到相机参数与高斯核。

精修与实现。得到粗解后,先做低通滤波去除易错的高频重建——对每个视图中每个检测到的物体,用最远点采样只保留 10% 的反投影高斯,以惩罚密集簇、促进均匀分布;随后用标准 3DGS 优化并同步优化相机位姿。在 NVIDIA RTX 3080 上,注册加调整每个视图通常需数分钟且随视图增多而增加,标准精修约 1 小时;推理速度与 3DGS 相同。

实验结果

在 Tanks & Temples 上,本文在 3/6/12 视图下均优于无位姿方法,并超越依赖估计位姿的方法(以 3 视图为例,指标越大越好者 PSNR/SSIM,越小越好者 LPIPS):

方法 类型 PSNR ↑ SSIM ↑ LPIPS ↓
Instant-NGP 需位姿 15.31 0.42 0.56
3DGS 需位姿 15.21 0.46 0.43
FSGS 需位姿稀疏 19.23 0.58 0.37
NoPe-NeRF 无位姿 12.05 0.35 0.76
CF 3DGS 无位姿 14.91 0.43 0.43
本文 无位姿 20.37 0.66 0.26

在更具歧义、轨迹不平滑的 Static Hikes 数据集上,本文在 3/6 视图的 PSNR、SSIM、LPIPS 亦全面领先无位姿方法(如 3 视图 PSNR 16.35、LPIPS 0.37)。视图数量研究(”Horse”场景)显示,本文即便半数数据也超越 Instant-NGP 与 3DGS,且随视图增多稳步提升(3→60 视图 PSNR 由 21.54 升至 35.93)。消融(”Museum”,6 视图)中完整模型 PSNR 23.33,去掉对应点监督(Config-A,16.29)、替换期望表面渲染(Config-B,17.09)、跳过深度调整(Config-C,19.64)、直接用 SfM 位姿与原始深度反投影(Config-D,17.50)均明显更差,验证了各组件的必要性。此外,打乱训练图像顺序会减少相邻重叠、增加注册难度,使指标从 20.37/0.66/0.26 退化到 19.06/0.59/0.30。

亮点与局限

亮点:

  • 用”构建-优化”范式替代”从稀疏观测拟合复杂信号”,借助 3DGS 的显式性把稀疏无位姿合成变得更可解。
  • 把注册与调整统一进同一可微框架,用二维对应点引入长程梯度信息,比 PnP 更稳健,也无需预知相机位姿。
  • 提出椭球壳期望表面渲染,保证期望表面点投影回原屏幕点的一致性,并通过重参数化解决相机-高斯联合优化时的梯度相消。
  • 逐基元仿射变换放松了单目深度的尺度一致假设,使深度与位姿有效对齐。

局限:

  • 依赖相邻帧存在重叠、按顺序连续拍摄,图像顺序被打乱、重叠减少时注册难度上升、指标下降。
  • 假设内参已知;渐进式逐帧构建使注册加调整的耗时随视图数量增长。
  • 在歧义强、轨迹非平滑的场景(如 Static Hikes)指标相对偏低,仅 3 视图时结果仍有歧义,需 4 视图以上才明显改善。

延伸思考

这项工作把稀疏无位姿场景重建从”回归/拟合”思路转向”几何构建加对齐优化”,与同期依赖前馈网络在规范空间预测高斯的路线形成互补,共同推动了 pose-free 稀疏视角合成的发展。其可微椭球壳期望表面渲染,为在 3DGS 上做需要几何一致性的下游任务(如对应点驱动的位姿优化、SLAM、逆渲染)提供了比”常数点近似”更严谨的表面定义。而对帧间重叠与拍摄顺序的依赖,也提示后续可结合更强的匹配先验或全局对齐机制,向真正无序、宽基线、少重叠的稀疏采集迈进。