A Construct-Optimize Approach to Sparse View Synthesis without Camera Pose
University of California, San Diego
一句话总结
面对”图像稀疏且相机位姿未知”的新视角合成难题,本文不去从零拟合信号,而是借助单目深度把像素反投影到三维、用 3D 高斯逐视角”构建”出一个粗解,并在构建过程中通过检测二维对应点统一优化相机位姿与深度、辅以一种新的”期望表面”渲染,最终经低通滤波与标准优化精修,仅用三到六张宽基线视图即可超越依赖估计位姿的方法。
研究背景
NeRF 及其变体在新视角合成上表现出色,但普遍要求稠密拍摄与精确标注的相机位姿。位姿通常靠 COLMAP 这类运动恢复结构(SfM)预处理得到,而 SfM 在视图稀疏时脆弱易失败;即便勉强注册成功,欠采样带来的三维歧义仍让稀疏视角合成成为病态问题。3D Gaussian Splatting(3DGS)同样受制于 SfM 初始化过于稀疏而难以处理稀疏视角。
一个直觉的做法是先估位姿、再按单目深度把像素反投影进场景。但问题在于:真实拍摄中位姿与深度是紧耦合、互相依赖的,而单目深度估计并不利用位姿信息、位姿估计也不对齐单目深度,导致同一场景在不同视角下的反投影相互不一致。作者据此提出核心思路——把优化嵌入构建过程,称为”构建-优化”(construct-and-optimize)方法,从而无需预先已知相机位姿。
本文假设:给定一组按顺序连续拍摄、相邻帧有重叠的 RGB 图像及其单目深度,且相机内参已知,外参未知。
方法
整体框架
流程是渐进式的:从第一帧开始逐帧注册、调整、反投影,逐步搭建场景得到粗解,再统一精修。
flowchart LR
A[有序 RGB 图像<br/>单目深度估计<br/>内参已知/外参未知] --> B[第一帧设为单位位姿<br/>反投影为 3D 高斯]
B --> C[第 k+1 帧注册<br/>初始化为第 k 帧位姿<br/>检测 2D 对应点优化 P]
C --> D[调整 Adjustment<br/>联合优化所有位姿与单目深度]
D --> E[按对齐后深度反投影<br/>新增 3D 高斯]
E -->|遍历全部视图| F[粗解]
F --> G[低通滤波去高频伪影<br/>标准 3DGS 精修]
关键设计
统一的可微注册与调整。注册与调整都在同一优化框架下完成:注册只优化新视图位姿,调整则联合优化此前所有外参 \(\{P_1,\dots,P_k\}\)、单目深度 \(\{D_1,\dots,D_k\}\) 以及当前的 \(P_{k+1}\)、\(D_{k+1}\)。新视图位姿先初始化为上一已注册帧的位姿。
对应点监督。对宽基线的稀疏视角,逐像素监督只含短程信息、优化效果差。作者改用现成检测器在真值图像 \(I\) 与当前渲染图 \(I_{\text{render}}(P)\) 之间检测二维对应点,把长程信息引入优化。设 \(I\) 上对应点为 \(\kappa\)、渲染图上为 \(\kappa'\),用可微的期望表面渲染器把 \(\kappa'\) 处渲染成屏幕空间坐标 \(q(\kappa')\),令其匹配 \(\kappa\):
\[\mathcal{L}_{\text{corr}} = \sum_{i=1}^{M} \lVert q(\kappa'^{(i)}) - \kappa^{(i)} \rVert_1\]
其中 \(q(\kappa'^{(i)})\) 数值上等于 \(\kappa'^{(i)}\),但构成了向底层表示反传梯度的计算图。相比对失配敏感、难以平衡匹配数与 RANSAC 阈值的 PnP 求解,该优化框架更稳健。当位姿接近真值时,再叠加逐像素监督稳定优化:
\[\mathcal{L}_{\text{rgb}} = \lVert I - I_{\text{render}}(P) \rVert_1\]
深度对齐。调整阶段需把单目深度对齐到渲染深度。尺度一致假设并不总成立,作者放松该假设,改为逐基元学习一个独立的仿射变换。设渲染深度在 \(\kappa'\) 处为 \(b(\kappa')\)、单目深度在 \(\kappa\) 处为 \(d(\kappa)\),并对 \(b\) 停止梯度(\(\mathrm{sg}[\cdot]\)):
\[\mathcal{L}_{\text{depth}} = \sum_{i=1}^{M} \lVert \mathrm{sg}[b(\kappa'^{(i)})] - d(\kappa^{(i)}) \rVert_1\]
总目标为 \(\mathcal{L} = \lambda_1 \mathcal{L}_{\text{corr}} + \lambda_2 \mathcal{L}_{\text{rgb}} + \lambda_3 \mathcal{L}_{\text{depth}}\),取 \(\lambda_1=1000\)、\(\lambda_2=10\)、\(\lambda_3=1\),梯度回传到相机参数与重建场景。
可微期望表面渲染。对应点监督要求把二维屏幕点的扰动映射到对应三维表面点的扰动,但 3DGS 是体积表示、无显式表面。以往方法把每个高斯核内的表面近似为常数点(如高斯中心 \(\boldsymbol{\mu}_i\)),会导致期望表面点 \(\Psi(s)\) 无法投影回 \(s\),破坏优化所需的”一致性”。作者提出用椭球壳近似高斯核表面:把中心 \(\boldsymbol{\mu}_i\) 替换为依赖于 \(s\) 的更优近似 \(\hat{\boldsymbol{\mu}}_i(s)\),即当前光线与该椭球壳的交点。壳的半轴由仅依赖高斯尺度参数的积分决定,为高效求梯度而用线性函数近似该积分。由此期望表面点满足投影一致性:
\[\Psi(s) = \sum_{i,\,\hat{\boldsymbol{\mu}}_i(s)\neq\varnothing} \hat{\boldsymbol{\mu}}_i(s)\,\alpha_i(s) \prod_{j=1,\,\hat{\boldsymbol{\mu}}_j(s)\neq\varnothing}^{i-1} (1-\alpha_j(s))\]
反向传播上,由于交点 \(\hat{\boldsymbol{\mu}}_i(s)\) 写成 \(o + l\,d(s)\) 会在同时优化相机参数时发生梯度相消,作者将其重参数化为仅由椭球壳的中心、旋转、尺度决定的独立壳上点,使梯度正确传到壳的属性、再到相机参数与高斯核。
精修与实现。得到粗解后,先做低通滤波去除易错的高频重建——对每个视图中每个检测到的物体,用最远点采样只保留 10% 的反投影高斯,以惩罚密集簇、促进均匀分布;随后用标准 3DGS 优化并同步优化相机位姿。在 NVIDIA RTX 3080 上,注册加调整每个视图通常需数分钟且随视图增多而增加,标准精修约 1 小时;推理速度与 3DGS 相同。
实验结果
在 Tanks & Temples 上,本文在 3/6/12 视图下均优于无位姿方法,并超越依赖估计位姿的方法(以 3 视图为例,指标越大越好者 PSNR/SSIM,越小越好者 LPIPS):
| 方法 | 类型 | PSNR ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|---|
| Instant-NGP | 需位姿 | 15.31 | 0.42 | 0.56 |
| 3DGS | 需位姿 | 15.21 | 0.46 | 0.43 |
| FSGS | 需位姿稀疏 | 19.23 | 0.58 | 0.37 |
| NoPe-NeRF | 无位姿 | 12.05 | 0.35 | 0.76 |
| CF 3DGS | 无位姿 | 14.91 | 0.43 | 0.43 |
| 本文 | 无位姿 | 20.37 | 0.66 | 0.26 |
在更具歧义、轨迹不平滑的 Static Hikes 数据集上,本文在 3/6 视图的 PSNR、SSIM、LPIPS 亦全面领先无位姿方法(如 3 视图 PSNR 16.35、LPIPS 0.37)。视图数量研究(”Horse”场景)显示,本文即便半数数据也超越 Instant-NGP 与 3DGS,且随视图增多稳步提升(3→60 视图 PSNR 由 21.54 升至 35.93)。消融(”Museum”,6 视图)中完整模型 PSNR 23.33,去掉对应点监督(Config-A,16.29)、替换期望表面渲染(Config-B,17.09)、跳过深度调整(Config-C,19.64)、直接用 SfM 位姿与原始深度反投影(Config-D,17.50)均明显更差,验证了各组件的必要性。此外,打乱训练图像顺序会减少相邻重叠、增加注册难度,使指标从 20.37/0.66/0.26 退化到 19.06/0.59/0.30。
亮点与局限
亮点:
- 用”构建-优化”范式替代”从稀疏观测拟合复杂信号”,借助 3DGS 的显式性把稀疏无位姿合成变得更可解。
- 把注册与调整统一进同一可微框架,用二维对应点引入长程梯度信息,比 PnP 更稳健,也无需预知相机位姿。
- 提出椭球壳期望表面渲染,保证期望表面点投影回原屏幕点的一致性,并通过重参数化解决相机-高斯联合优化时的梯度相消。
- 逐基元仿射变换放松了单目深度的尺度一致假设,使深度与位姿有效对齐。
局限:
- 依赖相邻帧存在重叠、按顺序连续拍摄,图像顺序被打乱、重叠减少时注册难度上升、指标下降。
- 假设内参已知;渐进式逐帧构建使注册加调整的耗时随视图数量增长。
- 在歧义强、轨迹非平滑的场景(如 Static Hikes)指标相对偏低,仅 3 视图时结果仍有歧义,需 4 视图以上才明显改善。
延伸思考
这项工作把稀疏无位姿场景重建从”回归/拟合”思路转向”几何构建加对齐优化”,与同期依赖前馈网络在规范空间预测高斯的路线形成互补,共同推动了 pose-free 稀疏视角合成的发展。其可微椭球壳期望表面渲染,为在 3DGS 上做需要几何一致性的下游任务(如对应点驱动的位姿优化、SLAM、逆渲染)提供了比”常数点近似”更严谨的表面定义。而对帧间重叠与拍摄顺序的依赖,也提示后续可结合更强的匹配先验或全局对齐机制,向真正无序、宽基线、少重叠的稀疏采集迈进。