Conference

Inovis: Instant Novel-View Synthesis

Mathias Harrer, Linus Franke, Laura Fink, Marc Stamminger, Tim Weyrich

Friedrich-Alexander-Universität Erlangen-Nürnberg

一句话总结

Inovis 把神经时空超采样的思路搬到新视角合成上,让一个免预处理、免逐场景训练的神经点云渲染器,能对着一个还在实时累积、覆盖稀疏的点云即时合成高保真新视角。

研究背景

  • 领域现状:新视角合成近年被神经方法(隐式的 NeRF 类、显式代理的点云/网格类)大幅推进,隐式方法用 MLP + 体渲染拟合连续表示,显式方法则借助几何代理把输入视图整合到目标视图。两类都出现了加速训练与推理的工作。
  • 核心痛点:现有方法几乎都依赖 a-priori 的场景完整性和对同一物体的反复观测,需要耗时的逐场景训练或预处理(数分钟到数小时)。这在”边采集边出图”的交互场景(如实时 LiDAR/RGBD 流、车载巡检、追踪镜头)里根本行不通——恰恰是刚被观测、覆盖最稀疏的区域最需要即时出图。
  • 本文 idea:作者观察到”从稀疏点云补全新视角”和”从粗输入做时空超采样”本质上都是在补缺失信息。于是把时空超采样架构改造过来:不再重采样历史渲染帧,而是重组多视图数据集中邻近的相机图像,在最新的点云表示引导下 warp 到目标帧再做神经插值,从而在不训练新场景的前提下即时合成新视角。

方法

整体框架:系统以一个 NPBG 风格的神经点云渲染器为主干,但关键在于它不只依赖融合出来的点云模型,还额外利用离目标视角很近的若干原始 RGBD 帧(称为 auxiliary views/辅助视图)。对每个目标帧,先选出邻近视图、编码成特征、在点云深度引导下 warp 到目标帧、用重加权网络融合,再与点云多分辨率渲染的特征拼接,交给 U-Net 重建网络出最终图像。整条流水线端到端对着真值训练。

flowchart LR
  PC["点云"] --> MR["多分辨率渲染"] --> FE1["特征编码"]
  AUX["邻近 RGBD 辅助视图"] --> SEL["视图选择"] --> FE2["特征编码"] --> WARP["点云深度引导 warp"]
  WARP --> RW["重加权网络"]
  FE1 --> CAT["特征拼接"]
  RW --> CAT
  CAT --> REC["U-Net 重建网络"] --> OUT["新视角图像"]

关键设计:

  1. 在线化的点云渲染主干:与 NPBG 把外观描述子离线优化不同,本文让点与图像属性尽量保持原始 RGB(D) 格式、特征只在推理时即时抽取,这样能配合动态输入与不断演化的模型,同时省内存以支持更大场景。目标视图先用一个每点一像素、带深度测试的 OpenGL 硬件渲染器渲成稀疏 RGBD,再在 1/2、1/4、1/8 三个较低分辨率上抽特征喂进多尺度 U-Net——粗层能学到更泛化的遮挡特征,也让特征抽取器见到更多样的点分布而更鲁棒。

  2. 辅助视图选择:从邻近捕获帧里选 \(n_{views}\) 个最相似的视图,依据一个位置因子 \(f_p\) 与视向因子 \(f_d\) 组合的相似度分数 \(s = f_p (1 + \alpha f_d)\),分数越低越好。其中 \(\alpha = 100\) 用来平衡两者,使约 10 米的距离惩罚与 90 度的视向偏差相当。视图从优到劣排序,引导网络更看重最近的视图。可选地把上一帧渲染结果也纳入候选,以缓解视频闪烁、提升时间连贯性(训练时不用历史帧)。

  3. 门控卷积特征编码 + warp:辅助视图用三级门控卷积(filter 数 16,输出 12 维特征)编码,编码时也捕获空间上下文,因此即便后续是稀疏的逐点重投影,也能保留邻域信息。门控卷积的可学习掩码专治稀疏深度图——它能识别出因缺深度而无法正确 warp 的区域,把可 warp 的信息”反向”扩散到邻近像素,类似小范围注意力机制。warp 时对目标视角可见的每个点,把它在辅助视图中反投影处的像素值(RGBD + 特征)搬到新位置;没有点覆盖的区域可选地把辅助图像 warp 到远处背景平面上,用于填天空、远景等无点区域。

  4. 重加权与重建网络:重加权网络(沿用时空超采样做法)读入 warp 后的辅助视图与目标渲染的 RGBD,为每个辅助视图算逐像素权重(缩放到 \([0, 10]\)),以此压制遮挡与 warp 伪影,比显式加权/补洞策略更好。加权后的特征拼接进一个五层 U-Net(各级 filter 均为 32,下采样用门控卷积 + max pooling,上采样用双线性 + 跳连),输出稳定的新视角。训练损失为 VGG16 感知损失加少量 SSIM(\(w_{vgg}=1\),\(w_{ssim}=0.25\)),后者用于消除表面上出现的规则纹样。

实验结果

主实验在 ScanNet、Redwood(摩托车/沙发)等未见场景上,与 SVS、IBR-Net、ADOP、NPBG++ 对比。除 ADOP 逐场景训练外,其余方法均不做逐场景微调。Inovis 在质量上稳定优于同为免/低预处理的 NPBG++,与 SVS 相当但渲染快得多;ADOP、IBR-Net 指标更好,但前者需约 6 小时逐场景训练、后者单帧渲染约 2 分钟,都不适合在线合成。

场景 / 方法 PSNR↑ LPIPS↓ SSIM↑
Motorcycle · Inovis 20.63 0.195 0.698
Motorcycle · NPBG++ 14.70 0.543 0.497
Motorcycle · SVS 19.21 0.273 0.658
Sofa · Inovis 24.19 0.187 0.769
Sofa · NPBG++ 17.02 0.392 0.637
Sofa · SVS 22.35 0.253 0.728
ScanNet · Inovis 22.78 0.309 0.792
ScanNet · NPBG++ 20.90 0.396 0.758
ScanNet · SVS 23.76 0.316 0.796

此外,Inovis 无需预处理,渲染约 131 ms(ScanNet 1296×968),交互帧率可达 960×540 下约 20 fps、1280×720 下约 11 fps。在模拟流式采集的对比中(给 ADOP、InstantNGP 与流逝时间相当的训练+渲染预算),Inovis 因无需训练、从一开始就产出高保真图像,在 time-to-image 上全面胜出。

亮点与局限

  • 亮点:
    • 免逐场景训练、免预处理,可直接对着实时累积、覆盖稀疏的点云即时出图,填补了在线新视角合成的空白。
    • 把时空超采样的特征编码与重加权思想迁移到新视角合成,能自我修正常见 warp 伪影;门控卷积巧妙处理稀疏深度。
    • 仅在点云里存 RGB、特征即时抽取,内存占用低,能扩展到数千万点的大场景,天然适配 LiDAR / RGBD / 立体相机等多种流式传感器。
  • 局限:
    • 泛化仍受”场景类别”约束——网络需先在同类场景上预训练(约 15–24 小时/V100),跨类别时质量存疑。
    • 纯指标上不及 ADOP、IBR-Net 等重预处理/慢渲染方法,是以质量换取即时性与通用性的折中。
    • 依赖外部 SLAM 提供实时位姿,且部分数据集邻近视图质量参差会带来闪烁,需靠引入历史帧缓解。

延伸思考

  • 方法把”新视角合成”与”神经超采样”统一为”补全缺失信息”的视角很有启发,这条类比或许还能延伸到视频插帧、时序重建等任务。
  • 相比同年兴起的 3D Gaussian Splatting,Inovis 走的是”点云 + 图像重组 + 神经插值”的免训练路线,二者在”是否需要逐场景优化”上形成鲜明对比;把辅助视图重组的思想与显式泼溅表示结合,可能在流式/增量重建场景里兼顾速度与质量。
  • 门控卷积对稀疏深度的”反向掩码”处理值得在其它稀疏输入(如稀疏视图 NeRF、稀疏 LiDAR 补全)中复用。