Conference

360° Reconstruction From a Single Image Using Space Carved Outpainting

Nuri Ryu, Minsu Gong, Geonung Kim, Joo-Haeng Lee, Sunghyun Cho

POSTECH

一句话总结

POP3D 通过”渐进式外绘(progressive outpainting)”,把单张 RGB 图像逐步补全成覆盖完整 360° 视角的伪真值多视图数据集,再用神经隐式表面重建出高保真的三维形状与外观。

研究背景

  • 领域现状:从单张图像重建三维模型意义重大(很多物体只有一张视图或来自 2D 生成模型),近期工作大量借助大规模图像先验(如 2D 扩散模型)配合蒸馏损失(score distillation)来补全不可见区域。
  • 核心痛点:现有方法有两大问题。一是泛化性差——依赖 3D 数据或特定类别训练的方法难以覆盖任意类别的野外图像;二是保真度低——用蒸馏损失的并发工作会让蒸馏损失与输入视图的 RGB 重建损失互相干扰,导致输入视图都重建不像,且目标分辨率偏低(如 \(96\times96\)、\(128\times128\)),再加上朴素的神经密度场缺乏明确表面阈值,产出的几何噪声大、雾状伪影多。
  • 本文 idea:不直接用蒸馏损失去”梦出”背面,而是围绕物体逐步移动相机,用空间雕刻(space carving)算出每个新视角”该补哪块”,再用条件扩散模型把这块外绘出来,逐步累积成一套高质量的多视图伪真值数据集;有了多视图数据后,就能用成熟的多视图重建策略(神经隐式表面)得到高保真结果。

方法

整体框架:POP3D 以单张 RGB 输入初始化一个三维模型,然后进入一个绕物体一周的循环——每一步移动相机到新视角、用空间雕刻求出待外绘的掩码、用扩散模型外绘补全该区域并抽取几何线索、把结果并入伪真值数据集并重训三维模型,直到覆盖完整 360°。三维表示采用 VolSDF:用一个网络建模有符号距离函数 \(f_\theta: x \mapsto s\),另一个网络建模辐射函数 \(L_\theta(x, \hat{n}, \hat{z})\)(不输入视角方向,因为单图不含视角相关光照信息)。

flowchart LR
  A["单张 RGB 输入"] --> B["初始化: 深度/法线估计 + 分割"]
  B --> C["初始 3D 模型 (VolSDF)"]
  C --> D["相机位置更新 (45°间隔调度)"]
  D --> E["空间雕刻求视觉外壳 → 减去已见区 = 外绘掩码"]
  E --> F["LDM 外绘 (DreamBooth 个性化 + 文本提示)"]
  F --> G["超分 + 深度/法线/前景估计"]
  G --> H["扩充伪真值数据集"]
  H --> I["按 MonoSDF 重训 3D 模型"]
  I --> D
  I --> J["完整 360° 高保真形状与外观"]

关键设计:

  • 空间雕刻求外绘掩码:借助视觉外壳(visual hull)思想,用基于深度的体素投票法雕刻包围盒。对每个体素,若它投影到已探索视角落在前景内、且到相机中心的距离大于该视角前景表面的距离,就投一票;票数等于已见视图数才保留,否则雕掉。把外壳投影到新视角得到轮廓 \(M^{\text{VH}}_i\),再通过前视点深度的 warping 操作算出已见前景掩码 \(M^{\text{FG}}_i\)(用背面剔除 \((p_j - o_i)\cdot\hat{N}_j < 0\) 只保留可见像素),二者相减 \(\tilde{M}_i = M^{\text{VH}}_i - M^{\text{FG}}_i\) 得到只含”新出现区域”的外绘掩码。这样保证补全区与已见区无缝衔接。
  • 扩散模型外绘生成伪真值:用在 LAION 大规模数据上预训练的潜在扩散模型(LDM),以”当前模型渲染出的图像 \(I_i\) + 外绘掩码 \(\tilde{M}_i\) + 文本提示”为条件外绘。文本用 “A photo of [V] [Class] in a white background, seen from [Dir]” 结构,其中 [V] 是物体的个性化标识、[Dir] 是方向词。外绘结果做 2× 超分,再用现成深度/法线估计器和背景去除得到几何与前景,并入数据集。
  • DreamBooth 个性化保持一致性:朴素使用预训练 LDM 补出的内容可能与参考图不符(如背面长出重复的脸)。因为本框架天然会产出多视图伪真值,正好满足 DreamBooth 需要同一物体多视图的条件,用它个性化出唯一标识 [V],使各视角外绘结果彼此协调、与输入一致。
  • 相机调度间隔的权衡:调度理论上任意,但间隔太小时外绘掩码只在物体边缘一圈,输入图主导条件、边缘伪影会不断累积;间隔太大时掩码相对物体过大,外绘会偏向文本提示而忽略输入图。经验上取 \(45°\) 间隔最稳。

实验结果

主实验为输入视图重建质量对比(在 Objaverse 十个类别上,与 NeuralLift-360、RealFusion 比较 PSNR/SSIM/LPIPS,下表为十类均值)。POP3D 在所有指标上大幅领先,说明直接在多视图伪真值上训练避免了蒸馏损失干扰 RGB 损失的问题。

方法 PSNR↑ SSIM↑ LPIPS↓
本文 (POP3D) 36.10 0.99 0.01
RealFusion 22.58 0.91 0.17
NeuralLift-360 13.89 0.77 0.30

在新视角合成上(CLIP 相似度与 NIQE 图像质量,与 NeuralLift、RealFusion、MCC、Point-E 比较),POP3D 的 CLIP 均值 0.86 最高,NIQE 均值 10.00 也大幅优于其余方法(次优 RealFusion 为 13.57),表明生成的新视角既语义贴近输入又画质更好。消融显示:\(45°\) 相机间隔可避免外绘失败;去掉 DreamBooth 个性化会产生与已见视图不协调的外绘结果。

亮点与局限

  • 亮点:
    • 不需任何 3D 训练数据或类别专属预训练,纯靠现成先验(深度/法线估计、LDM、DreamBooth)即可泛化到任意类别的野外单图。
    • 用空间雕刻精确界定”该补哪里”,配合多视图伪真值 + 神经隐式表面,避免了蒸馏损失干扰输入重建、以及密度场雾状伪影的问题,重建保真度高、目标分辨率提到 \(384\times384\)。
    • 模块化结构,各步骤模型可替换升级。
  • 局限:
    • 流水线由多个现成先验拼装,任一环节失败(如薄结构上的深度/法线估计出错)都会波及最终重建。
    • 物体完整背面质量有时明显逊于输入视图,源于外绘伪影随相机调度累积。
    • 重建单个物体约需单张 3090 RTX 上七小时,视图越多训练时间越长。

延伸思考

POP3D 走的是”先造多视图伪真值、再做多视图重建”的两段式思路,与当时直接用 SDS 蒸馏”梦出”三维的路线形成对比,其核心洞见——用几何约束(空间雕刻)精确控制生成区域、避免生成模型与重建损失打架——对后续单图三维生成仍有借鉴意义。七小时的重建耗时是主要瓶颈,论文自己也指出可用更快的隐式表面方法替换 VolSDF、用 LoRA 加速 DreamBooth;放到今天,把 VolSDF/NeRF 换成 3D Gaussian Splatting、或用前馈式大重建模型替代逐物体优化,都是自然的加速方向。此外,背面质量随外绘迭代退化的问题,本质是”生成误差在自举循环里累积”,如何设计更鲁棒的多视图一致性约束来抑制漂移,是这类自监督式补全框架的共性课题。