Conference

PSDR-Room: Single Photo to Scene using Differentiable Rendering

Kai Yan, Fujun Luan, Milos Hasan, Thibault Groueix, Valentin Deschaintre, Shuang Zhao

University of California, Irvine; Adobe Research

一句话总结

给定一张室内照片,PSDR-Room 借助单图场景理解模型做初始化、用 CLIP 从数据库检索几何与程序化材质,再用路径空间可微渲染联合优化相机、房间、物体位姿、材质与光照,从而端到端地重建出一个可编辑的 3D 场景。

研究背景

  • 领域现状:从单张照片重建 3D 场景是图形学与视觉交叉的长期难题。以往工作各自解决其中一块——有的专注几何检索与摆放(如 IM2CAD、Total3D),有的专注材质与光照(如 PhotoScene),但很少把三者放在一起联合优化。
  • 核心痛点:一个完整的 3D 场景由光照、材质、几何等相互耦合的组件构成,手工搭建既费时又需要美术与技术双重功底;而现有自动化方法要么不匹配材质与光照,要么用简化的可微渲染近似,重建保真度受限。
  • 本文 idea:近年来物理正确的路径空间可微渲染(PSDR)已能对几何、光照、材质等所有参数给出无偏梯度。作者第一次把它作为主干,串起单图场景理解与 CLIP 检索,实现”照片 → 可编辑 3D 场景”的端到端系统。

方法

整体框架分四个阶段串行推进:预处理 → 房间阶段 → 物体阶段 → 材质与光照阶段。每个阶段都遵循同一套”先用神经预测/点云做粗初始化,再用可微渲染在图像空间精修”的范式,可微渲染贯穿始终,是把粗糙初值拉向照片外观的关键。

flowchart LR
  A["输入照片"] --> B["预处理: 分割/深度/相机FoV"]
  B --> C["房间阶段: 盒子初始化 + 可微渲染精修"]
  C --> D["物体阶段: CLIP检索模型 + 位姿精修"]
  D --> E["材质与光照阶段: CLIP检索程序化材质 + 联合优化"]
  E --> F["可编辑输出场景"]
  • 预处理(全部沿用现成模型):用 PerspectiveFields 估相机竖直视场角,用基于 DPT/MiDaS 的单目模型估归一化深度,用 Mask2Former 做全景分割得到墙/地/天花板及各物体的掩膜。深度加分割即构成一个近似的分对象点云,作为后续初始化依据。
  • 房间阶段(把房间近似成盒子):用墙/地/天花板点云经 RANSAC 估地面并对齐旋转,得到粗对齐的房间盒;再用 PSDR-CUDA 优化盒子位姿,损失为掩膜的可微 IoU 加归一化深度的 L1。渲染掩膜带抗锯齿边缘,这一点很关键——只有边缘像素才有非零梯度,梯度下降才能推动几何边界。IoU 还专门扩展以正确处理抗锯齿的分数像素。
  • 物体阶段(检索 + 位姿精修):从 3D-FUTURE(一万多个艺术家制作的模型、且带材质分组)里检索。用 CLIP 把数据库渲染图和输入图中每个物体的裁剪块都编码为归一化向量,按余弦相似度取最近邻。粗对齐时按点云中位数定中心、把物体初始尺度设小让其”生长”(比一开始就估准更利于优化),并用启发式让竖直轴垂直于地面、试多个绕竖直轴的旋转选掩膜差最小的。随后可微渲染联合精修所有物体的缩放、水平平移和绕竖直轴旋转,保持贴地/贴墙约束;损失用掩膜乘深度的 L1 再加高斯模糊掩膜的 L1。
  • 材质与光照阶段(本文重点):先在渲染掩膜与目标掩膜的交集内取最大内接矩形,形成输入图与渲染图的”裁剪对”(可自动检测也可由用户指定)。材质检索用裁剪块对 DiffMatV2 库的 118 个程序化材质做 CLIP 搜索,配合投票与余弦相似度选材,并在若干缩放/旋转下用 Gram 矩阵损失定纹理变换;相似度太低或掩膜太小的部件退化为常数材质。光照上把天花板切成网格面光、剔除相机视锥内的光、相机后与隐藏墙处补面光模拟窗户,可见窗与灯变成发光体,并按下采样 L1 挑初始辐亮度。最后在全局光照下联合优化所有材质与光照参数,损失综合了 1/8 下采样全图 L1、每对裁剪的 Gram 矩阵纹理损失以及每个掩膜的 RGB 均值。程序化材质的可微优化会把图像空间梯度回传到节点图参数,节点图本身充当先验,保证即使不可见区域也生成高质量、不烘焙光照线索的纹理。

实验结果

论文在真实室内照片上评测,并与 IM2CAD、PhotoScene 两条基线对比,用 LPIPS(容忍轻微错位)与 RMSE 衡量重建图像与目标照片的接近程度,结论是 PSDR-Room 更准确地联合估计了光照与材质。由于原文定量结果以配图形式给出,这里以”各方法覆盖的组件”这一主对比呈现其定性优势:

方法 几何来源 材质估计 光照估计 可微渲染精度
本文 PSDR-Room 数据库检索 程序化节点图(联合优化) 联合优化 路径空间无偏梯度
PhotoScene 依赖已有几何 程序化材质 简化近似
IM2CAD 数据库检索
Total3D 单图直接预测网格

作者指出:用矩形裁剪对比纹理比 PhotoScene 的掩膜 VGG 损失更鲁棒,CLIP 检索也优于基于 VGG Gram 距离的搜索;因此在相同或更弱的几何前提下重建质量更好。消融显示即使只用数据库 5%(约 800 个模型)流程仍表现稳定。性能方面,房间优化约 100 次迭代(每次 <0.1s),几何初始化加 CLIP 检索每物体约 5s,材质光照优化每次迭代 1–5s,整体几分钟内完成。

亮点与局限

  • 亮点:
    • 首个把物理正确的路径空间可微渲染作为主干、端到端地把单张照片变成”物体/光照/程序化材质分离且可编辑”3D 场景的系统。
    • 巧妙复用现成的分割、深度、视场角、CLIP 等大模型做初始化与检索,把可微渲染的角色聚焦在”精修”上,工程上很务实。
    • 输出是真正可编辑的场景——相机、几何、光照、材质都能改,程序化节点图还能调参或整体替换。
  • 局限:
    • 房间被近似为盒子,难以处理复杂户型与非水平天花板。
    • 把可微渲染推到了极限:物体相互穿插会因缺失边界项产生错误的零梯度,缺少可微碰撞检测。
    • 依赖带良好材质分组的物体库,而作者的材质库偏小;商用部署需要投入构建更大、属性更规范的资产库。
    • 全自动结果并非完美,有时仍需用户提供裁剪对或从 CLIP 前若干候选里手动挑选才能达到最佳匹配。

延伸思考

  • 该系统本质是”大模型初始化 + 可微渲染精修”的分工范式,随着分割/深度/相机标定等上游模型进步可直接受益,是一个能持续搭便车的架构。
  • 把可微渲染约束在程序化材质流形上,既是正则也是质量保证,这一思路对其它逆向任务(如逆向 SVBRDF、可编辑资产生成)都有借鉴意义。
  • 后续方向很自然:更强的学习式初始化替代启发式、支持任意户型的房间表示、可微碰撞检测消除穿插伪影,乃至从室内推广到室外或更一般的场景。
  • 与如今流行的神经辐射场/高斯泼溅式重建相比,本文坚持输出”显式、组件分离、可物理编辑”的传统资产,这在真正需要下游美术编辑与重光照的生产管线里仍有不可替代的价值。