Conference

EBREnv: SVBRDF Estimation in Uncontrolled Environment Lighting via Exemplar-Based Representation

Li Wang, Jiajun Zhao, Lianghao Zhang, Fangzhou Gao, Jiawan Zhang

Tianjin University

一句话总结

在不可控的环境光照下,用一组已知材质渲染出的”范例图像”(exemplar)来表示环境光,把跨域的光照预测问题转化为同域的图像翻译问题,从而用手机闪光/非闪光两张图高质量地恢复近平面材质的 SVBRDF。

研究背景

用手机相机加共位(co-located)闪光灯拍摄少量图片来恢复空间变化的双向反射分布函数(SVBRDF),是外观采集里很实用的一条路线。但这类方法通常要求暗室环境,保证闪光灯是唯一光源,这在真实的现场采集中往往做不到。

一旦进入不可控的环境光照,材质外观同时受到环境光影响。环境光理论上能补充共位光照信息不足的问题,但它的随机性和未知性让网络难以利用,还会扰乱共位光照下稳定的高光激活模式,反而加大了估计难度。已有工作有两类思路:一类用扩散模型直接从单图或闪光/非闪光对生成 SVBRDF,忽略环境光,但生成结果和输入样本缺乏语义对齐;另一类先预测环境光再指导估计,但用球面高斯(SG)等传统表示时,光照在球面域、材质外观在样本表面域,跨域变换让网络既难预测又难利用。

本文的核心出发点:既然近平面材质估计中样本表面域是已知且固定的,就可以把环境光用一组”在该域下渲染出的外观图像”来表示,使其和输入图像建立逐像素对应,把跨域回归简化成同域翻译。

方法

整体框架

方法分两大部分。第一部分是环境光提取:用 Lighting Net 从闪光/非闪光对预测出范例图像(同时预测纯闪光图像),再通过主导球面高斯提取把范例图像逆向还原成 SG 表示以恢复正向渲染能力。第二部分是 SVBRDF 估计:通过自适应范例选择挑出最合适的范例组合,再用级联网络分阶段恢复漫反射、高光和精修结果。

flowchart TD
    A["输入: 闪光图 $$I_f$$ + 非闪光图 $$I_{nf}$$"] --> B["Lighting Net<br/>预测范例图像 + 纯闪光图"]
    B --> C["主导球面高斯提取<br/>四叉树初始化 + 合并 + 优化 + 动态增密"]
    C --> D["自适应范例选择<br/>粗到细 + 固定锚点范例"]
    D --> E["Diffuse Net<br/>估计法线图 + 漫反射图"]
    E --> F["Specular Net<br/>仅用点光照估计粗糙度 + 高光图"]
    F --> G["Refinement Net<br/>融合渲染残差精修"]
    G --> H["最终 SVBRDF: $$M=\{n,d,r,s\}$$"]

关键设计

  1. 基于范例的环境光表示:用一组共享相同漫反射(0.1)和高光(0.2)、仅粗糙度不同的已知材质,在环境光下渲染出 \(\{I_{ex_i}\}_{i=1}^{N}\)。这些范例图与输入外观图处于同一样本表面域,建立逐像素对应,让光照预测从跨域回归退化为同域翻译,大幅降低网络学习负担。由于目标是恢复材质,只需估计”光照与材质卷积后的效果”,而非完整环境光。

  2. 主导球面高斯提取:为恢复正向渲染能力,需把范例图像转回球面域。关键观察是单个像素值主要由视线反射方向的光照主导。据此用四叉树把范例图分块(方差低于阈值即停止细分),每个分块中心像素给出一个 SG:轴取视线反射向量、幅值取像素值、锐度按四叉树层级选取;再合并相邻相似 SG 去冗余,作为初始化做优化,并用 MS-SSIM 找到表示不足的区域动态增补 SG。优化上限 400 次迭代,单张 RTX 3090 上约 5 秒/样本,SG 数量最多 64。

  3. 自适应范例选择:先在粗糙度 \([0,1]\) 均匀采样构成粗集合,按与非闪光图的结构相似度选出最合适的范例;再在其粗糙度邻域构成细集合做二次精选。此外固定加入一高一低两个粗糙度的范例作为锚点,跨样本保持一致,提升引导的鲁棒性。

  4. 级联网络分离环境光负面影响:随机环境光主要干扰高光激活,对方向无关的漫反射影响小。因此先用含环境光的输入估计法线和漫反射;再渲染漫反射图并从纯闪光图中减去,得到高光图,仅用点光照信息估计粗糙度和高光图;最后精修网络融合渲染残差恢复最终结果。所有网络基于 NAFNet 的 4 层编解码结构。

实验结果

在 MatSynth 测试集的 86 个合成场景上,按每张贴图 RMSE 与重渲染(30 个随机光照方向)RMSE/LPIPS 评估。近场闪光/非闪光对比中本文相对 Two-Shot、MatFusion 全面领先;接入近远场(near-far-field)采集策略后各项进一步提升。

方法 Norm. RMSE↓ Diff. RMSE↓ Rough. RMSE↓ Spec. RMSE↓ Ren. RMSE↓ Ren. LPIPS↓
MatFusion(近场) 0.0823 0.1365 0.1604 0.0695 0.0658 0.1657
Two-Shot(近场) 0.0686 0.0503 0.1103 0.0457 0.0476 0.1166
Ours(近场) 0.0351 0.0285 0.0718 0.0446 0.0394 0.0568
NFPLight(近远场) 0.0406 0.0351 0.0615 0.0474 0.0350 0.0543
Ours(近远场) 0.0277 0.0199 0.0487 0.0278 0.0314 0.0342

在 60 个真实场景(每场景 6 张新光照参考图)上,本文的重渲染 RMSE/LPIPS 同样优于对比方法。消融实验表明:引入范例能有效解耦环境光与材质,级联设计更好地利用光照信息,自适应范例机制对高光估计提升明显;范例数量以 4 个为最优。

亮点与局限

亮点:

  • 用同域范例图像替代球面域的 SG 直接预测,巧妙化解了光照预测的跨域难题,兼顾”易预测”与”可正向渲染”。
  • 主导 SG 提取抓住”像素值由反射方向光照主导”这一物理直觉,给出稳健的初始化和优化流程。
  • 级联结构把随机环境光对高光的负面影响隔离在点光照阶段,提升了整体鲁棒性;同时兼容近场两拍与近远场四拍两种采集策略。

局限:

  • 未建模近远场采集因距离变化产生的动态阴影,当主导光源近乎正上方时会导致光照与材质的错误分解,目前靠手动遮挡主光源缓解。
  • 不考虑全局光照(如高度起伏物体的自阴影),漫反射图仍会烘焙进伪影。
  • 采集流程相对复杂,不支持单图输入,也不恢复高度图。

延伸思考

这项工作的思路本质是”用可微渲染把难以直接预测的隐变量投影到网络友好的观测域”,范例图像可以看作环境光在固定几何/相机配置下的一组”探针响应”。这种把光照信息编码进已知材质响应的做法,或许能推广到其他病态的逆向渲染任务中。作者也指出,扩散类生成方法在处理全局光照和采集灵活性上更有优势,而本文在精度上更强,未来把 GI 数据引入训练、简化采集需求,可能是两条路线融合的方向。