Conference

VideoNeuMat: Neural Material Extraction from Generative Video Models

Bowen Xue, Saeed Hadadan, Zheng Zeng, Fabrice Rousselle, Zahra Montazeri, Milos Hasan

University of Manchester; NVIDIA; University of California Santa Barbara

SIGGRAPH 2026Neural & Generative

一句话总结

VideoNeuMat 用一个两阶段流水线,把视频扩散模型里隐含的”材质真实感”知识提取出来,变成可复用、可重打光、可贴到任意曲面上的独立神经材质资产。

研究背景

  • 领域现状:照片级真实感材质对 3D 渲染至关重要,但传统方式(程序化图、微表面模型、位移贴图、分层)门槛极高,只有少数顶尖艺术家能做出可信的效果,且复杂分层往往对实时渲染太昂贵。神经材质(如 NeuMIP)是一个有前景的部署形式,但同样缺少便捷的照片级内容创作手段。
  • 核心痛点:想训练一个直接生成高质量材质的生成模型,根本障碍是数据——无论经典 SVBRDF 还是神经材质,都几乎不存在达到所需真实感级别的公开数据集。现有材质数据集(MatSynth、Adobe Substance)在真实感和多样性上远不及自然图像。
  • 本文 idea:视频生成模型在互联网规模数据上预训练后,本身就”会”生成逼真的材质外观,只是这份知识与几何、光照纠缠在一起、以最终 RGB 帧的形式呈现。作者提出把这份材质知识”抽取”出来:先教一个视频模型在受控光/相机轨迹下生成材质样本视频(一个”虚拟测角反射计”),再训练另一个模型把这些视频转成神经材质,从而绕开数据稀缺的瓶颈。

方法

整体框架是一个两阶段流水线。第一阶段把大视频模型 Wan 2.1 14B 微调成”虚拟测角反射计”,让它在固定的光/相机运动轨迹下、由文本或图像提示生成结构化的材质样本视频;第二阶段用一个从更小的 Wan 2.1 1.3B 视频骨干微调而来的大重建模型(LRM),单次前向推理就把 17 帧材质视频映射成 NeuMIP 神经材质的特征纹理。

flowchart LR
  A["文本 / 图像提示"] --> B["虚拟测角反射计<br/>微调 Wan 2.1 14B"]
  B --> C["结构化材质视频<br/>81 帧, 采样 17 帧"]
  C --> D["材质 LRM<br/>微调 Wan 2.1 1.3B"]
  D --> E["NeuMIP 特征纹理<br/>Offset Tex + Main Tex"]
  E --> F["可微神经材质渲染器"]
  F --> G["新视角 / 新光照下渲染, 贴到任意曲面"]

关键设计:

  • 结构化视频轨迹:每段视频由两个对称阶段组成——光运动阶段(相机固定在样本正上方,光源沿仰角 \(56.31° = \arctan(3/2)\) 的圆周运动)与相机运动阶段(光源固定正上方,相机沿同样仰角轨道运动)。两阶段分离给出干净的监督信号:前者教会光照响应,后者教会视角相关效应与视差。作者刻意采用透视投影和近场小面光源(而非传统 BTF 采集的正交、逐像素对齐布局),因为后者的画面不存在于自然视频中、落在视频模型预训练分布之外;牺牲逐像素对齐换来的是保留了预训练的真实感先验。

  • 从预训练视频模型到材质模型:训练数据是用 Mitsuba 3 渲染的 5600 多个 MatSynth 材质(1024 分辨率,高度图作真实几何位移,含多次反弹路径追踪,并做 90° 旋转增强)。由于 MatSynth 无文本标注,用 Qwen2-VL 生成描述,并通过”过滤光照词”和”只描述材质固有属性”两种策略避免描述里混入光照信息。微调只更新扩散 Transformer(DiT),冻结 VAE 与文本编码器;提供 LoRA(rank 32,更省资源、更保先验但轨迹遵循度稍弱)和全量微调(轨迹一致性最好)两个变体。另有图像条件变体(从参考照片生成)和可平铺(tileable)变体。

  • 神经材质表示与直接优化的局限:采用 Raghavan 等人改进的 NeuMIP 表示,含逐材质的 offset 特征纹理 \(T_{\text{off}}\)、reflectance 特征纹理 \(T_{\text{rgb}}\),以及通用(跨材质共享)的 offset MLP \(M_{\text{off}}\) 和 reflectance MLP \(M_{\text{rgb}}\)。给定材质空间位置 \(\boldsymbol{u}\)、入射方向 \(\boldsymbol{\omega_i}\)、出射方向 \(\boldsymbol{\omega_o}\),先算偏移 \(\Delta\boldsymbol{u} = M_{\text{off}}(T_{\text{off}}[\boldsymbol{u}], \boldsymbol{\omega_o}) \in [-1,1]^2\),再取 \(f = M_{\text{rgb}}(T_{\text{rgb}}[\boldsymbol{u}+\Delta\boldsymbol{u}], \boldsymbol{\omega_i}, \boldsymbol{\omega_o})\)。一种朴素做法是逐材质直接优化(可微渲染 + 图像损失迭代),但它要求完美的多视一致性,而扩散生成的视频存在视/光不一致,导致伪影;且视频只覆盖 4D 反射空间的很小切片,缺乏先验时对未见视角/光照泛化差;还很慢(1024 分辨率 81 帧要约 1.5 小时)。

  • 大重建模型(LRM):为克服上述问题,把 Wan 2.1 1.3B 改造成非生成的回归器,单次前向就输出神经材质的隐纹理。输入 17 帧(81 帧的子集,帧数取 \(1+4n\) 形式以配合视频 VAE 的时间下采样),用冻结的 VAE 编码器编码后送入 DiT,取对应第一帧的输出 token 经改末层的 VAE 解码器得到 \(T_{\text{off}}\) 和 \(T_{\text{rgb}}\)(各 12 通道)。DiT 与 VAE 解码器均用预训练 Wan 权重初始化(而非随机),因为模型解析视频中时间外观变化的能力可直接迁移到材质重建。训练不依赖真值隐纹理(无此数据),而用渲染损失:在 LRM 未见过的新视/光条件下渲染并与 MatSynth 真值算 L2(外加权重 0.1 的 LPIPS),监督帧不仅覆盖测角轨迹 81 帧,还包含 \(3^4=81\) 帧的新光/相机组合,迫使输出在多种视角光照下都合理。LRM 推理只需约 4 秒/材质(1024 分辨率),远快于直接优化。

实验结果

主实验是消融研究,验证 LRM 各关键设计的作用(指标在生成材质上评估,↓越低越好、↑越高越好):

配置 LPIPS↓ MAPE↓ MSE↓ PSNR↑
完整方法(17 帧, 64×4 MLP, 全预训练) 0.3017 0.0407 0.005667 24.29
线性上采样替代 VAE 解码器 0.2919 0.0454 0.005767 24.25
冻结预训练 MLP 0.3155 0.0461 0.006105 23.96
MLP 随机初始化 0.3341 0.0565 0.009961 22.13
LRM 随机初始化 0.3543 0.0563 0.008769 22.45
输入帧减到 5 帧 0.3352 0.0517 0.006763 23.45
输入帧增到 41 帧 0.3009 0.0435 0.006151 24.04

结论:不用预训练权重(无论 NeuMIP MLP 还是 Wan DiT/VAE)分数最差,验证了预训练先验的重要;冻结 MLP 也会掉点;网络增大/减小、输入帧增到 41 或减到 5 都不能带来明显提升(5 帧因光运动阶段欠采样而 LPIPS 变差,41 帧因冗余观测略损泛化),故 17 帧为最优;线性上采样除 LPIPS 外全面变差,且会产生 patch 伪影(因每个 token 独立处理)。

其余实验用文字补充:外观评估上,本文生成视频对 OpenVid-1M 的 FVD(118.04)低于 MatSynth 渲染(138.86),RealMatScore(0.6289 vs 0.5463)也更高,说明微调保留了真实视频先验而非退化到合成渲染分布。单图到材质对比中,在 7 个未训练的 Adobe Substance 材质上,本文在 MSE/LPIPS/PSNR 上均优于 CHORD 与 MatFusion(显示帧 MSE 0.0142、LPIPS 0.292、PSNR 18.47)。与 GNM、RealMat、ReflectanceFusion 的定性对比中,本文在输出分辨率和位移/视差效果上更突出。

亮点与局限

  • 亮点:
    • 提出把视频生成模型当”虚拟测角反射计”,用受控光/相机轨迹的合成视频微调,既学到测量协议又保住预训练的材质真实感先验,从根子上绕开材质数据稀缺问题。
    • 首个用于材质重建的 LRM,也是首个从视频骨干(而非从零)微调的 LRM,单次前向即可从稀疏视频得到可泛化的神经材质,比逐材质直接优化更鲁棒、快约上千倍(4 秒 vs 1.5 小时)。
    • LRM 设计与具体材质表示无关,理论上可换任意可微材质模型;生成材质在真实感和多样性上明显超出其小规模合成训练数据。
  • 局限:
    • NeuMIP 表示逼近真实 3D 效果的能力有限;更精细的表示有待设计(方法本身对表示不敏感)。
    • 流水线仅在 MatSynth 上微调,缺少半透明、分层、纤维等复杂材质;虽然生成先验仍能产出这类材质,但增广数据或改进训练目标可进一步提升复杂度。
    • 可平铺方案仍有改进空间,偶有不完美样本,需要隐空间边界后处理来减弱接缝。

延伸思考

这项工作把”生成模型蒸馏”从图像/几何领域延伸到了材质领域:核心思路是把大模型隐含但纠缠的知识,通过一个受控”测量协议”再加一个前向重建器蒸馏成结构化、可复用的资产,这个范式对其它难以直接获取真值数据的图形任务(如次表面散射、光泽织物、体积外观)可能同样适用。值得追问的是:RPC(残差视差一致性)这类无真值的序列质量度量能否推广成通用的”生成视频几何一致性”评估;以及当 LRM 换成更强的神经材质表示时,能否在保持单次前向速度的同时把半透明、纤维等真正的 3D 外观也纳入进来。