Journal

HumanRF: High-Fidelity Neural Radiance Fields for Humans in Motion

Mustafa Işık, Martin Rünz, Markos Georgopoulos, Taras Khakhulin, Jonathan Starck, Lourdes Agapito, Matthias Nießner

Synthesia; University College London; Technical University of Munich

一句话总结

HumanRF 用”时空张量分解 + 自适应时间分段”把动态神经辐射场扩展到 4D,能从 160 路 12MP 多视角视频里重建出长序列、高保真、时间连贯的运动人体,并同时发布了迄今分辨率最高的多视角人体数据集 ActorsHQ。

研究背景

  • 领域现状:NeRF 把静态场景的新视角合成推到了很高的水平,后续工作通过时间条件或形变场把它扩展到动态场景,人体专用方法则借助 SMPL、骨架等模板来约束重建。
  • 核心痛点:形变场类方法难以表达长序列里的复杂、快速运动(拓扑剧变时质量急剧下降);模板类方法受限于代理几何的近似,拍不出衣物动态、面部细节这类精细形变;同时高质量输出需要高分辨率训练数据,而公开数据集大多只有 4MP 或更低,既难采集也难被辐射场有效利用。
  • 本文 idea:不用模板、不用形变场,而是把 Instant-NGP 的哈希编码提升到时间维度,用低秩时空张量分解压缩 4D 特征网格;再把长序列切成若干”占用体量相近”的时间段,让训练时只需少量段驻留显存,从而在保真度和序列长度之间取得平衡。

方法

整体框架:训练前先把时间轴切分成若干 4D 段,使每段覆盖的 3D 空间体量相近;每段用一个紧凑的 4D 特征网格表示(四个 3D 哈希网格 + 四个 1D 稠密网格做低秩分解);训练时跨帧、跨相机采样光线,经两个共享浅层 MLP 得到密度与视角相关辐射,用体渲染出像素颜色,再用光度损失和前景掩码损失监督。

flowchart LR
  A["多视角视频"] --> B["自适应时间分段"]
  B --> C["每段一个 4D 特征网格<br/>3D 哈希 + 1D 稠密 低秩分解"]
  C --> D["共享 MLP:密度 + 视角相关辐射"]
  D --> E["体渲染"]
  E --> F["光度损失 + 掩码损失"]
  F --> G["新视角合成"]

关键设计:

  1. 4D 特征网格分解:把一个 4D 特征网格拆成四个 3D 网格与四个 1D 网格的哈达玛积之和:

    \[T_{xyzt}(\boldsymbol{p}) = T_{xyz} \odot T_t + T_{xyt} \odot T_z + T_{xzt} \odot T_y + T_{yzt} \odot T_x\]

    其中四个 3D 网格用多分辨率哈希网格实现(比稠密 3D 网格更省),四个 1D 网格用稠密向量数组。与并行工作用六个 2D 网格(Hex4D 式的 2D-2D 分解)不同,本文用的是 3D-1D 方案;消融显示在快速运动下 3D-1D 明显更好。

  2. 自适应时间分段:用前景掩码雕刻出每帧的占用网格,定义一组连续帧的膨胀因子

    \[\phi(\mathcal{T}) = \frac{\delta(\mathcal{T})}{\delta(\{t_0\})}\]

    即这组帧的并集占用体积相对首帧被放大了多少,它与运动复杂度正相关。算法用贪心策略逐帧扫描,一旦膨胀因子超过阈值(实验统一取 1.25)就开一个新段。这样每段承载的空间体量相近,运动小的地方段更长、时间共享更多,运动剧烈处段更短,避免了对”最优固定段长”做昂贵的超参搜索。

  3. 共享 MLP 与体渲染:每段各有自己的 4D 特征网格,但整段序列共享两个浅层 MLP——一个 3 层网络输出密度与几何特征,一个 4 层网络结合球谐编码的视角方向输出 RGB。共享 MLP 加上 4D 分解带来的时间信息共享,使结果时间连贯。

  4. 损失设计:光度项用 Huber 损失(对异常值更鲁棒),并用前景掩码与累积体渲染权重之间的二元交叉熵损失约束占用,尽早剪除空白空间、加速训练迭代。总损失为二者加权和(掩码项权重 \(\beta = 10^{-3}\))。

实验结果

在 ActorsHQ 上按不同序列长度评测,HumanRF 在几乎所有长度上都优于六个基线(形变类 NDVG / HyperNeRF / TiNeuVox,人体专用的 Neural Body / TAVA,以及逐帧独立训练的 Instant-NGP)。下表为不同序列长度下本文与逐帧 Instant-NGP 的对比(LPIPS 越低越好,PSNR/SSIM/VMAF 越高越好):

序列长度(帧) 方法 LPIPS↓ PSNR↑ SSIM↑ VMAF↑
100 本文 0.097 29.83 0.921 85.62
100 Instant-NGP(逐帧) 0.094 28.96 0.902 76.70
1000 本文 0.107 29.05 0.913 85.74
1000 Instant-NGP(逐帧) 0.093 28.85 0.905 77.60

逐帧 Instant-NGP 在 LPIPS 上略优,但时间稳定性差(VMAF 明显更低),且可训练参数量约为本文的 20 倍——HumanRF 仅用其约 5.2% 的参数就在感知视频质量上大幅领先。形变类方法随序列变长、运动变强而急剧退化。消融中,本文的 3D-1D 分解在中等运动和强运动下都稳定优于 tNGP(直接把时间拼进哈希网格)和 Hex4D(2D-2D 分解)。方法虽为人体设计,但无模板,迁移到动态毛发动物数据集 DFA 上同样达到 SOTA。

亮点与局限

  • 亮点:
    • 3D-1D 时空张量分解 + 多分辨率哈希网格,在极少参数下实现高保真、时间连贯的动态重建。
    • 自适应时间分段用”占用膨胀因子”自动决定段长,免去对最优段长的超参搜索,并让长序列能分段进显存、可扩展到任意长度。
    • 发布 ActorsHQ:8 位演员、160 路相机、12MP、近 4 万帧,并附逐帧约 50 万面片的高质量网格,分辨率与规模都超越已有多视角人体基准。
    • 无模板,可直接推广到毛发动物等非人体前景对象。
  • 局限:
    • 对每个序列都要单独优化一个辐射场,依赖高端采集的 ActorsHQ,尚不能作为可复用的化身泛化到单目测试序列。
    • 只重建训练姿态下的每一帧,对训练姿态之外的关节articulation没有显式控制。
    • 渲染速度仍有较大提升空间。
    • 前景掩码来自逐帧独立的网格重建,跨帧不一致,会在轮廓边缘产生闪烁。

延伸思考

  • 论文把静态 TensoRF 的向量-矩阵分解自然地抬升到 4D,并与哈希网格结合,这条”低秩分解 + 哈希编码”的思路对其他动态场景(不止人体)都有借鉴意义;作者也在 DFA 上验证了通用性。
  • 自适应分段本质是把”表达预算”按运动复杂度重新分配,这种以占用/信息量驱动的自适应划分,或许可迁移到动态高斯泼溅等更新的动态表示上做时间维度的资源调度。
  • 未来若把重建的辐射场转成隐式-显式混合表示(如 MobileNeRF 式)以加速渲染,并引入时间一致的背景抠像消除轮廓闪烁,会更接近生产可用;而”学习每段的形变网络或引入参数化模型”则是通往可控化身的一条自然路径。