Conference

GaussianPrediction: Dynamic 3D Gaussian Prediction for Motion Extrapolation and Free View Synthesis

Boming Zhao, Yuan Li, Ziyu Sun, Lin Zeng, Yujun Shen, Rui Ma, Yinda Zhang, Hujun Bao, Zhaopeng Cui

Zhejiang University; Jilin University; Ant Group; Google

一句话总结

在 3D 高斯表示上建立带形变场与”生命周期”属性的规范空间来重建动态场景,再用同心运动蒸馏把数十万个高斯的运动压缩到几百个关键点上,最后用图卷积网络预测关键点的未来运动,从而既能重建动态场景又能从任意视角合成未来时刻的照片级画面。

研究背景

在动态环境中预测”接下来会发生什么”,对智能决策与导航至关重要,但现有路线各有短板:

  • 视频预测能从历史帧外推未来动态,却只能停留在固定视角,无法自由换视角观察未来。
  • 新视角合成(NeRF、3D Gaussian Splatting 等)能从任意视角渲染,却不具备时间维度上的预测能力。
  • 3D 点云预测原生工作在三维空间、利于车辆决策,但难以生成高质量图像。

3D 高斯表示看似天然连接了新视角合成与运动预测,但直接搭建这样的系统并不简单:其一,需要对高斯做时序建模,同时覆盖一般运动与不可逆形变(如切开、掰碎),而同期动态高斯工作缺乏后者;其二,精确表示一个场景往往需要数十万个高斯,必须以协调一致的方式预测它们的运动,哪怕一小部分高斯预测出错也会显著劣化渲染质量。本文提出 GaussianPrediction 来应对这两大难题。

方法

整体框架

输入单目相机在不同时刻拍摄的动态场景图像,系统分三个阶段:先建规范空间做动态重建,再蒸馏关键点简化运动,最后用图卷积网络预测未来。

flowchart LR
    A[单目动态图像序列] --> B[阶段一<br/>超规范空间 + 形变 MLP<br/>生命周期不透明度]
    B --> C[阶段二<br/>同心运动蒸馏<br/>聚类初始化关键点/自适应增点/权重学习]
    C --> D[阶段三<br/>图卷积网络预测关键点未来运动]
    D --> E[由关键点驱动全场景高斯形变<br/>渲染任意视角的未来画面]

关键设计

超规范空间与形变建模。沿用”规范空间 + 形变”的思路,但为避免仅用位置与时间作输入导致相邻区域运动模式混淆而产生模糊,为每个高斯附加一个 \(d\) 维运动特征 \(m\)。给定时刻 \(t\),用一个 MLP \(D\) 预测中心位置与旋转的形变量:

\[\Delta\mu_t,\ \Delta q_t = D(\gamma(\mu),\, m,\, \gamma(t))\]

其中 \(\gamma\) 是位置编码。由位置与运动特征共同张成的超规范空间定义为:

\[C_h = \{(\mu, m)\ \lvert\ \mu \in \mathbb{R}^3,\, m \in \mathbb{R}^d\}\]

由于同时优化 \(\mu\) 与形变 MLP 易陷入局部最优,作者引入随迭代衰减的退火噪声,引导 \(\mu\) 更均匀地分布并提升渲染质量:

\[\varepsilon(i) = \mathcal{N}(0, 1)\cdot N_s \cdot \left(1 - \min\!\left(1, \frac{i}{10000}\right)\right)\]

生命周期属性。切水果、掰饼干等运动会让原表面消失或新表面出现,这类不可逆形变没有贯穿全序列的对应关系。作者为高斯不透明度乘上一个生命周期因子 \(\psi\),用 sigmoid 把它压到接近 0 或 1,表示某高斯只在特定时刻参与渲染:

\[\psi(G_i, t) = \frac{1}{1 + e^{-10\,\Delta o(G_i, t)}}, \qquad \Delta o = D_o(\gamma(\mu_i),\, m_i,\, \gamma(t))\]

同心运动蒸馏。直接把时间 \(t\) 外推给形变 MLP 会让相互独立的高斯丢失几何结构。作者改为用关键点驱动:在超规范空间定义 \(N_k\) 个关键点,每个高斯的形变由其最近的若干关键点的平移 \(T_t\) 与旋转 \(Q_t\) 加权合成:

\[\Delta\mu_t^i = \sum_{k\in K}\left(w^T_{i\leftarrow k}\cdot T_t^k\right), \qquad \Delta q_t^i = \sum_{k\in K}\left(w^Q_{i\leftarrow k}\cdot Q_t^k\right)\]

这一步把需要预测的节点从数十万降到几百个。它包含三步:(一)用聚类在超规范空间把高斯分组、以类中心初始化关键点(聚类同时考虑空间邻近与运动相似);(二)对梯度大、重建差的复杂运动区,用最远点采样自适应增补关键点;(三)学习时间无关的权重,且关键点搜索在超规范空间进行——只在 3D 空间找最近点会把”刀”和”柠檬”这类空间相邻但运动迥异的部分错误绑定,导致模糊。权重学习借助哈希编码加微型 MLP,在查询量增大时仍保持高效。

图卷积预测。蒸馏后场景运动被隐式编码在这几百个关键点中。以关键点在各时刻的 3D 位置为监督,用图卷积网络提取关键点间跨帧的关系特征,再由单层 MLP 解码出下一时刻的关键点位置;配合滑动窗口即可连续预测。得到未来关键点位置后,按上式驱动全场景高斯形变并渲染。

实验结果

在 D-NeRF 合成数据集上做未来运动预测(取时间戳 \([0.8, 1.0]\) 作测试)。加权平均指标显示,完整模型在 PSNR 与 LPIPS 上均优于对比方法;”Ours-MLP”是去掉图卷积、直接把时间外推给形变 MLP 的变体:

方法 PSNR ↑ SSIM ↑ LPIPS ↓
TiNeuVox-B 22.83 .9229 .0886
4D-GS 23.98 .9305 .0697
Deformable-GS 23.35 .9285 .0623
Ours-MLP 24.14 .9339 .0560
Ours(完整) 24.62 .9387 .0514

在 D-NeRF 上的动态场景重建(非预测),本文平均 PSNR 40.58、SSIM .9919、LPIPS .0107,略优于 Deformable-GS(40.43 / .9918 / .0116),显著超过 4D-GS 与 TiNeuVox-B。在 Hyper-NeRF 真实数据集上,本文平均 PSNR 28.9、MS-SSIM .920,为高斯类方法中最好,并在部分场景超过 NeRF 类方法(真实数据受相机位姿与时间戳不准影响,定量比较意义有限)。消融显示:去掉退火噪声、超规范空间初始化、自适应增点或生命周期属性都会降低指标,其中生命周期能有效消除切开处残留的高斯。

亮点与局限

亮点:

  • 把新视角合成与未来运动预测统一到 3D 高斯框架内,能从任意视角渲染未来时刻画面,突破了视频预测受限于固定视角的瓶颈。
  • 同心运动蒸馏把待预测节点从数十万降到几百,使未来预测既高效又稳健,避免了少数高斯预测出错拖垮整体渲染。
  • 生命周期不透明度显式建模切开、掰碎等不可逆形变,超规范空间的关键点搜索有效区分空间相邻但运动不同的部分。

局限:

  • 仅从输入观测学习关键点动态、不做任何预训练,因此只能预测有意义的短期未来,长期预测能力有限。
  • 真实数据集上受相机位姿与时间戳不准的影响,定量评估的参考价值弱于定性观察。

延伸思考

GaussianPrediction 展示了显式高斯表示做”可预测动态”的一条务实路径:与其直接预测海量高斯,不如先把运动蒸馏到少量关键点这一低维、结构化的载体上,再交给擅长关系建模的图卷积网络。这种”降维—预测—回投”的分工,与骨骼驱动蒙皮、稀疏控制点驱动稠密网格的经典思想一脉相承。作者也指出,短期预测的天花板主要来自缺乏运动先验;把物理先验或大规模预训练的运动模型引入关键点预测,或许是把这套框架推向长期、更泛化预测的关键方向。