Journal

Split4D: Decomposed 4D Scene Reconstruction Without Video Segmentation

Yongzhen Hu, Yihui Yang, Haotong Lin, Yifan Wang, Junting Dong, Yifu Deng, Xinyu Zhu, Fan Jia, Hujun Bao, Xiaowei Zhou, Sida Peng

Zhejiang University; Ant Group; Shanghai AI Lab

一句话总结

本文提出 Split4D,用带线性运动能力的 Freetime FeatureGS 表示可分解的 4D 场景,并配合流式特征学习策略,仅靠逐帧(不需时序一致)的 2D 分割图,通过对比损失就能恢复出时空一致的实例特征场,从而在无需视频分割/跟踪的前提下实现高质量的 4D 重建与分割。

研究背景

从多视角视频重建”可分解的” 4D 表示(即能对动态 3D 场景在时空上做实例级分割),对内容创作、机器人、自动驾驶等下游应用都很关键,例如可以选择性地移除或搬移场景中的动态物体。

已有代表性方法先重建 4D 表示,再把 2D 视频分割标签通过可微渲染”抬升”到 4D 空间。这类方法有两个痛点:

  • 强依赖输入视频分割质量。视频跟踪方法往往难以产生长期一致的分割,2D 标签的错误会直接传播到 4D 表示。
  • 多视角输入下,跨视角的标签一致性也很难保证,导致 4D 分割不连贯。

在静态多视角场景中,一种常见的规避思路是定义一个 3D 特征场,用对比损失从多视角分割图学习:对任意一对 3D 点,根据它们在 2D 分割图中是否属于同一 mask,强制其特征向量靠近或远离。由于点特征与具体实例标签解耦,就无需跨视角标签一致。但这一策略难以直接推广到 4D:对任意两个不同时刻的 3D 点,很难判定它们是否属于同一实例。已有工作(如 SADG)尝试用可变形高斯建立时序对应关系,但可变形高斯在大运动动态场景上重建质量不佳。

方法

给定带分割图的多视角视频(分割图由 SAM 得到),目标是学习一个可分解的 4D 表示以支持随时间的精确分割。整体框架包含时空自由的高斯表示、流式采样、对比特征学习、两项正则化,以及推理阶段的过滤策略。

flowchart LR
    A[多视角视频 + 逐帧 2D 分割图 SAM] --> B[Freetime FeatureGS\n带特征与线性速度的高斯]
    B --> C[流式采样\n时序有序取帧]
    C --> D[对比聚类损失\n逐帧不一致标签也可用]
    D --> E[正则化\n3D 跟踪对齐 + DINOv2 语义]
    E --> F[HDBSCAN 聚类 + 动态感知过滤]
    F --> G[时空一致的 4D 实例分割与编辑]

Freetime FeatureGS:时空自由的特征高斯

受 FreeTimeGS 启发,每个高斯基元可以出现在 4D 空间的任意时间与位置,并通过线性运动被复用。每个基元由 4D 均值 \(\boldsymbol{\mu}\in\mathbb{R}^4\)、4D 尺度 \(\boldsymbol{s}\in\mathbb{R}^4\)、不透明度 \(\alpha\)、左右四元数 \(q_l,q_r\)、球谐系数与一个速度向量 \(\boldsymbol{v}\in\mathbb{R}^3\) 定义。给定初始时刻 \(\mu_t\),任意时刻 \(t\) 的空间位置为:

\[ \boldsymbol{\mu}_x(t) = \boldsymbol{\mu}_x + \boldsymbol{v}\cdot(t-\mu_t) \]

即每个高斯在 3D 空间随时间做线性运动。为实现实例感知分割,每个高斯再额外挂一个可学习特征向量 \(\boldsymbol{f}\in\mathbb{R}^d\),通过可微光栅化渲染成 2D 特征图:

\[ F_s = \sum_{i\in N} \boldsymbol{f}_i \alpha_i T_i, \quad T_i = \prod_{j=1}^{i-1}(1-\alpha_j) \]

流式采样策略

线性运动与复用使得基元随时间被逐渐替换,从而在特征场中形成很强的局部时间连续性:相邻帧通常共享大量重叠基元,但相隔较远的帧可能已完全替换掉表示同一物体的基元。如果随机采样时间步训练,同一实例在时间跨度大的帧上特征容易收敛到不同点,导致 4D 分割不一致。

为此,作者构造时序有序的训练样本序列 \(S=\{(F_{v,t}, M_{v,t})\}_{v=1,t=1}^{V,T}\),训练时以流式方式从中采样计算对比损失,让特征沿运动轨迹平滑传播,同时帮助避免优化陷入局部极小。

Freetime 特征学习

对分割图中的每个实例,取 mask 内 \(N_s\) 个均匀采样点特征的均值作为特征中心 \(\bar{\boldsymbol{f}}_i\),用对比聚类损失优化实例级特征:

\[ L_{CC} = -\frac{1}{N_{inst}N_s}\sum_{i=1}^{N_{inst}}\sum_{j=1}^{N_s} \log \frac{\exp(\boldsymbol{f}_i^j\cdot\bar{\boldsymbol{f}}_i/\phi_i)}{\sum_{k=1}^{N_{inst}}\exp(\boldsymbol{f}_i^j\cdot\bar{\boldsymbol{f}}_k/\phi_k)} \]

其中 \(\phi_i\) 是随类内特征方差自适应的温度参数。关键在于:同一时刻的对比损失约束同帧内点特征按 mask 归属靠近/远离;而由于高斯基元能随时间移动,对比损失自然会与邻近时刻的特征发生作用,从而把对比学习扩展到时间维,使同实例点特征随时间保持接近,实现 4D 分割。因此只需逐图分割输入、不要求时序一致标签。

两项正则化

  • 3D 跟踪正则:用时间不透明度 \(\alpha(t)=\exp\left(-\frac{1}{2}\left(\frac{t-\mu_t}{s}\right)^2\right)\) 识别在下一帧即将消失的高斯,用 k 近邻找到其在 \(t+1\) 帧的时空匹配,再用对齐损失 \(L_{align}=\sum\lVert \boldsymbol{f}_{gt}-\boldsymbol{f}_{gt'}\rVert\) 强制匹配对特征一致,维持时间连贯性(对非线性大运动尤其重要)。
  • DINOv2 语义对齐:把 DINOv2 特征经固定线性投影后,作为”语义字典”用类似的对比损失引导特征空间形成有意义结构。因为学到的特征最终需偏离 DINOv2 的通用表示,该正则仅在训练早期施加。

训练与推理

训练时固定预训练好的 4D 重建模型,只优化实例特征,总目标为:

\[ L_{total} = L_{CC} + \lambda_1 L_{align} + \lambda_2 L_{DINO} \]

推理阶段用动态感知过滤:先从首帧随机采样 2–10% 的高斯,用 HDBSCAN 聚类并以簇平均特征表示实例;再结合速度、空间与特征相似度的过滤函数

\[ \text{Filter}(g_i)=\mathbb{I}\left((\Delta v_i>3\sigma_v)\wedge(\Delta p_i>3\sigma_p)\wedge(s(\boldsymbol{f}_i,\bar{\boldsymbol{f}}_i)<\tau_{sim})\right) \]

作为辅助信号剔除噪声基元,提升复杂运动场景下的分割质量。

实验结果

在 Neural3DV、Multi-Human、SelfCap 三个具挑战性的动态场景数据集上评测(由于原数据集无分割真值,使用 SAM2 / Grounded-SAM-2 生成测试视角上的一致 mask,每场景挑选 5–20 个含动/静态的标注实例)。用 mIoU、mAcc、Recall、F1,以及只在动态实例上计算的 Recalldyn 作为指标。基线为 OmniSeg3D、DGD、SA4D、SADG。方法在单张 RTX 4090 上每场景约 1 万次迭代、约 30 分钟。

主要定量对比(mIoU / mAcc):

数据集 Ours SA4D SADG DGD OmniSeg3D
Neural3DV 0.801 / 0.998 0.668 / 0.987 0.649 / 0.985 0.460 / 0.982 0.700 / 0.996
Multi-Human 0.893 / 0.997 0.592 / 0.928 0.696 / 0.932 0.379 / 0.889 0.533 / 0.903
SelfCap 0.882 / 0.995 0.688 / 0.987 0.723 / 0.987 0.499 / 0.977 0.777 / 0.988

方法在三数据集上 mIoU 与 mAcc 均领先,F1 也全面最优。在多人交互、球类传递等复杂运动场景优势尤为明显:DGD 因蒸馏 DINOv2 语义倾向把不同人合并成同一类;SA4D 在动态区域召回高主要是因为边界不清、前景过大而虚高。作者还发现方法能学到比 SAM 监督标签更精确的边界(如手-球接触处)。

消融显示运动建模与流式学习都至关重要:去掉显式运动建模(换成 4DGS 运动表示)会因运动与几何耦合产生模糊速度方向而显著掉点;去掉流式采样会破坏时序一致性。3D 跟踪正则与 DINOv2 对齐进一步提升稳健性。此外,相比联合优化(同时优化重建与特征),本文固定重建、单独学特征能避免多目标带来的重建质量退化,且 PCA 可视化显示学到的特征在帧间更时序一致、结构更清晰。

亮点与局限

亮点:

  • 提出无需视频分割/跟踪的 4D 分解重建框架,绕开了对长期一致 2D 标签的强依赖,特征与实例标签解耦。
  • Freetime FeatureGS 的线性运动天然把逐帧对比学习扩展到时间维,用逐图分割即可得到 4D 一致实例特征。
  • 流式采样有效缓解大时间跨度下同实例特征发散的局部极小问题;在多人交互、快速运动等复杂场景大幅领先现有方法。

局限:

  • 依赖预训练的高质量 4D 重建作为固定骨干,特征学习与重建分阶段进行。
  • 对非线性大运动仍需 3D 跟踪正则辅助维持时间连贯,DINOv2 语义先验在多人场景可能误合并个体,需要调低其权重。

延伸思考

将”运动可复用的自由高斯 + 时序流式对比学习”结合,为动态场景的实例级理解提供了一个不依赖脆弱视频跟踪的新范式。其把时间维一致性交给基元运动本身、而非标签传播的思路,值得推广到更长序列、开放词表分割乃至可编辑的动态内容生成;如何端到端联合优化重建与特征而不损失重建质量,以及如何减轻对预训练语义先验的依赖,都是有价值的后续方向。