Split4D: Decomposed 4D Scene Reconstruction Without Video Segmentation
Zhejiang University; Ant Group; Shanghai AI Lab
一句话总结
本文提出 Split4D,用带线性运动能力的 Freetime FeatureGS 表示可分解的 4D 场景,并配合流式特征学习策略,仅靠逐帧(不需时序一致)的 2D 分割图,通过对比损失就能恢复出时空一致的实例特征场,从而在无需视频分割/跟踪的前提下实现高质量的 4D 重建与分割。
研究背景
从多视角视频重建”可分解的” 4D 表示(即能对动态 3D 场景在时空上做实例级分割),对内容创作、机器人、自动驾驶等下游应用都很关键,例如可以选择性地移除或搬移场景中的动态物体。
已有代表性方法先重建 4D 表示,再把 2D 视频分割标签通过可微渲染”抬升”到 4D 空间。这类方法有两个痛点:
- 强依赖输入视频分割质量。视频跟踪方法往往难以产生长期一致的分割,2D 标签的错误会直接传播到 4D 表示。
- 多视角输入下,跨视角的标签一致性也很难保证,导致 4D 分割不连贯。
在静态多视角场景中,一种常见的规避思路是定义一个 3D 特征场,用对比损失从多视角分割图学习:对任意一对 3D 点,根据它们在 2D 分割图中是否属于同一 mask,强制其特征向量靠近或远离。由于点特征与具体实例标签解耦,就无需跨视角标签一致。但这一策略难以直接推广到 4D:对任意两个不同时刻的 3D 点,很难判定它们是否属于同一实例。已有工作(如 SADG)尝试用可变形高斯建立时序对应关系,但可变形高斯在大运动动态场景上重建质量不佳。
方法
给定带分割图的多视角视频(分割图由 SAM 得到),目标是学习一个可分解的 4D 表示以支持随时间的精确分割。整体框架包含时空自由的高斯表示、流式采样、对比特征学习、两项正则化,以及推理阶段的过滤策略。
flowchart LR
A[多视角视频 + 逐帧 2D 分割图 SAM] --> B[Freetime FeatureGS\n带特征与线性速度的高斯]
B --> C[流式采样\n时序有序取帧]
C --> D[对比聚类损失\n逐帧不一致标签也可用]
D --> E[正则化\n3D 跟踪对齐 + DINOv2 语义]
E --> F[HDBSCAN 聚类 + 动态感知过滤]
F --> G[时空一致的 4D 实例分割与编辑]
Freetime FeatureGS:时空自由的特征高斯
受 FreeTimeGS 启发,每个高斯基元可以出现在 4D 空间的任意时间与位置,并通过线性运动被复用。每个基元由 4D 均值 \(\boldsymbol{\mu}\in\mathbb{R}^4\)、4D 尺度 \(\boldsymbol{s}\in\mathbb{R}^4\)、不透明度 \(\alpha\)、左右四元数 \(q_l,q_r\)、球谐系数与一个速度向量 \(\boldsymbol{v}\in\mathbb{R}^3\) 定义。给定初始时刻 \(\mu_t\),任意时刻 \(t\) 的空间位置为:
\[ \boldsymbol{\mu}_x(t) = \boldsymbol{\mu}_x + \boldsymbol{v}\cdot(t-\mu_t) \]
即每个高斯在 3D 空间随时间做线性运动。为实现实例感知分割,每个高斯再额外挂一个可学习特征向量 \(\boldsymbol{f}\in\mathbb{R}^d\),通过可微光栅化渲染成 2D 特征图:
\[ F_s = \sum_{i\in N} \boldsymbol{f}_i \alpha_i T_i, \quad T_i = \prod_{j=1}^{i-1}(1-\alpha_j) \]
流式采样策略
线性运动与复用使得基元随时间被逐渐替换,从而在特征场中形成很强的局部时间连续性:相邻帧通常共享大量重叠基元,但相隔较远的帧可能已完全替换掉表示同一物体的基元。如果随机采样时间步训练,同一实例在时间跨度大的帧上特征容易收敛到不同点,导致 4D 分割不一致。
为此,作者构造时序有序的训练样本序列 \(S=\{(F_{v,t}, M_{v,t})\}_{v=1,t=1}^{V,T}\),训练时以流式方式从中采样计算对比损失,让特征沿运动轨迹平滑传播,同时帮助避免优化陷入局部极小。
Freetime 特征学习
对分割图中的每个实例,取 mask 内 \(N_s\) 个均匀采样点特征的均值作为特征中心 \(\bar{\boldsymbol{f}}_i\),用对比聚类损失优化实例级特征:
\[ L_{CC} = -\frac{1}{N_{inst}N_s}\sum_{i=1}^{N_{inst}}\sum_{j=1}^{N_s} \log \frac{\exp(\boldsymbol{f}_i^j\cdot\bar{\boldsymbol{f}}_i/\phi_i)}{\sum_{k=1}^{N_{inst}}\exp(\boldsymbol{f}_i^j\cdot\bar{\boldsymbol{f}}_k/\phi_k)} \]
其中 \(\phi_i\) 是随类内特征方差自适应的温度参数。关键在于:同一时刻的对比损失约束同帧内点特征按 mask 归属靠近/远离;而由于高斯基元能随时间移动,对比损失自然会与邻近时刻的特征发生作用,从而把对比学习扩展到时间维,使同实例点特征随时间保持接近,实现 4D 分割。因此只需逐图分割输入、不要求时序一致标签。
两项正则化
- 3D 跟踪正则:用时间不透明度 \(\alpha(t)=\exp\left(-\frac{1}{2}\left(\frac{t-\mu_t}{s}\right)^2\right)\) 识别在下一帧即将消失的高斯,用 k 近邻找到其在 \(t+1\) 帧的时空匹配,再用对齐损失 \(L_{align}=\sum\lVert \boldsymbol{f}_{gt}-\boldsymbol{f}_{gt'}\rVert\) 强制匹配对特征一致,维持时间连贯性(对非线性大运动尤其重要)。
- DINOv2 语义对齐:把 DINOv2 特征经固定线性投影后,作为”语义字典”用类似的对比损失引导特征空间形成有意义结构。因为学到的特征最终需偏离 DINOv2 的通用表示,该正则仅在训练早期施加。
训练与推理
训练时固定预训练好的 4D 重建模型,只优化实例特征,总目标为:
\[ L_{total} = L_{CC} + \lambda_1 L_{align} + \lambda_2 L_{DINO} \]
推理阶段用动态感知过滤:先从首帧随机采样 2–10% 的高斯,用 HDBSCAN 聚类并以簇平均特征表示实例;再结合速度、空间与特征相似度的过滤函数
\[ \text{Filter}(g_i)=\mathbb{I}\left((\Delta v_i>3\sigma_v)\wedge(\Delta p_i>3\sigma_p)\wedge(s(\boldsymbol{f}_i,\bar{\boldsymbol{f}}_i)<\tau_{sim})\right) \]
作为辅助信号剔除噪声基元,提升复杂运动场景下的分割质量。
实验结果
在 Neural3DV、Multi-Human、SelfCap 三个具挑战性的动态场景数据集上评测(由于原数据集无分割真值,使用 SAM2 / Grounded-SAM-2 生成测试视角上的一致 mask,每场景挑选 5–20 个含动/静态的标注实例)。用 mIoU、mAcc、Recall、F1,以及只在动态实例上计算的 Recalldyn 作为指标。基线为 OmniSeg3D、DGD、SA4D、SADG。方法在单张 RTX 4090 上每场景约 1 万次迭代、约 30 分钟。
主要定量对比(mIoU / mAcc):
| 数据集 | Ours | SA4D | SADG | DGD | OmniSeg3D |
|---|---|---|---|---|---|
| Neural3DV | 0.801 / 0.998 | 0.668 / 0.987 | 0.649 / 0.985 | 0.460 / 0.982 | 0.700 / 0.996 |
| Multi-Human | 0.893 / 0.997 | 0.592 / 0.928 | 0.696 / 0.932 | 0.379 / 0.889 | 0.533 / 0.903 |
| SelfCap | 0.882 / 0.995 | 0.688 / 0.987 | 0.723 / 0.987 | 0.499 / 0.977 | 0.777 / 0.988 |
方法在三数据集上 mIoU 与 mAcc 均领先,F1 也全面最优。在多人交互、球类传递等复杂运动场景优势尤为明显:DGD 因蒸馏 DINOv2 语义倾向把不同人合并成同一类;SA4D 在动态区域召回高主要是因为边界不清、前景过大而虚高。作者还发现方法能学到比 SAM 监督标签更精确的边界(如手-球接触处)。
消融显示运动建模与流式学习都至关重要:去掉显式运动建模(换成 4DGS 运动表示)会因运动与几何耦合产生模糊速度方向而显著掉点;去掉流式采样会破坏时序一致性。3D 跟踪正则与 DINOv2 对齐进一步提升稳健性。此外,相比联合优化(同时优化重建与特征),本文固定重建、单独学特征能避免多目标带来的重建质量退化,且 PCA 可视化显示学到的特征在帧间更时序一致、结构更清晰。
亮点与局限
亮点:
- 提出无需视频分割/跟踪的 4D 分解重建框架,绕开了对长期一致 2D 标签的强依赖,特征与实例标签解耦。
- Freetime FeatureGS 的线性运动天然把逐帧对比学习扩展到时间维,用逐图分割即可得到 4D 一致实例特征。
- 流式采样有效缓解大时间跨度下同实例特征发散的局部极小问题;在多人交互、快速运动等复杂场景大幅领先现有方法。
局限:
- 依赖预训练的高质量 4D 重建作为固定骨干,特征学习与重建分阶段进行。
- 对非线性大运动仍需 3D 跟踪正则辅助维持时间连贯,DINOv2 语义先验在多人场景可能误合并个体,需要调低其权重。
延伸思考
将”运动可复用的自由高斯 + 时序流式对比学习”结合,为动态场景的实例级理解提供了一个不依赖脆弱视频跟踪的新范式。其把时间维一致性交给基元运动本身、而非标签传播的思路,值得推广到更长序列、开放词表分割乃至可编辑的动态内容生成;如何端到端联合优化重建与特征而不损失重建质量,以及如何减轻对预训练语义先验的依赖,都是有价值的后续方向。